DeepSeek lokal betreiben: Der ultimative Guide zu Installation, Hardware, Modellen & Datensouveränität

DeepSeek lokal betreiben heißt KI ohne Cloud nutzen mit passender Hardware, Modellen, RAG und voller Datensouveränität.

Illustration: DeepSeek lokal betreiben – KI-Modell auf eigener Hardware statt in der Cloud

DeepSeek lokal zu betreiben heißt: Du nutzt ein leistungsfähiges KI-Modell auf eigener Hardware – statt über Cloud-Server. Das ist für Unternehmen und Tech-Teams besonders interessant, wenn sensible Daten (IP, Kundendaten, interne Dokumente) verarbeitet werden sollen oder wenn du unabhängig von Anbieter-Limits arbeiten willst.

Dieser Guide führt dich von „läuft in 5 Minuten“ bis zu Team-Hosting, Governance und RAG (eigene PDFs & Datenquellen). Stand: Juli 2026 – inklusive DeepSeek R1, V3.1/V3.2 und der neuen V4-Serie.

Auf einen Blick

Lokal heißt souverän.
Prompts, Dokumente und Ergebnisse bleiben auf eigener Hardware – nichts wird an externe KI-Anbieter übertragen.

Quickstart in 5 Minuten.
Mit Ollama läuft ein R1-Distill-Modell (z. B. deepseek-r1:8b) auf einem normalen Arbeitsrechner – ganz ohne GPU-Cluster.

Die Hardware bestimmt die Modellklasse.
16–32 GB RAM reichen für 7B/8B-Modelle, ab 24 GB VRAM wird 32B produktiv – 671B-Modelle bleiben Server-Territorium.

V4 ist da – aber (noch) nicht lokal.
Die neue V4-Serie ist über Ollama derzeit nur als Cloud-Modell nutzbar. Für echten Lokalbetrieb sind R1-Distills und V3.x die praktikable Wahl.

Der echte Hebel: API + RAG.
Als interner Service mit eigenen Datenquellen wird aus dem Chat-Experiment eine wiederverwendbare Komponente fürs ganze Unternehmen.

Warum DeepSeek lokal? Der Business-Case in 4 Punkten

1) Datensouveränität & Compliance
Prompts, Dokumente und Ergebnisse müssen nicht an externe KI-Anbieter übertragen werden. Das reduziert Risiken bei vertraulichen Inhalten und kann die Compliance einfacher machen.

2) Kostenmodell: CapEx statt Abo
Statt monatlicher Seat-Kosten investierst du einmal in Hardware (oder nutzt vorhandene Workstations/Server). Laufende Kosten sind primär Strom und Betrieb.

3) Verfügbarkeit & Offline-Fähigkeit
Nach dem initialen Model-Download ist Nutzung auch ohne Internet möglich (z. B. in abgeschotteten Netzen oder on-site).

4) Kontrolle über Betrieb & Policies
Du bestimmst Modellversion, Update-Zyklen, Logging, Zugriff, Netzwerkgrenzen.

Wann Cloud trotzdem gewinnt:
Wenn du maximale Geschwindigkeit/Skalierung, Multi-Modalität „out of the box“ oder minimalen Betriebsaufwand brauchst. Wo generative KI im Unternehmen generell ansetzt, zeigt unser Überblick KI für Unternehmen.

Quickstart in 5 Minuten: DeepSeek lokal installieren mit Ollama

Wenn du ohne Umwege starten willst, ist Ollama der pragmatische Standard: schnell installiert, läuft lokal, bietet CLI + lokale API.

Schritt 1: Ollama installieren

Windows und macOS: Installer von ollama.com/download. Unter Linux genügt eine Zeile im Terminal:

curl -fsSL https://ollama.com/install.sh | sh

Schritt 2: Modell ziehen und starten

Starte klein, damit du sofort Ergebnisse bekommst – der Download startet automatisch beim ersten Aufruf:

# Einstieg: ca. 5 GB, läuft auf den meisten Arbeitsrechnern
ollama run deepseek-r1:8b

# Spürbar besser: ab ca. 12–16 GB RAM/VRAM
ollama run deepseek-r1:14b

# Bester Kompromiss auf starker Consumer-Hardware: ab 24 GB VRAM
ollama run deepseek-r1:32b
  • 7B/8B: Tests, einfache Assistenten, schnelle Antworten
  • 14B: deutlich besser, oft noch leichtgewichtig genug
  • 32B (Distill): häufig der beste Kompromiss für Coding/Reasoning auf starker Consumer-Hardware

Schritt 3: Geschwindigkeit messen statt schätzen

Mit --verbose zeigt Ollama nach jeder Antwort die erreichten Token/s – die wichtigste Kennzahl dafür, ob sich dein Setup produktiv anfühlt:

ollama run deepseek-r1:8b --verbose

Teste anschließend je eine Aufgabe aus deinem Alltag:

  • Coding (z. B. Bugfix + Erklärung)
  • Reasoning (mehrschrittige Logik)
  • Unternehmenskontext (Ton/Terminologie)

Schritt 4: Lokale API testen

Ollama stellt automatisch eine lokale API unter Port 11434 bereit – die Grundlage für alle späteren Integrationen:

curl http://localhost:11434/api/generate -d '{
  "model": "deepseek-r1:8b",
  "prompt": "Erkläre RAG in zwei Sätzen."
}'

Schritt 5: Optional GUI anschließen

  • Open WebUI (Browser-UI, ideal für Teams)
  • Chatbox (Desktop-Client ohne Docker)
  • LM Studio (GUI-first, einsteigerfreundlich)

Ohne GPU? Kein Blocker: Die kleinen Distill-Varianten (1.5b, 7b, 8b) laufen auch CPU-only – spürbar langsamer, aber zum Testen und für leichte Aufgaben völlig okay. Auf Macs mit Apple Silicon zählt der gemeinsame Arbeitsspeicher (Unified Memory): 16 GB+ sind ein guter Start.

Welche Installations-Route passt zu dir? (Decision Box)

ZielToolAufwandIdeal für
Schnell per GUI startenLM StudioniedrigEinsteiger, Einzelplatz
CLI + API für IntegrationenOllamaniedrig–mittelDev/Automation
ChatGPT-ähnliche Team-UIOpen WebUI (Docker)mittelTeam-Chat, Browser
GUI ohne DockerChatboxniedrigLaptop-Workflows
Experiment/All-in-onePinokiomittelDemos, Bastler

Empfehlung für Unternehmen:
Oft ist „Ollama als Basis + Open WebUI fürs Team“ die beste Kombi: stabil, erweiterbar, gut administrierbar.

DeepSeek-Modelle verstehen: R1, V3.x und V4 – und Distill vs Full

Die Modellfamilien im Überblick (Stand: Juli 2026)

  • DeepSeek-V3 / V3.1 / V3.2: Generalisten (Text, Zusammenfassungen, Standard-Tasks). V3.1 ergänzt einen zuschaltbaren Reasoning-Modus, V3.2 macht lange Kontexte durch Sparse Attention deutlich effizienter.
  • DeepSeek-R1: Reasoning-orientiert (stärker bei Logik/Mathe/komplexem Coding, oft langsamer). Als Distill-Varianten von 1.5B bis 70B die praktischste Wahl für den lokalen Betrieb.
  • DeepSeek-V4-Serie (neu): V4-Flash (284B Parameter, 13B aktiv, 1-Million-Token-Kontextfenster) und V4-Pro (1,6 Billionen Parameter, 49B aktiv, drei Reasoning-Modi). Wichtig für diesen Guide: Über Ollama sind beide derzeit nur als Cloud-Modelle („:cloud“-Tag) nutzbar – sie laufen also nicht auf deiner eigenen Hardware. Für echten Lokalbetrieb bleiben R1 und V3.x die relevante Wahl.

Die offenen Modellgewichte findest du bei Hugging Face (deepseek-ai), die lokal lauffähigen Varianten in der Ollama-Bibliothek. Wer Alternativen vergleichen möchte: In unserem Guide zeigen wir, wie Gemma 4 lokal auf dem MacBook läuft.

Distill vs Full: die wichtigste Realitätsprüfung

Viele Anleitungen zu „DeepSeek R1 lokal“ verwenden in der Praxis destillierte Modelle – also kleinere Modellvarianten, die so trainiert wurden, dass sie das Verhalten eines großen Reasoning-Modells nachahmen. Der Grund ist simpel: Die größten R1-Varianten sind für typische Workstations oder Gaming-PCs oft zu speicherhungrig, um sie in voller Qualität lokal zu betreiben. Destillierte Modelle schließen genau diese Lücke: Sie liefern einen großen Teil der „R1-Reasoning“-Stärke, benötigen aber deutlich weniger RAM/VRAM und sind damit für die meisten lokalen Setups überhaupt erst realistisch.

Technisch läuft das über Knowledge Distillation: Ein sehr leistungsfähiges „Teacher“-Modell erzeugt viele hochwertige Beispiele (z. B. komplexe Antworten, Lösungswege, Code-Analysen). Ein kleineres „Student“-Modell wird anschließend darauf trainiert, dieses Antwortverhalten möglichst gut zu reproduzieren. Deshalb sind viele R1-Distill-Varianten in lokalen Tools als Qwen- oder Llama-basierte Modelle zu finden: Diese Architekturen sind stark verbreitet, gut optimiert und lassen sich effizient quantisieren und auf Consumer-Hardware ausführen.

Wichtig ist dabei das richtige Erwartungsmanagement: Destilliert bedeutet nicht automatisch schlechter, aber es ist auch nicht „identisch zum Flagship“. Für viele Alltagsfälle (Coding, Textarbeit, Analyse, interne Q&A) sind R1-Distill-Modelle oft der beste Sweet Spot aus Qualität, Geschwindigkeit und Hardwarekosten. Bei sehr anspruchsvollen Reasoning-Aufgaben, extrem langen Kontexten oder Spezialfällen können größere Modelle jedoch stabilere Ergebnisse liefern. Entscheidend ist daher, im Setup klar zu prüfen, ob du gerade R1 Distill oder ein Full-Scale Modell betreibst – denn davon hängen Hardwarebedarf, Geschwindigkeit und erreichbare Qualität direkt ab.

Merksatz:
Wenn du „Cloud-Flagship-Qualität“ erwartest, musst du genau prüfen, ob du Distill oder Full betreibst – und ob deine Hardware dafür realistisch ausreicht.

ModellCharakterGrößeLokal betreibbar?Typischer Einsatz
R1-Distill (1.5B–70B)Reasoning, kompaktca. 1–43 GB (Q4)Ja – Consumer-/Workstation-HardwareCoding, Analysen, interne Q&A
R1 (Full, 671B MoE)Reasoning-Flagshipmehrere hundert GBNur Server/Multi-GPUSpezialfälle, Forschung
V3.1 / V3.2 (671B MoE)Generalist + Reasoning-Modusmehrere hundert GBNur Server/Multi-GPUZentrale Team-Services
V4-Flash (284B, 13B aktiv)Effizienz + 1M-Token-KontextNein – via Ollama nur CloudSehr lange Dokumente
V4-Pro (1,6T, 49B aktiv)Frontier, 3 Reasoning-ModiNein – via Ollama nur CloudMaximale Qualität (Cloud)

Was ist Inferenz? (und warum ist das der Flaschenhals beim lokalen Betrieb)

Viele Guides reden sofort über RAM/VRAM – ohne den Kernbegriff zu erklären.

Inferenz bedeutet bei KI-Modellen: Das Modell berechnet eine Antwort auf deinen Prompt – Token für Token.

Wichtig ist die Abgrenzung:

  • Training: Das Modell wird „angelernt“ (sehr teuer, Wochen/Monate, GPU-Cluster).
  • Inferenz: Das Modell wird „genutzt“ (genau das passiert bei dir lokal).

Warum ist Inferenz speicherhungrig?
Weil während der Berechnung zwei Dinge in schnellen Speicher müssen:

  1. Model Weights (die gelernten Parameter – riesige Datenmenge)
  2. Kontextspeicher (je länger Prompt/Chat/RAG-Kontext, desto mehr zusätzlicher Speicher)

Wenn das nicht in RAM/VRAM passt, startet es nicht oder wird extrem langsam.

DeepSeek lokal Anforderungen: Sizing-Guide nach Szenario

Vergiss pauschale Aussagen wie „8 GB RAM reichen“. Beim lokalen Betrieb entscheidet nicht ein einzelner Wert, sondern eine simple Logik: Modellgröße × Quantisierung × Use Case = Hardwarebedarf und Nutzererlebnis. Ein 7B-Modell kann auf einem Notebook sinnvoll laufen – ein 32B-Modell fühlt sich erst dann „produktiver“ an, wenn genügend RAM/VRAM für Modellgewichte und Kontext vorhanden ist. Und bei Team-Betrieb (oder RAG mit Dokumenten) zählt nicht nur „es startet“, sondern ob es stabil bleibt, wenn mehrere Anfragen kommen oder der Kontext länger wird.

Die KPIs, die in der Praxis wirklich zählen

  • Token/s (gefühlte Geschwindigkeit): Je mehr Token pro Sekunde, desto flüssiger schreibt das Modell. Setups, die „laufen“, aber nur 1–3 Token/s liefern, werden im Alltag schnell zäh – vor allem im Team.
  • Kontextfenster: Das ist das „Arbeitsgedächtnis“ des Modells: Prompt + Chatverlauf + (bei RAG) Dokumentauszüge. Je mehr Kontext du hineingibst, desto höher werden Speicherbedarf und Latenz.
  • Stabilität: Der wichtigste KPI im Betrieb. Ein Modell, das „auf Kante genäht“ gerade so in RAM/VRAM passt, führt häufig zu Hängern, Out-of-Memory-Fehlern oder Neustarts – besonders unter Last.
  • Ladezeit: Große Modelle müssen erst in RAM/VRAM geladen werden, bevor die erste Antwort kommt. Das spielt im Team-Hosting eine größere Rolle als im Einzelplatzbetrieb.
  • Storage: Plane nicht nur Platz fürs Modell ein, sondern auch für Caches und – falls du RAG nutzt – für Embeddings und Vektorindizes, die mit der Menge an Dokumenten wachsen.

Faustregel fürs Sizing

Wenn du Geschwindigkeit und Stabilität willst, starte mit einer Modellklasse, die mit Reserve in deinen Speicher passt. Quantisierung ist dabei der Hebel: Q8 liefert meist die bessere Qualität, braucht aber deutlich mehr Speicher; Q4 macht größere Modelle auf Consumer-Hardware oft überhaupt erst möglich, kann bei anspruchsvollem Reasoning aber früher Qualitätsgrenzen zeigen. Das Ziel ist nicht „maximal groß“, sondern maximal produktiv für deinen konkreten Use Case. Welche GPU-Klassen sich für welche KI-Workloads eignen, zeigt unser Überblick zu NVIDIA-GPUs und KI-Infrastruktur.

Infografik: Welches DeepSeek-Modell passt zu welcher Hardware? Vier Stufen vom Notebook (deepseek-r1:8b) bis zum Server mit 671B-Modellen, Stand Juli 2026
SzenarioModellklasse (typisch)RAM/VRAM (Daumenregel)ErwartungUse Cases
Notebook/Client7B/8B (Q4)16–32 GB RAM„gut zum Testen“Drafts, einfache Q&A
Starker PC14B–32B (Distill, Q4)32–64 GB RAM / 12–24+ GB VRAM„produktiv“Coding, Analysen
Workstation/Server70B+ (Q4/Q8)stark setup-abhängig„stark, Ops-lastig“Team-Service, komplexe Aufgaben
Flagship-Ambition671B MoE (R1/V3.x)extrem ressourcenintensiv„Spezial-HW“Forschung/Edge Cases

Quantisierung & Formate: FP8, Q8, Q4 – was heißt das konkret?

Quantisierung ist „Zahlen komprimieren“. Model Weights sind riesige Tabellen mit Zahlen. Je weniger Bits pro Zahl, desto kleiner der Speicherbedarf.

FP8

  • 8-bit Floating Point (Gleitkomma)
  • oft nahe am Originalformat und GPU-optimiert
  • nicht überall (v. a. auf CPU) reibungslos nutzbar

Q8

  • 8-bit quantisiert (meist integer-ähnlich)
  • qualitativ näher am Original, aber groß
  • sinnvoll, wenn du genug RAM/VRAM hast und Qualität Priorität hat

Q4

  • 4-bit quantisiert
  • massiv kleiner, oft der Unterschied zwischen „läuft“ und „läuft nicht“
  • Trade-off: bei anspruchsvollem Reasoning eher Qualitätsabfall möglich

Faustregel:
Wenn Q8 nicht in deinen Speicher passt, ist Q4 oft der pragmatische Weg, um überhaupt lokal Inferenz zu machen.

DeepSeek lokal betreiben (Ops): stabil, wiederholbar, updatefähig

Wenn DeepSeek mehr sein soll als ein Laptop-Experiment, brauchst du Betriebsgrundlagen:

  • Modell-Management (Versionen, Freigaben, Storage)
  • Ressourcensteuerung (Parallelität, Limits, Priorisierung)
  • Restart/Watchdog (bei Hängern automatisch neu starten)
  • Monitoring light (CPU/RAM/VRAM, Latenz, Disk)
  • Update-Policy (Test → Rollout → Rollback)

Typische Stolpersteine

  • UI hängt → Service/Container neu starten, Logs prüfen
  • „Plötzlich langsam“ → Kontextfenster zu groß, Sessions resetten
  • Out-of-memory → kleinere Variante oder stärkere Quantisierung

Tipp: Leistung messen statt schätzen. Ein kurzer Lauf mit ollama run <modell> --verbose zeigt die real erreichten Token/s auf deiner Zielhardware. Zwei, drei gemessene Werte in einer internen Tabelle ersetzen jede Schätzung – und machen Upgrade-Entscheidungen belegbar.

DeepSeek lokal als API nutzen (Integrationen statt nur Chat)

Wenn DeepSeek lokal nur als Chatfenster genutzt wird, bleibt der Effekt oft punktuell: Eine Person arbeitet schneller, aber Prozesse ändern sich kaum. Der echte Hebel entsteht, wenn das Modell als interner Service betrieben wird – also zentral auf einer Workstation oder VM läuft und über eine API von verschiedenen Tools genutzt werden kann.

So wird aus „KI zum Chatten“ eine wiederverwendbare Komponente für mehrere Use Cases: z. B. Ticket-Zusammenfassungen im Support, Text- und Code-Assists in der Entwicklung oder Content-Workflows im Marketing. Gleichzeitig lässt sich Governance zentral steuern: Modellversionen, Zugriff, Logging und (falls nötig) RAG-Datenquellen werden nicht pro Nutzer, sondern einmal für alle definiert.

Beispiele

  • Intranet-Assistent (Prozesse, Richtlinien, Handbücher)
  • Support-Triage (Ticket-Zusammenfassung, Vorschläge)
  • Dev-Assistent im internen Netz (Code bleibt intern)
  • Content-Workflows (Briefings, Varianten, Konsistenzchecks)

Grundidee: Tool/App → lokaler Endpoint → Modell → Antwort. Wie sich solche Endpoints in Automatisierungen einbinden lassen, zeigt unser Artikel zu Workflow-Automation mit n8n.

DeepSeek lokal hosten (Self-hosting für Teams)

Sobald mehr als eine Person DeepSeek nutzt, solltest du das Setup nicht mehr wie ein Einzelplatz-Experiment behandeln. Damit ein lokaler KI-Dienst im Team zuverlässig funktioniert, braucht es eine minimale Form von „Produktionshygiene“: Zugriffsschutz, klare Rollen, kontrollierte Updates und eine Logging-Policy.

Konkret heißt das: Das Web-Frontend (z. B. Open WebUI) sollte nicht ohne Login im Netzwerk stehen. Admin-Rechte (Modell nachladen, Systemeinstellungen, Logs) gehören in klar definierte Rollen. Außerdem muss entschieden werden, ob Prompts und Chatverläufe gespeichert werden dürfen – und falls ja, wie lange und wer Zugriff hat. Diese Basics sind der Unterschied zwischen „lokal = sicher“ und „lokal = unkontrolliert“.

  • Reverse Proxy + TLS
  • Auth (mind. Basic, besser SSO)
  • LAN/VPN Zugriff, keine offenen Admin-UIs
  • Rollen: wer lädt Modelle nach, wer sieht Logs?
  • Kapazität: gleichzeitige Nutzer, interne Rate Limits

RAG mit DeepSeek lokal: PDFs & Datenquellen – ohne Datenabfluss

RAG (Retrieval-Augmented Generation) erweitert ein KI-Modell um eure eigenen Daten. Anstatt nur aus dem Trainingswissen zu antworten, holt das System vor einer Antwort passende Textstellen aus internen Quellen – zum Beispiel aus PDFs, Wikis oder Handbüchern – und gibt sie dem Modell als Kontext mit. Dadurch werden Antworten deutlich präziser, nachvollziehbarer und im Idealfall quellengestützt.

Technisch läuft RAG meist so ab: Dokumente werden eingelesen, in Abschnitte zerlegt, als Embeddings in einer Vektor-Datenbank gespeichert und bei einer Frage werden die relevantesten Passagen abgerufen. Das Modell formuliert dann die Antwort auf Basis dieser Passagen. Für die Datensouveränität ist entscheidend, dass nicht nur das Modell lokal läuft, sondern auch die Dokumente, Embeddings, Indizes und Logs sauber geregelt sind.

Infografik: RAG mit DeepSeek lokal – Dokumente werden als Chunks und Embeddings in einer Vektor-Datenbank indexiert; bei jeder Frage holt das Retrieval passende Textstellen und DeepSeek generiert die Antwort mit Quellenbezug, alles innerhalb des Unternehmensnetzes ohne Datenabfluss

RAG in 60 Sekunden

  1. Dokumente in Text zerlegen (Chunks)
  2. Embeddings erzeugen
  3. Embeddings/Index speichern (Vector DB)
  4. Bei Fragen passende Textstellen holen (Retrieval)
  5. Modell antwortet auf Basis dieser Fundstellen

Datensouveränität in der Praxis

  • Wo liegen PDFs?
  • Wo liegen Embeddings/Index?
  • Was wird geloggt?
  • Wie werden Backups/Snapshots behandelt?

Wenn du das sauber regelst, wird „lokal“ wirklich zu „souverän“.

DeepSeek vs ChatGPT: Wann ist lokal überlegen?

Lokal ist stark bei

  • sensiblen Daten / IP
  • Compliance / abgeschotteten Netzen
  • planbarer Kostenstruktur bei hoher Nutzung

Cloud ist stark bei

  • maximaler UX/Latency
  • Skalierung ohne internes Ops-Team
  • Feature-Reife/Ökosystem

Häufige Fragen zu DeepSeek lokal

Weiterführende Artikel

KI & Automation
21 Juli 2026 15 Min. Lesezeit

KI-KoKI-Kompetenz | Pflicht & Umsetzung nach Art. 4 EU AI

KI-Kompetenz (AI Literacy) ► Seit 2.2.2025 Pflicht ✓ Durchsetzung ab August 2026 ✓ 4-Schritte-Fahrplan ✓ Nachweis & Dokumentation ✓ Jetzt umsetzen

Florian Ahlers Jetzt lesen
KI & Automation
17 Juni 2026 14 Min. Lesezeit

RAG | Retrieval-Augmented Generation im Unternehmen

Was ist RAG und wie funktioniert es? So nutzen Unternehmen Retrieval-Augmented Generation für bessere KI-Antworten und produktive RAG-Chatbots.

Nils Hufnagel Jetzt lesen
KI & Automation
09 Juni 2026 13 Min. Lesezeit

KI im Kundenservice | Proof of Concept als Einstieg

Wie lässt sich KI im Kundenservice sinnvoll testen? Der Artikel zeigt, warum ein Proof of Concept ein guter Einstieg sein kann, welche Vorteile er bietet und wie die Umsetzung abläuft.

Tillmann Strübig Jetzt lesen
KI & Automation
09 Juni 2026 12 Min. Lesezeit

KI für Unternehmen | Vorteile, Einsatz & Einführung

Was bringt KI für Unternehmen und wie gelingt der Einstieg? Vorteile, Anwendungsfälle und Tipps zur erfolgreichen Einführung von künstlicher Intelligenz.

Tillmann Strübig Jetzt lesen
KI & Automation
09 Juni 2026 9 Min. Lesezeit

NVIDIA KI | GPUs, Inferenz & Infrastruktur für Unternehmen

Warum ist NVIDIA für KI im Unternehmen so relevant? Der Beitrag zeigt, wie GPUs, Inferenz, Software und Infrastruktur produktive KI-Anwendungen ermöglichen.

Tillmann Strübig Jetzt lesen
KI & Automation
09 Juni 2026 12 Min. Lesezeit

KI und Datenschutz | DSGVO-konform im Unternehmen nutzen

Wie lässt sich KI datenschutzkonform einsetzen? Der Artikel zeigt, was Unternehmen bei DSGVO, personenbezogenen Daten, Datenverarbeitung und KI-Tools beachten müssen.

Tillmann Strübig Jetzt lesen
KI & Automation
20 Mai 2026 20 Min. Lesezeit

NPU | Neural Processing Unit: Nutzen, Vergleich & Kauf

Was eine Neural Processing Unit wirklich kann, ob du sie überhaupt brauchst und wie du prüfst, ob dein Gerät schon eine besitzt.

Hendrik Schrandt Jetzt lesen
KI & Automation
19 Mai 2026 11 Min. Lesezeit

Gemma 4 | Lokal installieren auf MacBook mit LM Studio

Mit Gemma 4 schickt Google DeepMind die vierte Generation seiner offenen Modellfamilie ins Rennen — und zwar nicht in die Cloud, sondern auf deinen eigenen Rechner.

Hendrik Schrandt Jetzt lesen
KI & Automation
15 Mai 2026 16 Min. Lesezeit

Workflow Automation mit n8n: Self-Hosted, Docker & AI Agents

Wie n8n, Docker, Self-Hosting und AI-Workflows moderne Workflow Management Systeme praktisch erweitern.

Nils Hufnagel Jetzt lesen
KI & Automation
08 Apr. 2026 14 Min. Lesezeit

Cloud AI – Definition, Funktionsweise & Unternehmenseinsatz

Was ist Cloud AI? Wie KI in der Cloud funktioniert, welche Anbieter und Anwendungsfälle es gibt – kompakter Überblick für IT-Entscheider im DACH-Mittelstand.

Hendrik Schrandt Jetzt lesen

Kommentare (0)

Noch keine Kommentare vorhanden.

Back to top