Zum Inhalt springen
LLMlokal
☰

Praxis-Guide · Deutsch · Lokale Verarbeitung

Wie kann man ein LLM lokal erstellen?

Eine vollständige, deutsche Anleitung zum Betrieb von Sprachmodellen auf eigener Hardware. Mit konkreten Tool-Empfehlungen, Hardware-Tipps und einer ehrlichen Cloud-vs-Lokal-Abwägung.

28 Guides Installation & Einsatz Aktualisiert 30.09.2026

Warum braucht ihr lokale KI?

Sensible Daten, eigene Entwicklung, technisches Wissen oder hohe Nutzungskosten: Der Anlass entscheidet, was wir zuerst testen. Für den Einsatz im Team zählen der vollständige Datenweg und ein prüfbares Ergebnis.

12 konkrete Anwendungsfälle für Branchen und Fachbereiche ansehen →

Kanzleien, Steuerberatung, Personalabteilungen, Softwareteams, Engineering, Forschung und weitere Nischen. Oder zuerst GPT, ChatGPT und lokale Modelle vergleichen.

Direkte Antwort

Ein lokales LLM führt seine Modellberechnung auf deiner eigenen Hardware aus. Wenn auch die übrigen Komponenten lokal eingerichtet sind, kann der Arbeitsablauf ohne externe Modell-API laufen. Du installierst dafür ein Inferenz-Tool wie Ollama oder LM Studio, lädst ein Modell wie Llama 3.3 oder Qwen3 8B, und kannst sofort offline mit dem Modell sprechen.

Das ist die kürzeste richtige Antwort. Wenn du die Details brauchst - welche Hardware, welches Modell, wie installieren, wann sich der Aufwand lohnt - arbeite den Rest dieses Pillars durch oder spring direkt in die thematische Sub-Page.

Quickstart in 5 Schritten

  1. Hardware prüfen. Mindestens 16 GB RAM, idealerweise 32 GB. GPU ab 8 GB VRAM beschleunigt deutlich, ist aber kein Zwang. Detail: Hardware-Guide.
  2. Tool wählen. Ollama für Kommandozeile, LM Studio für grafische Oberfläche. Beide kostenlos, beide auf Mac/Windows/Linux.
  3. Modell laden. Llama 3.2 (3B) für Einsteiger, Qwen3 8B als ausgewogener Allrounder, Llama 3.3 (70B Q4) für Profis.
  4. Erste Inferenz starten. Eine Frage stellen, Tokens-pro-Sekunde beobachten, Kontextlänge prüfen.
  5. Optimieren. Quantisierungsstufe wählen, GPU-Layer aktivieren, Kontextfenster anpassen.

Welches Tool passt zu dir?

Drei Programme decken praktisch alles ab, was Einzelnutzer und kleine Teams brauchen. Sie schließen sich nicht aus — die meisten landen nach ein paar Wochen bei einer Kombination.

 OllamaLM Studiollama.cpp
BedienungKommandozeileGrafische OberflächeKommandozeile, low level
StärkeEin Befehl pro Modell, REST-API ab WerkModelle browsen und vergleichen, ohne TerminalVolle Kontrolle über jeden Parameter
SchwächeWenig Einblick in DetailparameterSchwerer zu automatisierenKein Komfort, du baust alles selbst
Passt fürEinbindung in eigene Programme und SkripteEinstieg und reine Desktop-NutzungWenn dir die anderen beiden zu viel abnehmen

Für die meisten ist Ollama der richtige Start: Installation und erstes Modell dauern zusammen etwa fünf Minuten, und die mitgelieferte REST-API macht das Modell sofort für eigene Skripte nutzbar. Wer lieber klickt als tippt, nimmt LM Studio — technisch läuft darunter dieselbe Inferenz-Bibliothek, die Ergebnisse sind also vergleichbar.

Welches Modell für welche Aufgabe?

Die Größen sind die typischen Q4-Varianten (Q4_K_M beziehungsweise Q4_0), also das, was die Tools standardmäßig herunterladen — die Werte stammen aus der Ollama-Library. Je nach Tool, Quantisierungsvariante und vor allem Kontextlänge kann der tatsächliche Bedarf deutlich darüber liegen, weil der KV-Cache mitwächst. Die RAM-Spalte ist der Punkt, ab dem das Modell im Alltag flüssig läuft, nicht das absolute Minimum; für den eigenen Fall rechnet der Hardware-Rechner das genauer aus.

ModellGrößeRAM abWofür
Llama 3.2 3B~2 GB8 GBZusammenfassungen, Klassifikation, alles wo Tempo zählt
Qwen3 8B~5 GB16 GBDer moderne Standard-Allrounder
Llama 3.1 8B~5 GB16 GBEtwas älter, dafür das breiteste Ökosystem an Werkzeugen
Qwen3 14B~9 GB32 GBAnspruchsvollere Aufgaben, längere Texte
Gemma 3 27B~17 GB32 GBStarke Qualität, versteht Bilder, 128K Kontext
Qwen3 30B-A3B~19 GB48 GBMixture-of-Experts: nur ~3B aktiv, dadurch flott
Qwen3 32B~20 GB48 GBCoding, Reasoning, lange Antworten
Llama 3.3 70B~43 GB64 GBHöchste Qualität, die lokal realistisch ist

Warum kein Mistral 7B mehr in dieser Liste? Es ist nicht schlecht geworden, nur alt: Der latest-Tag in der Ollama-Library zeigt weiterhin auf Version 0.3 und wurde zuletzt vor über einem Jahr angefasst. Für neue Setups sind Qwen3 8B oder Gemma 3 in derselben Größenklasse die bessere Wahl. Wer Mistral gezielt braucht, findet die Einordnung weiterhin unter Mistral lokal installieren.

Die Lizenzfrage entscheidet oft mit, und sie ist nicht bei allen dreien gleich. Qwen3 steht unter Apache 2.0 und ist damit uneingeschränkt kommerziell nutzbar. Die Llama-Modelle laufen unter der Llama-Community-Lizenz, die kommerzielle Nutzung erlaubt, solange du unter 700 Millionen monatlich aktiven Nutzern bleibst — für DACH-Unternehmen praktisch nie ein Thema. Gemma ist der Sonderfall: Die Gemma Terms of Use sind keine Open-Source-Lizenz im engeren Sinn, sondern enthalten eine Liste verbotener Verwendungen, die Google einseitig fortschreiben kann. Für die meisten Anwendungen unproblematisch, aber ein Punkt, den man vor dem Produktivbetrieb gelesen haben sollte. Details stehen bei Llama lokal installieren.

Eine Faustregel, die fast immer trägt: ein größeres Modell in Q4 schlägt ein kleineres in Q8. Wenn beide in deinen Speicher passen, nimm das mit mehr Parametern.

Eigene Dokumente mit einem lokalen LLM nutzen

Ein oft unterschätzter Anwendungsfall: Ein lokales LLM beantwortet nicht nur allgemeine Fragen, sondern auch Fragen zu deinen eigenen Dokumenten - Handbücher, Verträge, interne Wikis oder Recherchematerial. Technisch heißt das Retrieval-Augmented Generation (RAG): Das Modell bekommt vor der Antwort passende Textausschnitte aus deiner Dokumentensammlung mitgeliefert, statt nur aus seinem Trainingswissen zu schöpfen.

Für den Einstieg reichen zwei Werkzeuge. Ollama liefert das Sprachmodell, ein Tool wie AnythingLLM oder GPT4Alls LocalDocs übernimmt Einlesen, Chunking und Vektorsuche der Dokumente - alles läuft lokal, keine Datei verlässt deinen Rechner. Für Unternehmen mit sensiblen Daten (Mandantengeheimnis, Patientendaten, interne Geschäftszahlen) ist das der Punkt, an dem lokale LLMs ihren größten Vorteil gegenüber ChatGPT und anderen Cloud-Modellen ausspielen: Die Dokumente bleiben, wo sie sind.

Die ausführliche Anleitung mit Embedding-Modellen, Chunking-Strategien und Vektor-Store-Auswahl (Qdrant, Chroma) steht auf der Sub-Page RAG lokal. Wer die Einrichtung im Unternehmenskontext lieber begleitet haben möchte, findet das passende Format unter Beratung.

Vertiefen - die Sub-Pages

Jedes Thema bekommt seine eigene Seite mit Praxisbeispielen, Befehlen und FAQs. Lies sie in beliebiger Reihenfolge.

Modul 01 15 min

Ollama Tutorial - Lokale LLMs in 5 Minuten starten

Praxis-Quickstart für Ollama: Installation auf Mac, Windows, Linux. Modelle ziehen, Modelfiles schreiben, REST-API nutzen, GPU aktivieren.

Modul 02 14 min

Llama lokal installieren - Llama 3.2, 3.3 und Code-Llama auf eigener Hardware

Schritt-für-Schritt: Llama 3.2, Llama 3.3 70B und Code-Llama lokal mit Ollama oder llama.cpp betreiben. Hardware, Quantisierung, Performance, Lizenz.

Modul 03 14 min

Mistral lokal installieren - Mistral 7B, Mixtral 8x7B und Codestral auf eigener Hardware

Praxis-Anleitung: Mistral 7B Instruct, Mixtral 8x7B und Codestral lokal mit Ollama oder llama.cpp betreiben. Lizenz, Hardware, Quantisierung, Performance.

Modul 04 11 min

LM Studio - GUI für lokale LLMs auf Mac, Windows, Linux

LM Studio im Praxis-Test: Modell-Browser, Chat-Interface, OpenAI-kompatibler lokaler Server. Wann LM Studio besser passt als Ollama.

Modul 05 18 min

Hardware für lokale LLMs - Mac, Windows, Linux 2026 im Vergleich

Hardware für lokale LLMs: RAM und VRAM für Mac, NVIDIA und CPU vergleichen. Modellbedarf, parallele Nutzung und Budget vor dem Kauf prüfen.

Modul 06 15 min

RAG lokal - Retrieval-Augmented Generation auf eigener Hardware

Eigene Dokumente lokal mit LLM verbinden: Embeddings, Vektor-Stores, Chunking-Strategien. Praxis-Setup mit Ollama, nomic-embed-text und Qdrant lokal.

Modul 07 11 min

Lokale LLMs und DSGVO - der ehrliche Compliance-Check 2026

Warum lokale Sprachmodelle DSGVO-freundlicher sind als Cloud-APIs, wann sie es nicht sind, und welche Risiken trotzdem bleiben.

Modul 08 9 min

Cloud vs. lokales LLM: Kosten, Datenwege und passende Szenarien

GPT-API, lokales Modell oder VPS? Vergleiche Kosten und Datenwege anhand eurer Nutzung. Mit API-Rechner und geprüften VPS-Einstiegs- und Verlängerungstarifen.

Modul 09 13 min

Hermes lokal installieren - Nous Research Hermes 3 auf eigener Hardware

Hermes 3 von Nous Research lokal mit Ollama betreiben: Größen von 3B bis 405B, System-Prompt-Steuerung, Tool-Calling und JSON-Modus. Lizenz, Hardware, Praxis.

Modul 10 14 min

OpenClaw mit lokalem Modell - autonomer Agent ohne API-Kosten

OpenClaw mit Ollama oder LM Studio statt Cloud-API betreiben: Aufbau, Einrichtung, laufende Kosten von null — und die Sicherheitsfragen, die dabei ehrlich zu klären sind.

Modul 11 8 min

Buzz selbst hosten - Blocks Nostr-Workspace für Mensch-Agent-Teams

Buzz.xyz erklärt: Blocks quelloffener Nostr-Workspace für Menschen und KI-Agenten. Was er kann, wie Selbsthosting geht, wo Grenzen liegen - jetzt lesen.

Modul 12 8 min

Paperclip - Agenten mit Orgchart, Budgets und Freigaben verwalten

Paperclip verwaltet mehrere Agenten-Laufzeiten als ein Team mit Rollen, Budgets und Freigaben. Selbst hostbar unter MIT-Lizenz — und wo der Bezug zu lokalen Modellen aufhört.

Modul 13 7 min

Hardware-Rechner - passt dieses Modell auf meinen Rechner?

Arbeitsspeicher und Kontextlänge eingeben, sehen welche Modelle laufen. Mit der KV-Cache-Rechnung, die fast alle unterschätzen — Architekturwerte aus den offiziellen config.json.

Modul 14 7 min

LLM im Browser - ein Sprachmodell direkt auf deiner Grafikkarte

Ein Sprachmodell im Browser starten, per WebGPU auf der eigenen Grafikkarte, ohne Server. Zum Ausprobieren auf dieser Seite — mit ehrlicher Einordnung, was das kann und was nicht.

Modul 15 13 min

DeepSeek V4 Flash lokal betreiben — offene Gewichte, 167 GB Hardware

DeepSeek V4 Flash lokal: 304B Parameter, 13B aktiv, 167 GB. Die Rechnung, die Ollama-Cloud-Falle — und warum seit August ein einzelner DGX Spark ab 4.000 Euro genügt.

Modul 16 13 min

Große Modelle lokal betreiben — was 300 Milliarden Parameter auf einem Desktop kosten

DeepSeek V4 Flash läuft auf 24 GB VRAM plus 128 GB RAM, mit 4,6 Tokens pro Sekunde. Die Bandbreitenformel, MoE-Offload in llama.cpp und die Grenze, ab der nur noch EU-Cloud bleibt.

Modul 17 12 min

Local Studio: lokale Modelle im Unternehmen betreiben

Local Studio bündelt vLLM, SGLang, llama.cpp und MLX hinter einer Schnittstelle. Was das für Kanzleien, Praxen und Ingenieurbüros bedeutet, deren Dokumente das Haus nicht verlassen dürfen.

Modul 18 13 min

NVIDIA DGX Spark für lokale LLMs — lohnt sich das Gerät?

DGX Spark und GB10-Partnergeräte für lokale LLMs: 128 GB gemeinsamer Speicher, Kapazität, Grenzen und Kostenplanung. Tagespreis und Lieferbarkeit anfragen.

Modul 30 8 min

GPT für Unternehmen: vom Chat zum nutzbaren Arbeitsablauf

GPT im Unternehmen einsetzen: ChatGPT, API oder lokales Modell vergleichen. Konkrete Szenarien, Datenwege, Pilot und Beratung für euer Team.

Modul 31 8 min

KI für Anwaltskanzleien: Aktenarbeit mit Quellen und Mandatstrennung

KI für Kanzleien mit 5–30 Personen: Akten sichten, Vertragsstellen finden und Entwürfe vorbereiten. Mit Quellen, Mandatstrennung und einem prüfbaren Pilot.

Modul 32 9 min

KI im Mittelstand: passende Szenarien für 20 bis 250 Beschäftigte

KI im Mittelstand für 20–250 Beschäftigte: Angebote, Servicewissen und interne Suche. Teamgröße, parallele Nutzung, Integration und Kosten sinnvoll planen.

Modul 33 8 min

Interne KI-Wissensdatenbank: Antworten aus eigenen Dokumenten

Eine interne KI-Wissensdatenbank mit Quellen, Dokumentversionen und Nutzerrechten planen. Lokales RAG für Handbücher, Verträge und Unternehmenswissen.

Modul 34 8 min

KI-Server-Kosten: GPT-API, Workstation oder eigener Server?

KI-Server-Kosten nachvollziehbar rechnen: GPT-API, Workstation und eigener Server. Mit aktuellem API-Tarifstand, Kostenrechner und Anfrage nach tatsächlicher Last.

Modul 35 7 min

Lokale KI für sensible Daten: den gesamten Datenweg schützen

Vertrauliche Dokumente mit lokaler KI verarbeiten: Datenwege, Rechte, Offline-Betrieb und überprüfbarer Pilot für Mandate, Personalunterlagen und Firmenwissen.

Modul 36 7 min

Lokale KI für Entwicklung: mit eigenem Code zum überprüfbaren Prototyp

Lokale KI für Softwareteams, Agenturen und Forschung: eigenen Code schützen, Prototypen bauen, Modelle testen und Kosten vor dem produktiven Einsatz messen.

Modul 37 7 min

Lokale KI für Industrie und Engineering: technisches Wissen richtig nutzen

KI für Engineering, technischen Service und Qualität: Projektwissen, gültige Dokumentversionen und Offline-Suche mit prüfbaren Quellen statt pauschaler Automatisierung.

Modul 38 8 min

LLM-API-Kosten senken: Tokenbudget, lokale Modelle und Anbieterwechsel

GPT- und Claude-Kosten kontrollieren: weniger Tokens, Caching, Batch und lokale Modelle. Mit Szenariorechner für mögliche Tarifänderungen und Kosten je Ergebnis.

Modul 90 9 min

512-GB-MacBook für Ollama: Reicht der Speicher für lokale LLMs?

Praxischeck für Ollama auf dem MacBook: Wie viel SSD-Speicher Modelle wirklich belegen, warum RAM der härtere Engpass ist und welche Modellgrößen realistisch bleiben.

Wo du am besten weiterliest

Die Sub-Pages sind nach Themen sortiert. Nach Situation sortiert sieht die Reihenfolge so aus:

  • Du willst heute noch etwas laufen sehen. Dann direkt ins Ollama Tutorial — Installation und erstes Modell dauern zusammen etwa fünf Minuten.
  • Du weißt nicht, ob dein Rechner reicht. Der Hardware-Rechner sagt dir in zehn Sekunden, welche Modelle bei deiner Kontextlänge in den Speicher passen. Die Begründung dahinter steht im Hardware-Guide.
  • Du liest von einem neuen offenen Spitzenmodell und fragst dich, ob du es betreiben kannst. Am Beispiel des im Juli 2026 veröffentlichten DeepSeek V4 Flash zeigt DeepSeek V4 Flash lokal, warum freie MIT-Gewichte und lokale Lauffähigkeit zwei verschiedene Dinge sind — mit der Speicherrechnung und der Cloud-Tag-Falle bei Ollama.
  • Du willst es erst einmal sehen, bevor du etwas installierst. Unter LLM im Browser läuft ein Modell direkt auf deiner Grafikkarte — ohne Installation, und im Netzwerk-Tab nachprüfbar, dass nichts rausgeht.
  • Deine Daten dürfen das Haus nicht verlassen. Dann fang bei Sicherheit und DSGVO an. Dort steht auch, wo das Datenschutzargument für lokale Modelle nicht trägt.
  • Du willst eigene Dokumente durchsuchbar machen. Das ist RAG lokal — der Anwendungsfall mit dem besten Verhältnis von Aufwand zu Nutzen.
  • Du bist unsicher, ob lokal überhaupt das Richtige ist. Die Kostenrechnung und die ehrliche Gegenüberstellung stehen unter Cloud vs. Lokal.
  • Dein Modell soll deinen Anweisungen wirklich folgen. Dann sieh dir Hermes an — die Reihe ist auf System-Prompt-Steuerung, Funktionsaufrufe und verlässliche JSON-Ausgabe abgestimmt.
  • Das Modell läuft, und jetzt soll es etwas tun. Ein Agent mit lokalem Modell und ohne API-Kosten steht unter OpenClaw lokal — inklusive der Sicherheitsfragen, die dabei ehrlich dazugehören.
  • Es soll ins Unternehmen. Was dafür nötig ist und was ausdrücklich nicht, steht auf der Seite Beratung.

Was lokale Modelle nicht gut können

Wer mit realistischen Erwartungen startet, bleibt dabei. Diese Grenzen verschieben sich zwar laufend, aber Stand 2026 gelten sie:

  • Schwieriges Reasoning. Bei mehrstufigen Aufgaben, die wirklich Denkarbeit verlangen, liegen die großen Cloud-Modelle vorn. Ein lokales 8B-Modell löst eine Fachfrage sauber — aber nicht die, an der auch ein Mensch zwanzig Minuten sitzt.
  • Sehr lange Kontexte. Technisch nehmen die Modelle große Kontextfenster entgegen. Praktisch sinkt die Qualität mit zunehmender Länge spürbar, und der Speicherbedarf steigt mit. Wer 200 Seiten am Stück verarbeiten will, braucht RAG statt eines größeren Kontextfensters.
  • Aktuelles Wissen. Ein lokales Modell kennt nur seinen Trainingsstand. Es hat keinen Internetzugang, es sei denn, du baust ihn dazu. Für Fragen zu laufenden Ereignissen ist es das falsche Werkzeug.
  • Verlässliche Werkzeugnutzung. Agenten, die selbstständig Tools aufrufen und mehrere Schritte verketten, funktionieren lokal — aber deutlich unzuverlässiger als mit den großen Modellen. Je enger die Aufgabe, desto besser das Ergebnis.

Nichts davon spricht gegen lokale Modelle. Es spricht dagegen, sie an der falschen Aufgabe zu messen. Ihr Vorteil ist nicht Spitzenqualität, sondern dass Daten das Haus nicht verlassen, die Kosten planbar bleiben und das Ganze auch ohne Netz funktioniert.

Die häufigsten Fehler beim Einstieg

  1. Mit dem größten Modell anfangen. Das 70B-Modell läuft zäh, der erste Eindruck ist Enttäuschung, das Projekt stirbt. Fang mit einem 3B- oder 7B-Modell an und geh erst hoch, wenn du eine konkrete Aufgabe hast, an der es scheitert.
  2. Auf die SSD schauen statt auf den RAM. Die Festplatte entscheidet, wie viele Modelle du lagern kannst. Der Arbeitsspeicher entscheidet, welche davon flüssig laufen. Bei der Kaufentscheidung gewinnt im Zweifel immer der RAM — mehr dazu im Hardware-Guide.
  3. Fine-Tuning statt RAG. „Das Modell soll unsere Daten kennen" führt fast nie zu Fine-Tuning. Es führt zu RAG: schneller aufgesetzt, billiger, und du kannst Dokumente austauschen, ohne irgendetwas neu zu trainieren.
  4. Ohne definierten Anwendungsfall starten. „Wir machen was mit KI" endet in einem Setup, das nach drei Wochen niemand mehr öffnet. „Wir wollen unsere Angebotsvorlagen durchsuchbar machen" endet in etwas, das benutzt wird.
  5. Benchmark-Tabellen glauben. Veröffentlichte Ranglisten messen englische Standardaufgaben. Ob ein Modell deine deutschen Fachtexte versteht, sagt dir nur ein eigener Test mit fünf echten Prompts. Der dauert zehn Minuten und ist aussagekräftiger als jede Tabelle.

Wann lokales LLM, wann Cloud?

Lokal lohnt sich, wenn Datenschutz Priorität hat (Mandantengeheimnis, Patientendaten, interne Geschäftslogik), wenn du häufig offline arbeitest, oder wenn dich die Cloud-Kosten bei großem Volumen erschlagen. Eine freigegebene Cloud-API kann sinnvoll sein, wenn sie eure Aufgabe besser löst oder ihr eigenen Modellbetrieb vermeiden möchtet.

Eine ehrliche Abwägung mit Kostenrechnung findest du auf der dedizierten Sub-Page Cloud vs. Lokal. Wer eine Mittelweg sucht: ein eigener VPS kann Anwendungen extern betreiben. Verträge, Datenstandort und ausreichende Leistung müssen dafür passen.

Wer betreibt LLMlokal?

LLMlokal ist eine redaktionelle Sammelseite mit Praxis-Anleitungen für DACH-Nutzer. Wir betreiben selbst lokale LLMs auf Mac- und Linux-Setups, und schreiben über das, was funktioniert - inklusive der Stellen, an denen die Marketing-Versprechen der Modell-Anbieter brechen. Kontakt und vollständige Angaben im Impressum.

Häufig gestellte Fragen

Was bedeutet "LLM lokal betreiben"?

Das Modell führt seine Berechnung auf deiner eigenen Hardware aus. Ob der gesamte Arbeitsablauf lokal bleibt, hängt auch von Dokumentverarbeitung, Suche, Integrationen und Protokollen ab. Diese Datenwege müssen separat geprüft werden.

Welche Hardware brauche ich mindestens?

Für 3B-Modelle wie Llama 3.2 reichen 8 GB RAM. Für 7B-Modelle (Llama, Mistral) solltest du 16 GB RAM haben. Eine dedizierte GPU mit 8 GB+ VRAM beschleunigt die Inferenz deutlich, ist aber kein Muss.

Welches Tool soll ich nehmen - Ollama oder LM Studio?

Ollama ist die richtige Wahl, wenn du dich auf der Kommandozeile wohl fühlst und das Modell in andere Programme einbinden willst. LM Studio bietet eine grafische Oberfläche und eignet sich besser für Einsteiger oder reine Desktop-Nutzung.

Welche Modelle sind 2026 für DACH-Nutzer empfehlenswert?

Qwen3 8B als moderner Allrounder, Llama 3.2 3B wenn Tempo zählt, Gemma 3 27B für hohe Qualität mit Bildverständnis, Qwen3 30B-A3B als effizientes Mixture-of-Experts und Llama 3.3 70B für das lokal Machbare. Alle laufen lokal und sind kommerziell nutzbar, wobei Gemma eigene Nutzungsbedingungen statt einer klassischen Open-Source-Lizenz hat.

Ist das DSGVO-konform?

Lokaler Betrieb ist nicht automatisch DSGVO-konform. Rechtsgrundlage, Nutzerrechte, Datenminimierung, Protokolle, Löschung und Sicherheit müssen passen. Ob Dienstleister beteiligt sind, hängt auch von Wartung, Backups und den übrigen Komponenten ab. Details unter Sicherheit und DSGVO.

Kann ich Llama 3 kommerziell nutzen?

Ja, mit Einschränkungen. Die Llama-3-Lizenz erlaubt kommerzielle Nutzung, sofern du nicht über 700 Millionen monatlich aktive Nutzer hast. Für die meisten DACH-Unternehmen kein Problem.

Was kostet das Setup?

Für einen ersten Versuch kann vorhandene Hardware reichen. Die Kosten hängen von Software- und Modelllizenz, benötigter Hardware, Einführung und Betrieb ab. Teamnutzung, Kontextlänge und parallele Anfragen bestimmen den weiteren Aufwand; der Kosten-Guide zeigt die einzelnen Kostenblöcke.

Wie schnell läuft so ein lokales LLM?

Auf einem MacBook M3 Pro mit 18 GB RAM erreicht Llama 3.2 3B rund 30-50 Tokens/Sekunde. Mit dedizierter GPU (RTX 4070 oder besser) erreichst du 70+ Tokens/Sekunde, vergleichbar mit ChatGPT-Niveau-Geschwindigkeit.

Was ist der Unterschied zu ChatGPT oder Claude?

Bei lokaler Inferenz entfallen externe Tokengebühren. Hardware, Energie und Betrieb bleiben Kosten. Qualität und Offline-Fähigkeit müssen für die konkrete Aufgabe und alle Komponenten geprüft werden. ChatGPT, Claude und API-Anwendungen haben andere Betriebswege und Konditionen.

Kann ich ein lokales LLM mit meinen eigenen Dokumenten nutzen?

Ja, über Retrieval-Augmented Generation (RAG): Das Modell bekommt vor der Antwort passende Ausschnitte aus deinen Dokumenten mitgeliefert. Mit Ollama und einem Tool wie AnythingLLM oder GPT4All läuft das komplett lokal, ohne dass Dateien deinen Rechner verlassen. Details unter RAG lokal.

Beratung