So richten Sie Ihren PC für lokale KI-Modelle ein
Ein KI-Modell auf dem eigenen Rechner auszuführen dauert etwa zwanzig Minuten, und das meiste davon ist der Download. Es braucht kein Konto und kein Abonnement, und sobald die Gewichte auf der Festplatte liegen, funktioniert alles offline — Ihre Eingaben verlassen den Rechner nie.
Diese Anleitung verwendet Ollama, kostenlos, quelloffen und der einfachste Weg, ein Modell zum Laufen zu bringen. Es lädt die Gewichte herunter, nutzt die GPU, wo es geht, und stellt das Modell bereit — die gesamte Einrichtung besteht aus einem Installer und einem Befehl.
Diese Seite ist eine Übersetzung. Das Original ist auf Englisch.
Schritt 1 — Prüfen, was Ihr PC ausführen kann
Die Modellgröße wird zuerst durch den Speicher begrenzt. Ein Modell, das in den VRAM der Grafikkarte passt, läuft schnell; passt es nicht, muss es mit dem Arbeitsspeicher geteilt werden, was funktioniert, aber deutlich langsamer ist; passt es in keines von beiden, lädt es gar nicht erst.
Das durch den Download von 20 GB Gewichten herauszufinden ist der umständliche Weg — prüfen Sie es vorher.
Schritt 2 — Ollama installieren
Laden Sie den Installer für Ihr Betriebssystem herunter und führen Sie ihn aus. Unter Windows richtet er einen Hintergrunddienst ein und fügt den Befehl ollama hinzu; danach ist nichts weiter zu konfigurieren.
Ollama von ollama.com herunterladenWindows, macOS und Linux. Es lohnt sich, grundsätzlich nur von ollama.com zu laden: Nachbauten beliebter KI-Werkzeuge sind ein verbreiteter Weg, etwas ganz anderes zu verteilen.
Schritt 3 — Das erste Modell laden und starten
Öffnen Sie ein Terminal — Eingabeaufforderung oder PowerShell unter Windows, Terminal unter macOS oder Linux — und führen Sie einen einzigen Befehl aus. Beim ersten Mal lädt er das Modell und startet einen Chat damit:
ollama run gemma3Etwa 3 GB. Der Download läuft einmal; danach startet das Modell in Sekunden.
Danach erscheint eine Eingabeaufforderung. Tippen Sie eine Frage, drücken Sie Enter, und die Antwort entsteht auf Ihrer eigenen Hardware. Mit /bye verlassen Sie den Chat.
Fangen Sie klein an, auch wenn Ihr PC mehr kann: Ein 3B- oder 4B-Modell bestätigt in wenigen Minuten, dass alles funktioniert, und danach können Sie größer werden. Ersetzen Sie den Namen durch ein beliebiges Modell aus dem Katalog, in dem steht, was jedes einzelne benötigt.
Schritt 4 — Die Befehle, die man kennen sollte
Diese fünf decken fast alles im Alltag ab:
ollama pull qwen3:8bEin Modell herunterladen, ohne einen Chat zu starten.
ollama listZeigt die bereits vorhandenen Modelle samt Größe.
ollama rm qwen3:8bLöscht ein Modell und gibt den Speicherplatz frei.
ollama show gemma3Zeigt, was ein Modell benötigt und wie es konfiguriert ist.
ollama psZeigt, welche Modelle gerade im Speicher geladen sind.
Ein Name wie qwen3:8b besteht aus dem Modell und der Variante. Der Teil nach dem Doppelpunkt wählt Größe und Quantisierung; ohne ihn erhalten Sie die Standardvariante, meist eine mittelgroße 4-Bit-Version. Jede Modellseite auf dieser Website listet die verfügbaren Varianten und den Speicher, den jede davon braucht.
Wo die Modelle gespeichert werden
Die Gewichte sind jeweils mehrere Gigabyte groß und landen standardmäßig auf der Systemplatte:
| System | Speicherort |
|---|---|
| Windows | %USERPROFILE%\.ollama\models |
| macOS | ~/.ollama/models |
| Linux | /usr/share/ollama/.ollama/models |
Wird der Platz auf der Systemplatte knapp, setzen Sie die Umgebungsvariable OLLAMA_MODELS auf einen Ordner auf einer anderen Platte und starten Ollama neu. Bereits geladene Modelle bleiben, wo sie sind, sofern Sie sie nicht selbst verschieben.
Aus eigenen Anwendungen nutzen
Solange Ollama läuft, stellt es eine lokale API auf Port 11434 bereit. Genau daran hängen Desktop-Chatoberflächen und Editor-Erweiterungen, und so würden Sie ein Modell aus eigenem Code aufrufen — nichts verlässt dabei Ihren Rechner.
curl http://localhost:11434/api/generate -d "{\"model\":\"gemma3\",\"prompt\":\"Why is the sky blue?\"}"Eine gewöhnliche HTTP-Anfrage an das Modell auf Ihrem eigenen PC.
Wenn es langsam läuft
- Prüfen, ob die GPU genutzt wird. Führen Sie ollama ps aus, während ein Modell geladen ist — es zeigt, wie viel auf der GPU liegt. Ein Modell, das vollständig auf der CPU steht, ist der übliche Grund für langsame Antworten.
- Eine kleinere Variante wählen. Ein Modell, das nicht in den VRAM passt, wird mit dem Arbeitsspeicher geteilt, und der ausgelagerte Teil läuft nur mit einem Bruchteil der Geschwindigkeit. Eine Größe tiefer ist oft dramatisch schneller.
- Den Kontext verkürzen. Der KV-Cache wächst mit dem Kontextfenster und konkurriert mit den Gewichten um denselben Speicher. Ein langer Kontext kann ein Modell, das sonst passt, aus dem VRAM drängen.
- Grafiktreiber aktualisieren. Die Beschleunigung hängt davon ab, und ein alter Treiber kann bedeuten, dass die GPU überhaupt nicht genutzt wird.
Häufige Fragen
- Brauche ich eine Grafikkarte, um KI-Modelle lokal auszuführen?
- Nein, aber sie entscheidet darüber, was praktikabel ist. Ollama läuft auch allein auf der CPU mit dem Arbeitsspeicher, was für kleine Modelle genügt und bei großen langsam ist. Eine dedizierte GPU hält das Modell im VRAM und ist typischerweise um ein Vielfaches schneller — die Menge an VRAM entscheidet also, welche Modelle angenehm laufen, nicht nur, welche überhaupt möglich sind.
- Wie viel RAM und VRAM brauche ich?
- Als Faustregel benötigt ein auf 4 Bit quantisiertes Modell rund 0,6 GB je Milliarde Parameter, dazu Speicher für das Kontextfenster und den Laufzeit-Overhead. Ein 8B-Modell will damit etwa 6 GB VRAM bei kurzem Kontext. Das ist nur ein Anhaltspunkt — die Prüfung auf dieser Website rechnet es aus Ihrer tatsächlichen Hardware und der konkreten Variante aus.
- Ist Ollama kostenlos, und funktioniert es offline?
- Ollama ist kostenlos und quelloffen, ein Konto ist nicht nötig. Für den Download eines Modells brauchen Sie eine Internetverbindung, aber sobald die Gewichte auf der Platte liegen, läuft das Modell vollständig auf Ihrem Rechner, offline, und Ihre Eingaben werden nirgendwohin gesendet.
- Wo speichert Ollama die Modelle?
- Unter Windows liegen die Gewichte in %USERPROFILE%\.ollama\models, unter macOS in ~/.ollama/models und unter Linux in /usr/share/ollama/.ollama/models. Modelle sind jeweils mehrere Gigabyte groß; ist die Systemplatte knapp, können Sie Ollama über die Umgebungsvariable OLLAMA_MODELS auf einen anderen Ordner verweisen.
- Mit welchem Modell sollte ich anfangen?
- Mit einem kleinen: Eine 3B- oder 4B-Variante lädt in wenigen Minuten, läuft auf bescheidener Hardware und genügt, um zu bestätigen, dass alles funktioniert. Wenn die Einrichtung steht, wechseln Sie zum größten Modell, das Ihre Hardware bequem trägt.
- Kann ich Ollama ohne Kommandozeile nutzen?
- Ja. Ollama stellt eine lokale API auf Port 11434 bereit, und mehrere Desktop- und Browser-Oberflächen verbinden sich damit und geben Ihnen ein Chatfenster. Die Kommandozeile ist nur der schnellste Weg, das erste Modell zum Laufen zu bringen.
Unsicher, welches Modell es sein soll?
Prüfen Sie Ihren PC und erhalten Sie eine Liste aller Modelle, die er ausführen kann — mit dem Speicher, den jedes benötigt, und der Begründung. Das dauert etwa eine Minute und braucht kein Konto.