Erste Schritte
Modell wählen
Welches Modell auf deine Grafikkarte passt, und die eine Zahl, die das entscheidet.
Draggy fragt Ollama, was jedes installierte Modell kann, statt es aus dem Namen zu raten. Cloud-Modelle sind ausgeblendet; Embedding-Modelle stehen in der Liste, können aber nicht antworten.
Windows und Linux
Zuerst nach dem Speicher der Grafikkarte gewählt. Eine Maschine mit wenig oder keinem bekommt trotzdem ein Modell in der Größe, die ihr Arbeitsspeicher trägt, statt des kleinsten, das es gibt.
| VRAM | Modell |
|---|---|
| unter 4 GB | Qwen 3.5 0.8B |
| 4 GB | Qwen 3.5 2B |
| 5 GB | Gemma 4 E4B |
| 6 GB | Mistral 7B |
| 8 GB | Qwen 3.5 9B |
| 10 GB | Gemma 4 12B |
| 12 GB | Phi-4 14B |
| 16 GB | GPT-OSS 20B MoE |
| 20 GB | Qwen 3.5 27B MoE |
| 22 GB | GLM 4.7 Flash MoE |
| 24 GB | Gemma 4 31B |
| 32 GB | Qwen 3.5 35B MoE |
| 96 GB | Qwen 3.5 122B MoE |
Jedes Modell, das es nennen kann, mit Parametern, bestem Einsatz und Unterstützung, steht in der vollständigen Modelltabelle.
Apple Silicon
Ollama 0.19+ führt Modelle über MLX aus, also nimmt Draggy den
-mlx-Build. Auf einem Mac gibt es keinen getrennten Grafikspeicher,
darum sind die Größen unten die ganze, ungekürzte Zahl, mit der der Mac
verkauft wurde. Ein Basis- oder Pro-Chip nimmt das Modell in der linken Spalte;
ein Max oder Ultra, mit deutlich mehr Speicherbandbreite, das daneben.
| Gemeinsamer Speicher | Basis oder Pro | Max oder Ultra |
|---|---|---|
| 8 GB | Qwen 3.5 2B (MLX) | Qwen 3.5 4B (MLX) |
| 16 GB | Qwen 3.5 4B (MLX) | Qwen 3.5 9B (MLX) |
| 24 GB | Qwen 3.5 9B (MLX) | Qwen 3.5 27B MoE (MLX) |
| 32 GB | Qwen 3.5 27B MoE (MLX) | Gemma 4 31B (MLX) |
| 48 GB | Gemma 4 31B (MLX) | Qwen 3.5 35B MoE (MLX) |
| 64 GB | Qwen 3.5 35B MoE (MLX) | GLM 4.7 Flash (MLX) |
| 96 GB | GLM 4.7 Flash (MLX) | Qwen 3.5 122B MoE (MLX) |
| 128 GB und mehr | Qwen 3.5 122B MoE (MLX) | Qwen 3.5 122B MoE (MLX) |
Jeder Mac, der seine eigenen Modelle ausführen kann, seit dem ersten 2020:
| Mac | Jahre | Chip | Gemeinsamer Speicher |
|---|---|---|---|
| MacBook Air | 2020–2025 | M1, M2, M3, M4 | 8–32 GB |
| MacBook Pro 13" | 2020 | M1 | 8–16 GB |
| MacBook Pro 14"/16" | 2021–2025 | M1 bis M4, Pro oder Max | 16–128 GB |
| Mac mini | 2020–2024 | M1, M2 oder M2 Pro, M4 oder M4 Pro | 8–64 GB |
| iMac | 2021–2025 | M1, M3, M4 | 8–24 GB |
| Mac Studio | 2022–2025 | M1/M2 Max oder Ultra, M3 Ultra, M4 Max | 32–512 GB |
| Mac Pro | 2023 | M2 Ultra | 64–192 GB |
Ein Mac von 2019 oder älter ist ein Intel: Er hat stattdessen eine echte, getrennte Grafikkarte und liest die Windows-und-Linux-Tabelle oben.
Dieselbe Tabelle, nach gemeinsamem Speicher statt VRAM, ist die vollständige Modelltabelle für Mac.
Die Zahl, auf die es ankommt
Einstellungen → Modelle zeigt, wie viel von jedem Modell in den
Grafikspeicher passt. Bei 100 % auf der GPU antwortet es in Lesegeschwindigkeit.
Bei 60 % läuft es, mehrfach langsamer. Darunter lohnt eine Nummer kleiner.
Ein geladenes Modell bekommt dort einen Knopf Modell entladen, der den Grafikspeicher freigibt, ohne etwas zu löschen.
Das Sprechmodell
Der Sprachmodus nutzt ein eigenes, kleineres
Modell, eingestellt unter Einstellungen → Chat → Sprechen. Schnell
zu antworten zählt hier mehr als gut zu antworten, also klein halten.