Pour commencer
Choisir un modèle
Quel modèle tient dans votre carte graphique, et le seul chiffre qui en décide.
Draggy demande à Ollama ce que chaque modèle installé sait faire plutôt que de le deviner d'après son nom. Les modèles cloud sont masqués ; les modèles d'embedding sont listés mais ne répondent pas.
Windows et Linux
Choisi d'abord dans la mémoire de la carte graphique. Une machine qui en a peu ou pas obtient quand même un modèle à la taille de sa mémoire vive, plutôt que le plus petit qui existe.
| VRAM | Modèle |
|---|---|
| moins de 4 Go | Qwen 3.5 0.8B |
| 4 Go | Qwen 3.5 2B |
| 5 Go | Gemma 4 E4B |
| 6 Go | Mistral 7B |
| 8 Go | Qwen 3.5 9B |
| 10 Go | Gemma 4 12B |
| 12 Go | Phi-4 14B |
| 16 Go | GPT-OSS 20B MoE |
| 20 Go | Qwen 3.5 27B MoE |
| 22 Go | GLM 4.7 Flash MoE |
| 24 Go | Gemma 4 31B |
| 32 Go | Qwen 3.5 35B MoE |
| 96 Go | Qwen 3.5 122B MoE |
Tous les modèles qu'il sait nommer, avec leurs paramètres, leur meilleur usage et ce qu'ils prennent en charge, sont dans le tableau complet des modèles.
Apple Silicon
Ollama 0.19+ fait tourner les modèles via MLX, donc Draggy choisit la version
-mlx. Il n'y a pas de mémoire vidéo séparée sur un Mac : les
tailles ci-dessous sont le nombre entier, non réduit, avec lequel le Mac est
vendu. Une puce de base ou Pro prend le modèle de la colonne de gauche ; une
Max ou une Ultra, avec beaucoup plus de bande passante mémoire, prend celui
d'à côté.
| Mémoire unifiée | Base ou Pro | Max ou Ultra |
|---|---|---|
| 8 Go | Qwen 3.5 2B (MLX) | Qwen 3.5 4B (MLX) |
| 16 Go | Qwen 3.5 4B (MLX) | Qwen 3.5 9B (MLX) |
| 24 Go | Qwen 3.5 9B (MLX) | Qwen 3.5 27B MoE (MLX) |
| 32 Go | Qwen 3.5 27B MoE (MLX) | Gemma 4 31B (MLX) |
| 48 Go | Gemma 4 31B (MLX) | Qwen 3.5 35B MoE (MLX) |
| 64 Go | Qwen 3.5 35B MoE (MLX) | GLM 4.7 Flash (MLX) |
| 96 Go | GLM 4.7 Flash (MLX) | Qwen 3.5 122B MoE (MLX) |
| 128 Go et plus | Qwen 3.5 122B MoE (MLX) | Qwen 3.5 122B MoE (MLX) |
Tous les Mac capables de faire tourner ses modèles, depuis le premier en 2020 :
| Mac | Années | Puce | Mémoire unifiée |
|---|---|---|---|
| MacBook Air | 2020–2025 | M1, M2, M3, M4 | 8–32 Go |
| MacBook Pro 13" | 2020 | M1 | 8–16 Go |
| MacBook Pro 14"/16" | 2021–2025 | M1 à M4, Pro ou Max | 16–128 Go |
| Mac mini | 2020–2024 | M1, M2 ou M2 Pro, M4 ou M4 Pro | 8–64 Go |
| iMac | 2021–2025 | M1, M3, M4 | 8–24 Go |
| Mac Studio | 2022–2025 | M1/M2 Max ou Ultra, M3 Ultra, M4 Max | 32–512 Go |
| Mac Pro | 2023 | M2 Ultra | 64–192 Go |
Un Mac de 2019 ou avant est un Intel : il a une vraie carte graphique séparée à la place, et lit le tableau Windows et Linux ci-dessus.
Le même tableau, à la taille de la mémoire unifiée plutôt que de la VRAM, est le tableau complet des modèles pour Mac.
Le chiffre qui compte
Paramètres → Modèles montre quelle part de chaque modèle tient en
mémoire vidéo. À 100 % sur le GPU, il répond à la vitesse de lecture. À 60 %,
il fonctionne, plusieurs fois plus lentement. En dessous, descendez d'une
taille.
Un modèle chargé y gagne un bouton Décharger le modèle, qui libère la mémoire vidéo sans rien supprimer.
Le modèle vocal
Le mode vocal utilise son propre modèle, plus
petit, réglé dans Paramètres → Chat → Parler. Répondre vite vaut
mieux que répondre bien ici, donc gardez-le petit.