开始使用
选择模型
哪个模型放得进你的显卡,以及决定这件事的那一个数字。
Draggy 会问 Ollama 每个已安装模型能做什么,而不是从名字上猜。云端模型被隐藏;嵌入模型会列出但不能回答。
Windows 与 Linux
首先按显卡显存来选。显存很少或没有的机器,仍会得到一个系统内存能撑得住的模型,而不是最小的那个。
| 显存 | 模型 |
|---|---|
| 低于 4 GB | Qwen 3.5 0.8B |
| 4 GB | Qwen 3.5 2B |
| 5 GB | Gemma 4 E4B |
| 6 GB | Mistral 7B |
| 8 GB | Qwen 3.5 9B |
| 10 GB | Gemma 4 12B |
| 12 GB | Phi-4 14B |
| 16 GB | GPT-OSS 20B MoE |
| 20 GB | Qwen 3.5 27B MoE |
| 22 GB | GLM 4.7 Flash MoE |
| 24 GB | Gemma 4 31B |
| 32 GB | Qwen 3.5 35B MoE |
| 96 GB | Qwen 3.5 122B MoE |
它能叫出名字的每一个模型,连同参数、最适合的用途和支持情况,都在 完整模型列表里。
Apple Silicon
Ollama 0.19 及以上版本通过 MLX 运行模型,所以 Draggy 会选择 -mlx
版本。Mac 上没有独立显存,所以下表的数字就是 Mac 出厂时标注的、未经缩减的整数。基础版或
Pro 芯片对应左边一列的模型;内存带宽大得多的 Max 或 Ultra,对应旁边那一列。
| 统一内存 | 基础版或 Pro | Max 或 Ultra |
|---|---|---|
| 8 GB | Qwen 3.5 2B (MLX) | Qwen 3.5 4B (MLX) |
| 16 GB | Qwen 3.5 4B (MLX) | Qwen 3.5 9B (MLX) |
| 24 GB | Qwen 3.5 9B (MLX) | Qwen 3.5 27B MoE (MLX) |
| 32 GB | Qwen 3.5 27B MoE (MLX) | Gemma 4 31B (MLX) |
| 48 GB | Gemma 4 31B (MLX) | Qwen 3.5 35B MoE (MLX) |
| 64 GB | Qwen 3.5 35B MoE (MLX) | GLM 4.7 Flash (MLX) |
| 96 GB | GLM 4.7 Flash (MLX) | Qwen 3.5 122B MoE (MLX) |
| 128 GB 及以上 | Qwen 3.5 122B MoE (MLX) | Qwen 3.5 122B MoE (MLX) |
自 2020 年第一台以来,每一台能运行自家模型的 Mac:
| Mac | 年份 | 芯片 | 统一内存 |
|---|---|---|---|
| MacBook Air | 2020–2025 | M1、M2、M3、M4 | 8–32 GB |
| MacBook Pro 13" | 2020 | M1 | 8–16 GB |
| MacBook Pro 14"/16" | 2021–2025 | M1 到 M4,Pro 或 Max | 16–128 GB |
| Mac mini | 2020–2024 | M1、M2 或 M2 Pro、M4 或 M4 Pro | 8–64 GB |
| iMac | 2021–2025 | M1、M3、M4 | 8–24 GB |
| Mac Studio | 2022–2025 | M1/M2 Max 或 Ultra、M3 Ultra、M4 Max | 32–512 GB |
| Mac Pro | 2023 | M2 Ultra | 64–192 GB |
2019 年及更早的 Mac 是 Intel 机型:它有一块真正独立的显卡,读取的是上面 Windows 与 Linux 的表格。
同样的表格,按统一内存而不是显存排列,就是 Mac 版完整模型列表。
真正重要的那个数字
设置 → 模型会显示每个模型有多少装得进显存。GPU 占比 100%
时,它的回答速度和你阅读的速度相当;60% 时也能用,但会慢上好几倍;再低就该降一档了。
已加载的模型在那里会多出一个卸载模型按钮,它只释放显存,不删除任何东西。
语音模型
语音模式用的是自己的、更小的模型,在
设置 → Chat → 语音对话里设置。这里答得快比答得好更重要,所以尽量选小的。