开始使用

选择模型

哪个模型放得进你的显卡,以及决定这件事的那一个数字。

Draggy 会问 Ollama 每个已安装模型能做什么,而不是从名字上猜。云端模型被隐藏;嵌入模型会列出但不能回答。

Windows 与 Linux

首先按显卡显存来选。显存很少或没有的机器,仍会得到一个系统内存能撑得住的模型,而不是最小的那个。

显存模型
低于 4 GBQwen 3.5 0.8B
4 GBQwen 3.5 2B
5 GBGemma 4 E4B
6 GBMistral 7B
8 GBQwen 3.5 9B
10 GBGemma 4 12B
12 GBPhi-4 14B
16 GBGPT-OSS 20B MoE
20 GBQwen 3.5 27B MoE
22 GBGLM 4.7 Flash MoE
24 GBGemma 4 31B
32 GBQwen 3.5 35B MoE
96 GBQwen 3.5 122B MoE

它能叫出名字的每一个模型,连同参数、最适合的用途和支持情况,都在 完整模型列表里。

Apple Silicon

Ollama 0.19 及以上版本通过 MLX 运行模型,所以 Draggy 会选择 -mlx 版本。Mac 上没有独立显存,所以下表的数字就是 Mac 出厂时标注的、未经缩减的整数。基础版或 Pro 芯片对应左边一列的模型;内存带宽大得多的 Max 或 Ultra,对应旁边那一列。

统一内存基础版或 ProMax 或 Ultra
8 GBQwen 3.5 2B (MLX)Qwen 3.5 4B (MLX)
16 GBQwen 3.5 4B (MLX)Qwen 3.5 9B (MLX)
24 GBQwen 3.5 9B (MLX)Qwen 3.5 27B MoE (MLX)
32 GBQwen 3.5 27B MoE (MLX)Gemma 4 31B (MLX)
48 GBGemma 4 31B (MLX)Qwen 3.5 35B MoE (MLX)
64 GBQwen 3.5 35B MoE (MLX)GLM 4.7 Flash (MLX)
96 GBGLM 4.7 Flash (MLX)Qwen 3.5 122B MoE (MLX)
128 GB 及以上Qwen 3.5 122B MoE (MLX)Qwen 3.5 122B MoE (MLX)

自 2020 年第一台以来,每一台能运行自家模型的 Mac:

Mac年份芯片统一内存
MacBook Air2020–2025M1、M2、M3、M48–32 GB
MacBook Pro 13"2020M18–16 GB
MacBook Pro 14"/16"2021–2025M1 到 M4,Pro 或 Max16–128 GB
Mac mini2020–2024M1、M2 或 M2 Pro、M4 或 M4 Pro8–64 GB
iMac2021–2025M1、M3、M48–24 GB
Mac Studio2022–2025M1/M2 Max 或 Ultra、M3 Ultra、M4 Max32–512 GB
Mac Pro2023M2 Ultra64–192 GB

2019 年及更早的 Mac 是 Intel 机型:它有一块真正独立的显卡,读取的是上面 Windows 与 Linux 的表格。

同样的表格,按统一内存而不是显存排列,就是 Mac 版完整模型列表

真正重要的那个数字

设置 → 模型会显示每个模型有多少装得进显存。GPU 占比 100% 时,它的回答速度和你阅读的速度相当;60% 时也能用,但会慢上好几倍;再低就该降一档了。

已加载的模型在那里会多出一个卸载模型按钮,它只释放显存,不删除任何东西。

语音模型

语音模式用的是自己的、更小的模型,在 设置 → Chat → 语音对话里设置。这里答得快比答得好更重要,所以尽量选小的。