本地安装开源大模型最新王者 Qwen3.5
为什么会选在这个时候介绍 qwen3.5 模型,因为最近出了一些类比 OpenClaw 但是更亲近于国人的AI助理智能体(比如,CoPaw), qwen3.5 又是最近最火的可本地部署的开源模型,所以本节会先介绍该模型的本地部署,后续在介绍 CoPaw 完全本地化的时候,会基于该模型进行介绍。
在 一文中,通过比较 Qwen3 大模型 3 个阶段的 15 个模型,得出结论:本地 24G 显存可以部署的最优模型是 Qwen3-30B-A3B-Thinking-2507 的量化版本。
后面在 一文中,我们通过 glm-4.7-flash 模型官网给出的比较数据,发现其实力超过了 Qwen3-30B-A3B-Thinking-2507,故 24G 显存可以部署的最优模型易主为 glm-4.7-flash。
本节来看下最新开源的 qwen3.5 的几个模型,看看 24G 显存可以部署的最优模型是否会有变更。
Qwen3.5 模型发展历程
第一阶段
2026-02-16,阿里推出了 Qwen3.5 系列的第一款模型 Qwen3.5-397B-A17B,该模型是当前 Qwen 系列的旗舰模型。
第二阶段
2026-02-24: 阿里又开源了 Qwen3.5-122B-A10B, Qwen3.5-35B-A3B 和 Qwen3.5-27B 三款模型。
官方给出的三者的测评图见留言区(此处放不见来)。
从测评数据来看,Qwen3.5-35B-A3B 和 Qwen3.5-27B 性能总体上相差不大,Qwen3.5-27B 占优的指标会多一些,同时考虑到 Qwen3.5-27B 模型的大小要比 Qwen3.5-35B-A3B 小,故在 qwen3.5 系列中,24G 显存部署选择 Qwen3.5-27B。
我们再将上述的测评数据与 OpenClaw 本地部署 一文中 glm-4.7-flash 模型官网给出的数据做一波横向对比,发现 Qwen3.5-27B 要优于 glm-4.7-flash,且前者是文本多模态一体化模型,故 Qwen3.5-27B 成为 24G 显存可以部署的最优模型。
核心亮点
对于国内使用者,Qwen3.5 最核心的亮点就是文本多模态一体化,这标志着我只需要一个模型就能处理文本/图片等,对于智能体(例如,OpenManus)调用 Ollama 支持的本地模型来同时处理文本和图片场景,提供了巨大的便利。在这之前,我们得想办法做好文本模型和VL模型的切换能力。
模型下载
下载 Ollama
进入 Ollama 官网 https://ollama.com,下载 Ollama 的 exe 安装文件。
之后双击安装文件,一路到底安装完成。
下载模型到本地
打开终端,输入如下命令,下载 Qwen3.5-27B 模型
ollama run qwen3.5:2说明:下载的过程中如果发现下载速度突然变慢,不要傻等,直接 ctrl+c 停止下载。之后进入输入上述的命令进行下载,Ollama 支持断点下载能力,此时的速度就又提上去了。
Ollama 界面中使用
文本处理
视觉处理
注意点
Qwen3.5-27B 需要 24G 显存,在使用的过程中,Context length 不要设置太大,建议最大设置为 32k,否则很可能因为显存不足导致程序崩溃;(Qwen3.5-35B-A3B 也有这个问题)
如果需要更大的上下文长度,可以选择 glm-4.7-flash 模型



0 条评论