先说结论
如果你今天只想知道 Mistral Medium 3.5 到底值不值得看,先记住这 8 句话:
- Mistral 在 2026 年 4 月 29 日 左右把
Mistral Medium 3.5推到公开视野里,并在官方博客里把它定义成 “first flagship merged model”,核心目标是把instruction-following、reasoning和coding合到同一套权重里。 - 截至 2026 年 5 月 22 日,Mistral 官方文档已经确认它是一个 128B dense、256K context、支持多模态输入的开放权重模型,并采用
Modified MIT许可。 - 官方同时给出两个很关键的现实信号:它可以 self-host on as few as four GPUs,并且已经替换
Devstral 2成为Mistral Vibe编码 Agent 的默认模型。 - 从 API 价格看,官方公开价是 输入 $1.5 / 1M tokens,输出 $7.5 / 1M tokens。这不算低价跑量模型,但也没有冲到 Claude / GPT 的最高价层。
- Mistral 官方公开 benchmark 里最值得看的不是泛泛的“更强了”,而是
77.6% SWE-Bench Verified和91.4 on τ³-Telecom,这说明它重点在 Agent 编码和长任务执行,不是只卖聊天体验。 - 如果你现在主要在比较
Claude Code、Codex、Qwen、DeepSeek这些路线,Mistral Medium 3.5最值得看的不是“欧洲也有一个大模型”,而是 开放权重 + 远程 Agent + Work mode 这套组合。 - 对中国用户来说,它今天不一定是最容易落地的默认主力层,因为本地社区、中文资料、价格敏感型 API 和国内工作流接入上,
Qwen与DeepSeek仍然更顺手;但如果你关心 欧洲合规、开放权重、企业私有化和代码 Agent,它非常值得进候选名单。 - 一句话判断:
- 普通开发者:先把它当值得跟踪的开放权重高端模型。
- 进阶 Agent 用户:重点看
Vibe remote agents、Le Chat Work mode和reasoning effort。 - 站长、工具团队和企业:重点看它能不能在 自托管、可审计和多工具编排 之间给出更平衡的路线。
如果你要把它放回站内模型路线里看,建议顺手看:
- DeepSeek V4 Pro 和 Flash 怎么分层
- Qwen3.6-27B 和 35B-A3B 怎么选
- Qwen3.6-35B-A3B 本地部署显卡指南
- Claude Code 限额翻倍后怎么选
- Codex vs Cursor vs GitHub Copilot
同方向标杆页面怎么写,我们补了什么?
这次同方向最值得研究的页面,主要有三类:
- Mistral 官方
model card,把关键购买信息压得很短:256k、$1.5 / $7.5、Modified MIT license、agentic and coding use cases。 - Mistral 官方
Vibe remote agents博客,不先讲愿景,而是先告诉开发者:默认模型换了、远程 Agent 上线了、Le Chat 里能跑 Work mode 了。 - Hugging Face 官方模型卡,会把工程团队最在意的
reasoning effort、多语言、函数调用、Agent benchmark 和许可范围一次列出来。
这些标杆共同做对的一件事是:
先讲能不能接住真实工程任务,再讲“这是个多大参数的模型”。
站内这篇补的,是中文用户最缺的三层判断:
- 它适合放在你的哪一层,而不是只看 benchmark。
开放权重、API、Vibe remote agents三条线分别意味着什么。- 中国团队今天什么时候该试,什么时候该继续用
Qwen / DeepSeek / Claude / Codex。
Mistral Medium 3.5 到底发布了什么?
先把事实说清楚。
按 Mistral 官方公开页面,Mistral Medium 3.5 现在最关键的公开信息有 7 个:
- 它是
128B dense模型,不是 MoE。 - 它支持
256K context window。 - 它是
multimodal,支持文本和图像输入、文本输出。 - 它用
Modified MIT许可发布开放权重,不是完全无条件的传统 MIT。 - 它的
reasoning effort可以按请求配置,不是把推理和快答拆成完全不同型号。 - 它已在
Le Chat里替代旧的中高端路线,并在Mistral Vibe里替代Devstral 2。 - 官方公开价格是
input $1.5 / 1M tokens、output $7.5 / 1M tokens。
这些点放在一起,真正的含义不是“又多了个欧洲模型”,而是:
Mistral 正在把 开放权重旗舰、代码 Agent、远程执行和企业工作模式 收到一条更完整的产品线上。
这次最值得看的,不是参数,而是“统一模型 + 远程 Agent”
很多人看 Mistral Medium 3.5 第一眼会被两个点吸引:
- 128B
- 开放权重
但真正更重要的,是它后面跟着的两条产品动作:
Mistral Vibe remote agentsLe Chat Work mode
为什么这比参数更重要?
因为官方自己已经把判断重点写出来了:
- 它成了
Vibe的默认编码模型。 - 它支持 agent 级工具调用和结构化输出。
- 它能在云端持续跑长任务,并允许多个 session 并行。
也就是说,Mistral 不是只在卖一个“能下载的模型”,而是在卖一整条更适合工程团队的路线:
- 本地或私有化可以考虑开放权重。
- 需要云端长任务时,可以接
Vibe remote agents。 - 需要跨工具复杂任务时,可以进
Le Chat Work mode。
哪些团队最该试,哪些团队不该急着换?
1. 最值得优先试的人
更适合优先测试 Mistral Medium 3.5 的,通常有这些特征:
- 你已经在认真评估代码 Agent,而不是只用聊天工具问几句。
- 你希望保留
开放权重或自托管路线,不想完全押注闭源 API。 - 你做的是长任务、异步任务、多工具任务,比如大规模改代码、测例补全、CI 调查、文档整理。
- 你所在团队对
欧洲合规、私有化、可审计或供应商分散有明确要求。
2. 不该马上全量迁移的人
如果你属于下面这些情况,今天更该观察,而不是立刻替掉现有主力:
- 你最看重的是中文效果和国内社区经验。
- 你当前预算极度敏感,需要比
$1.5 / $7.5更低的 API 分层。 - 你已经在
Claude Code、Codex或国内模型上跑出了稳定效率。 - 你需要的是“开箱即用的产品成熟度”,而不是一条更灵活的工程路线。
中国用户今天更现实的判断方式
如果你是中文开发者或工具团队,今天看 Mistral Medium 3.5 最稳的顺序不是先看参数,而是:
- 你更需要
开放权重还是更需要低价 API。 - 你更需要
欧洲 / 企业合规,还是更需要中文生态和本地社区。 - 你是真要做
Agent 编码,还是只是想找一个通用聊天替代。
如果你的答案更偏:
- 中文优先
- 低价优先
- 社区资料多优先
- 国内 API 接入顺手优先
那今天更实际的路线通常还是:
QwenDeepSeek- 或者继续用闭源高质量编码入口
如果你的答案更偏:
- 私有化
- 欧洲部署
- 多工具 Agent
- 长任务远程执行
那 Mistral Medium 3.5 就值得认真进 shortlist。
它更像谁的替代项,不像谁的替代项?
更像替代“分裂的工程路线”
它最可能替代的是这种分裂结构:
- 一个开放模型做私有化
- 一个闭源模型做高质量代码推理
- 一个单独 Agent 框架做异步任务
因为 Mistral 现在试图把这些层收得更近。
不像“直接替掉所有闭源编码工具”
它今天还不该被理解成:
- 立刻替掉所有
Claude Code - 立刻替掉所有
Codex - 立刻替掉所有
Cursor
原因也很直接:
- 产品成熟度、团队协作、插件生态和默认体验,不只看模型。
- 中国团队真实落地时,还要看文档、连接器、账号体系和社区实践。
- 开放权重带来的灵活性,不自动等于最低总成本。
为什么 77.6% SWE-Bench Verified 很重要,但不能单独决定一切?
Mistral 官方把 77.6% SWE-Bench Verified 放得很靠前,这是合理的,因为它直接对应代码修复和 Agent 编码能力。
但你今天不能只拿这个数就做采购决策,原因有三个:
SWE-Bench Verified更像“解决真实代码问题的上限信号”,不等于你团队今天的真实完成率。- 工程团队的总成本,不只取决于模型答对多少,还取决于:
- 能不能并行
- 能不能看 diff
- 能不能接现有工具
- 人工审批链顺不顺
- 你如果最终还是要自己托管、做权限边界、接内部系统,那真正成本不只在 token。
所以更稳的做法不是“看到 77.6% 就全换”,而是拿自己的真实仓库和任务做灰度测试。
站长和工具团队今天最值得看的,是“可审计的 Agent 路线”
对站长、开发平台团队和企业自动化团队来说,Mistral Medium 3.5 最值得看的不只是模型分数,而是这条路线:
- 开放权重
- 远程 Agent
- Work mode
- 可看 diff、可见工具调用、显式审批
这意味着它更像:
- 一个可被接进工程体系的执行层
- 而不只是一个聊天窗口里的聪明模型
如果你正在做:
- 自动修复
- 批量重构
- 测试补全
- 文档与代码联动
- 受权限约束的企业 Agent
那它的信号价值会大于“普通用户对话好不好聊”。
质量门槛判断
如果一篇 Mistral Medium 3.5 文章只会说“欧洲出了个 128B 开放模型”,那它通常不如官方模型卡有价值。
真正值得保留的判断页,至少要回答清楚:
- 它到底适合放在默认层、编码层还是远程 Agent 层。
开放权重、Vibe、Le Chat Work mode各自意味着什么。- 中国团队为什么不能只看 benchmark 就下结论。
- 它什么时候值得进 shortlist,什么时候继续观望更合理。
常见问题
Mistral Medium 3.5 是开源模型吗?
更准确地说,它是 open weights,并采用 Modified MIT 许可。它不是“毫无额外约束的传统 MIT 代码仓库”那种理解方式,企业在正式使用前仍然需要看清许可条款。
它现在最适合什么任务?
按 Mistral 官方公开描述,它最适合 agentic and coding use cases,包括长任务编码、结构化输出、多工具调用、远程异步执行和复杂工作模式,不是只做聊天回复。
4 张 GPU 就一定能低成本跑起来吗?
不能这么简单理解。官方说的是它能 self-host on as few as four GPUs,这说明它具备私有化可行性,但真实成本还要看你用什么 GPU、推理框架、量化方式、并发量和稳定性要求。
它现在就能替掉 Qwen 或 DeepSeek 吗?
不能一刀切。对中文优先、低价优先、国内工作流优先的团队,Qwen 和 DeepSeek 今天依然更容易落地;对看重开放权重旗舰、欧洲路线和远程 Agent 的团队,Mistral Medium 3.5 才更值得测试。
这篇文章的首图来源是什么?
首图是本站自制信息图,文件位于 /article-images/mistral-medium-3-5-guide-2026-05-22.svg。视觉依据来自 Mistral 官方模型卡、Vibe remote agents 公告和 Hugging Face 官方模型卡中的 128B、256K、价格、许可与 Agent 路线信息整理,没有嵌入来源不明图片。
资料来源
- Mistral Docs: Mistral Medium 3.5 model card
- Mistral AI: Remote agents in Vibe. Powered by Mistral Medium 3.5.
- Mistral Docs: Models overview
- Hugging Face: mistralai/Mistral-Medium-3.5-128B
- WinBuzzer: Mistral Medium 3.5 folds chat, reasoning and code into one 128B AI model