10 月 10 日,IT 之家报道:当地时间 10 月 9 日,微软上线了一个叫 Microsoft-Decision-1 的模型。它被归在「决策模型」这一类,官方说专为结构化决策任务打造,已经上架 Microsoft Foundry,也接进了 OpenRouter。

我第一眼看的是它的底座。

服务器机房里一排排机柜
服务器机房里一排排机柜

先说它是什么

按官方口径,Decision-1 和聊天那类大语言模型,是两种东西。它要解决的是「给结论」的活:批还是不批,放行还是拦下,选 A 还是选 B。这种活的特点是重复、量大、要求快。

原文的说法是,它在响应延迟和决策质量上表现顶尖,实际表现「全面超越大语言模型及其他传统决策模型」。这是微软自己的口径,我照录,没有独立验证。

桌上的玻璃沙漏
桌上的玻璃沙漏

官方给的几个数

微软说,在 36 项基准测试、涵盖近 15 万个「训练阶段完全隔离」的测试内容里,Decision-1 拿到了最高准确率。

速度上它排第一:比第二名 Quyet-1.0-Large 快 4.5 倍,比 GPT-6 Sol 快 35 倍。

35 倍。

这类数字都是在特定基准上测出来的,换个任务,差距多半不是这个量级。这话官方没说,是我加的。

价格是另一个看点。每百万 token 输入 0.042 美元,约合 0.28 元人民币,输出免费。

叠放在一起的硬币
叠放在一起的硬币

真正让人多看两眼的,是底座

官方写得很直白:Decision-1 是对 Qwen3.5-9B 做后训练做出来的。之后会以它为基础,往 Microsoft AI(MAI)、OpenAI 等其它底座迁移。

Qwen3.5-9B 是阿里的开源模型。9B 这个量级,放在今天不算大。

一家美国大厂,拿一个不算大的中国开源模型当底座,后训练出一个速度第一的决策模型。它连自研一个千亿参数大模型的功夫都省了,直接站在别人的底座上盖楼。这件事本身,比那 35 倍更值得琢磨。

至于它说明了什么,我不急着下结论。

残雪坡地上的木路标
残雪坡地上的木路标

安全这块,它也报了数

11 项安全基准,5,250 条请求,覆盖有害内容、越狱攻击、提示词注入。

官方结论是,能有效拦住这些恶意行为,同时保持很高的可用性。一样,这是自测数据,我没有复现。

港口堆叠的货运集装箱
港口堆叠的货运集装箱

我自己的判断

Decision-1 这类「只给结论」的模型,真正落地的地方,大概率是企业里那些要成千上万次重复判断的流程。判断成本压到每百万 token 三毛上下,这笔账确实好算。像风控初筛、工单分流、内容初判这类重复活,正好对得上这种模型的脾气。

有两处得留神。它准不准,目前只有官方基准,还没看到第三方复现;底座和迁移路线都攥在微软手里,对使用者来说就是个黑盒。这两条是我的看法,报道里没有。

至于普通用户,短期内多半感受不到,这类模型更多是在后台跑。你甚至不会知道它在替谁做判断,这算好事还是坏事,我也说不好。

夜里的旧台灯
夜里的旧台灯

你会用这种「只给结论」的模型吗?在什么场景下?