2026 年 9 月 29 日至 10 月 7 日|“做判断”只值两美分了
9 月 29 日到 10 月 7 日这九天,我们读了 3400 多条帖子,留下约 240 件真正发生的事:11 家公司自己宣布了 68 件,其余来自测评机构和个人。单看每一件都是新闻,放在一起是五条线。
一、“决策模型”在一周内变成了一个品类
- 9 月 29 日,OpenAI 推出 Decisions API(它涉及的工作),限量预览,用途写得很直白:实时分类、路由、替 agent 选下一步动作。
- 10 月 1 日,Perplexity 开源了自己的决策模型并上线 API,每百万输入词元 4 美分,输出免费。
- 同一天,@svpino 介绍了 Nace AI 的 Drex 1.5,按他的说法是 128k 上下文、同样 4 美分。
- Inception 的 Mercury Decide 上了 OpenRouter,早期免费。
- Ollama 宣布支持在本地运行决策模型。
- 10 月 6 日,OpenAI 向所有开发者开放。同一天 Perplexity 把价格砍到 2 美分。
Perplexity 还晒了一张账单:让模型打通宝可梦火红的四天王和冠军,全程 137 次调用,花了 2.8 美分。
八天,四家,有开源、有降价、有免费,还能在本地跑。一个新品类刚出现就开始了价格战。
二、评测从“答题”变成“让它干一件长事”
- Vals AI 让 Gemini 4 Argon 玩坎巴拉太空计划,从入轨到登陆多个天体再返回。成了。
- Vals AI 让十个 Claude Sonnet 5.5 agent 证明一道数学题:球面上七个电子的最低能量排布。15 小时内交出一份 17,895 行的形式化证明。
- Perplexity 让自家的 agent 从头做一个浏览器里的开放世界游戏,做出来了,花掉约 2000 美元的额度。
- 让 Gemini 4 Argon 经营一台自动售货机,只成了一部分。
- @johnowhitaker 让 GPT-6.1 Sol 用 CAD 画一个简单的电机支架,也只成了一部分。
能写出一万七千行证明,却管不好一台售货机。长活能不能交出去,取决于这件事错了有没有人兜着。
三、有人开始把日常杂事整件交给 agent
- @doodlestein 把卖二手显卡整件交了出去:查近期成交价、写商品描述、上架、跟踪,卖掉了 12 件。
- @svpino 让 agent 办了值机、转了 PayPal 余额、整理了表格、汇总了邮件。
- @sayashk 连续几天用高速档填表和做简单编码,一周的额度两个小时左右就用完了。
配套的东西在同一周出现:
- Stripe 拉上 Meta、Shopify、沃尔玛等几家,推出个人 agent 协议,定的是 agent 怎么和商家打交道。
- 10 月 7 日,阿里云和 Sui 合作做 agent 支付。
- Every 在 Slack 里上线了“agent 同事”,每月 30 美元。
- Nativ 0.4 加入了在本机上浏览网页和操作电脑。
先交出去的不是工作,是杂事。而支付公司和零售商已经开始为 agent 修路了。
四、在自己的机器上跑大模型
这条线上最大的一件事不是哪家公司发的。一位开发者做的开源推理引擎 Strata,把一千多亿参数的 Qwen3.8-Flash-Next 跑进了普通的游戏电脑。
- 作者 @coldniko 的原帖说:一台便宜的旧 DDR3 机器,64GB 或 128GB 内存,接一块 8GB 以上的显卡,每秒能出 70 个以上的词元。第二天他又把输出速度从每秒 64.5 提到了 76.4。
- @Yacamochi_db 实测:87GB 的模型,单张 RTX 5090 每秒 120 到 150 个词元。
- @rS_alonewolf 实测:RTX 5090 每秒 100 到 140,RTX 5070 Ti 每秒 50 到 70。
- @daluoseo 实测:12GB 显存,每秒 96 个词元。
- @chikitleung 在一块 8GB 的 RTX 4060 Ti 上跑到了每秒 38 个。
我们搜到的帖子里,有 39 个账号各自贴出了自己机器上的实测结果,主要来自日文和中文圈。
苹果芯片这边同样在动:
- @hxiao 在一台 M3 Ultra 上本地跑同一个模型,每秒约 75 个词元,而七月还只有 20 到 25。
- @ivanfioravanti 用 92 个 agent 场景测了 9 种本地部署方案,最高分 92。同时发现其中 7 种会泄露别的租户的数据。
- llama.cpp 发布了 0.6.0;Artificial Analysis 开源了一套专测本地机器跑 agent 的基准。
也有没做成的:@Gimenorum 连续五次让一个压缩得更小的版本修同一个问题,没有修好。
一周之内,几十个人在各自的旧显卡上把同一个大模型跑了起来。门槛从服务器降到了游戏电脑。但九种部署方案里七种会漏数据,说明跑得起来和用得放心还是两回事。
五、开放权重模型密集发布
- Mistral 放出 Mistral Large 4 预览版:总参数一万亿,每次激活 490 亿,权重月底开放。OpenRouter 上的价格是每百万输入词元 0.68 美元。
- Google 发布 EmbeddingGemma 2(它涉及的工作),7.4 亿参数,面向端侧。
- Cristóbal Valenzuela 宣布了 Praxis-1,一个开放权重的机器人动作模型。
- Perplexity 的决策模型也是开源的。
- 新的非营利机构 Trillium Labs 成立,做开放的前沿模型训练方法。
一周之内,从万亿参数的大模型到手机上的嵌入模型,都有了能下载的版本。
你
以下是本期的判断和猜测,不是数据。
一,如果你的产品卖的是“帮人做选择”,这周它不再是产品了。 路由、分流、初筛、推荐、审核,这些在两美分面前都只是一个功能。你该问的不是“我的判断准不准”,而是“除了判断,我还握着什么”:数据、渠道,还是出了错由你负责。
二,你每周花在杂事上的那几个小时,会比你的本职工作先消失。 不是因为模型突然变聪明了,而是因为有人开始为 agent 修路。值机、报销、挂二手、填表,这些事的共同点是做错了能撤回。
三,别急着把整件长活交出去。 这周最好的模型经营一台售货机都只能算部分成功。现在能放心交的是“错了看得见、看见了能改”的事。判断标准很简单:如果它搞砸了,你多久能发现?
猜测:下一个被打到几美分的是语音。 Microsoft 的语音模型这周发布后很快出现在多个平台上,这通常是价格战的前奏。如果你的生意建立在“语音转写很贵”这个前提上,现在就该重算一遍。
数据截至 2026 年 10 月 7 日 10:32(UTC)。文中数字均出自发帖方本人的陈述,点击链接可看原帖。每条更新涉及哪些工作、到了哪一级,见[全部更新](/updates)和[职业](/occupations)。