SurviAGI
← 全部文章

2026 年 9 月 29 日至 10 月 7 日|“做判断”只值两美分了

9 月 29 日到 10 月 7 日这九天,我们读了 3400 多条帖子,留下约 240 件真正发生的事:11 家公司自己宣布了 68 件,其余来自测评机构和个人。单看每一件都是新闻,放在一起是五条线。

一、“决策模型”在一周内变成了一个品类

Perplexity 还晒了一张账单:让模型打通宝可梦火红的四天王和冠军,全程 137 次调用,花了 2.8 美分。

八天,四家,有开源、有降价、有免费,还能在本地跑。一个新品类刚出现就开始了价格战。

二、评测从“答题”变成“让它干一件长事”

能写出一万七千行证明,却管不好一台售货机。长活能不能交出去,取决于这件事错了有没有人兜着。

三、有人开始把日常杂事整件交给 agent

配套的东西在同一周出现:

先交出去的不是工作,是杂事。而支付公司和零售商已经开始为 agent 修路了。

四、在自己的机器上跑大模型

这条线上最大的一件事不是哪家公司发的。一位开发者做的开源推理引擎 Strata,把一千多亿参数的 Qwen3.8-Flash-Next 跑进了普通的游戏电脑。

  • 作者 @coldniko 的原帖说:一台便宜的旧 DDR3 机器,64GB 或 128GB 内存,接一块 8GB 以上的显卡,每秒能出 70 个以上的词元。第二天他又把输出速度从每秒 64.5 提到了 76.4。
  • @Yacamochi_db 实测:87GB 的模型,单张 RTX 5090 每秒 120 到 150 个词元。
  • @rS_alonewolf 实测:RTX 5090 每秒 100 到 140,RTX 5070 Ti 每秒 50 到 70。
  • @daluoseo 实测:12GB 显存,每秒 96 个词元。
  • @chikitleung 在一块 8GB 的 RTX 4060 Ti 上跑到了每秒 38 个。

我们搜到的帖子里,有 39 个账号各自贴出了自己机器上的实测结果,主要来自日文和中文圈。

苹果芯片这边同样在动:

也有没做成的:@Gimenorum 连续五次让一个压缩得更小的版本修同一个问题,没有修好。

一周之内,几十个人在各自的旧显卡上把同一个大模型跑了起来。门槛从服务器降到了游戏电脑。但九种部署方案里七种会漏数据,说明跑得起来和用得放心还是两回事。

五、开放权重模型密集发布

  • Mistral 放出 Mistral Large 4 预览版:总参数一万亿,每次激活 490 亿,权重月底开放。OpenRouter 上的价格是每百万输入词元 0.68 美元。
  • Google 发布 EmbeddingGemma 2(它涉及的工作),7.4 亿参数,面向端侧。
  • Cristóbal Valenzuela 宣布了 Praxis-1,一个开放权重的机器人动作模型。
  • Perplexity 的决策模型也是开源的。
  • 新的非营利机构 Trillium Labs 成立,做开放的前沿模型训练方法。

一周之内,从万亿参数的大模型到手机上的嵌入模型,都有了能下载的版本。

你

以下是本期的判断和猜测,不是数据。

一,如果你的产品卖的是“帮人做选择”,这周它不再是产品了。 路由、分流、初筛、推荐、审核,这些在两美分面前都只是一个功能。你该问的不是“我的判断准不准”,而是“除了判断,我还握着什么”:数据、渠道,还是出了错由你负责。

二,你每周花在杂事上的那几个小时,会比你的本职工作先消失。 不是因为模型突然变聪明了,而是因为有人开始为 agent 修路。值机、报销、挂二手、填表,这些事的共同点是做错了能撤回。

三,别急着把整件长活交出去。 这周最好的模型经营一台售货机都只能算部分成功。现在能放心交的是“错了看得见、看见了能改”的事。判断标准很简单:如果它搞砸了,你多久能发现?

猜测:下一个被打到几美分的是语音。 Microsoft 的语音模型这周发布后很快出现在多个平台上,这通常是价格战的前奏。如果你的生意建立在“语音转写很贵”这个前提上,现在就该重算一遍。


数据截至 2026 年 10 月 7 日 10:32(UTC)。文中数字均出自发帖方本人的陈述,点击链接可看原帖。每条更新涉及哪些工作、到了哪一级,见[全部更新](/updates)和[职业](/occupations)。