SurviAGI
← 全部文章

2026 年 10 月 5 日至 11 日|AI 交了 722 篇数学论文,法律任务只过 9.4%

这一周,AI 接手了什么:周榜与七周时间轴

这一周我们读了 276 个账号的 3700 多条帖子,留下约 100 件真正发生的事。上面这张榜是其中最受关注的六件,按原帖浏览量排列。下面分三段说:接手了什么,有什么影响,大家在争什么。

一、这周接手了什么

1. 软件工程师:回答不再是一段话,是一个能用的界面。 OpenAI 向所有人推出 GPT-6 和 Intelligent UI(它涉及的工作):ChatGPT 的回答可以是一个能点、能操作的界面,也可以是当场做出来的小工具。

2. 数学家:三小时,一篇数学论文。 OpenAI 公开了一批数学成果(它涉及的工作),由一个尚未发布的内部模型产出。

3. 设计师:一句话,一块实时看板。 Anthropic 的 Claude Dashboards 和 Claude Motion 开始测试(它涉及的工作):数据变成实时看板,想法变成动画讲解。同一周,Google Docs 里的 Gemini 把文字简报转成演示文稿。

4. 呼叫中心客服:涨了十五年的岗位,开始每年少 4%。 a16z 发了一张图:呼叫中心岗位连续 15 年每年增长约 4%,现在每年缩约 4%。数据来自 Revelio Labs。

5. 律师:交了卷,只过 9.4%。这一件没接住。 Artificial Analysis 和 Harvey 把法律 agent 基准升到 v1.1:交付物满足全部评分标准,并且没有实质性的错误陈述,才算过关。

  • 第一名 Grok 4.7 只有 9.4%。
  • 不加这道检查时,Muse Spark 1.3 以 26.7% 领先;加上之后剩 8.9%。三份看起来过关的里面,两份带着会误导读者的错误。

6. 医生:它先问诊,医生再接手。 Google 的问诊系统 AMIE 在一家真实诊所接了 100 位病人(它涉及的工作),0 次安全中止,90% 的诊断与医生一致,发表在《柳叶刀》。病人先和它谈,医生随后接手。

接住的几件有一个共同点:做完之后,有人或有东西能判断它对不对。证明可以交给机器核对,诊断有医生复核,看板一眼能看出对错。法律文书里一个写错的日期,读起来和写对的一样通顺。

二、有什么影响

数学家。

  • Ethan Mollick 转述了几位数学家的第一手感受:问题是用人不会用的办法解出来的。两天后他又写道,至少一部分证明引出了很多人参与的快速接力改进。
  • Epoch AI 统计,它跟踪的 18 个数学分支里有 3 个,过半的 arXiv 论文注明用了 AI;微分几何从 7 月的约 8% 到 9 月的约 57%。

呼叫中心。

  • 美国劳工统计局的数字,按一位读者的整理:电话呼叫中心就业从 2025 年 9 月的 32.22 万降到 2026 年 8 月的 30.72 万,降 4.7%。他补了一句:这说明人数降了,不证明是 AI 造成的。
  • Revelio 的研究还显示,在 12 个中等收入国家,招聘放缓的幅度大于离职。岗位是靠少招人缩下去的。
  • 另一个方向的读数:有帖子引用一项 5,172 名客服的研究,AI 让最弱的人产出高 36%,顶尖的略降。

更多的人。

岗位数在降,留下的人里最弱的提升最大。两个读数说的是同一件事的两个阶段。

三、这周在争什么

这些问题这周都有了新的主张。每个问题可以投一票,每季度一次。

你

以下是本期的判断和猜测,不是数据。

一,看你的工作,先问“我做错了,谁能发现、多快发现”。 能被机器或下一个环节很快验出来的活,会先被接手,数学就是这样到的今天。验不出来的活暂时安全,但原因不是 AI 做不了,而是没人敢信。

二,如果你做的是验不出对错的活,你的价值正在从“做”移到“担保”。 律师的签字、医生的复核,值钱的是有人为结果负责。

三,别把“它交出来了”当成“它做对了”。 法律任务里看起来过关的,三份有两份带错。把活交出去之前,先有一个你信得过的检查办法。

猜测:下一个出现“一周十年”的领域,会是另一个对错能自动判定的地方。 比如芯片验证、编译器、密码协议。


数据截至 2026 年 10 月 11 日 02:55(UTC)。浏览量是原帖在采集时的读数。数学发布的各项数字出自转述它的账号,以 OpenAI 的原文和仓库为准;其余数字出自发帖方本人的陈述。“被 AI 触及的工作”是机器对应的结果,没有经过人工审核。每条更新涉及哪些工作,见[全部更新](/updates);全部问题见[话题](/topics)。