2026 年 10 月 5 日至 11 日|AI 交了 722 篇数学论文,法律任务只过 9.4%

这一周我们读了 276 个账号的 3700 多条帖子,留下约 100 件真正发生的事。上面这张榜是其中最受关注的六件,按原帖浏览量排列。下面分三段说:接手了什么,有什么影响,大家在争什么。
一、这周接手了什么
1. 软件工程师:回答不再是一段话,是一个能用的界面。 OpenAI 向所有人推出 GPT-6 和 Intelligent UI(它涉及的工作):ChatGPT 的回答可以是一个能点、能操作的界面,也可以是当场做出来的小工具。
2. 数学家:三小时,一篇数学论文。 OpenAI 公开了一批数学成果(它涉及的工作),由一个尚未发布的内部模型产出。
- 按读过发布内容的账号转述:722 篇稿件,归成 372 组结果,来自约 4,000 个研究问题,平均每个结果约三小时的计算。
- 很多证明已经转成 Lean,可以由机器核对。
- OpenAI 的 Mark Chen 说,这次运行相当于一周之内十年的数学进展;Noam Brown 说模型在一些研究问题上越过了顶尖人类专家,同时也说它的能力仍然参差不齐。
3. 设计师:一句话,一块实时看板。 Anthropic 的 Claude Dashboards 和 Claude Motion 开始测试(它涉及的工作):数据变成实时看板,想法变成动画讲解。同一周,Google Docs 里的 Gemini 把文字简报转成演示文稿。
4. 呼叫中心客服:涨了十五年的岗位,开始每年少 4%。 a16z 发了一张图:呼叫中心岗位连续 15 年每年增长约 4%,现在每年缩约 4%。数据来自 Revelio Labs。
5. 律师:交了卷,只过 9.4%。这一件没接住。 Artificial Analysis 和 Harvey 把法律 agent 基准升到 v1.1:交付物满足全部评分标准,并且没有实质性的错误陈述,才算过关。
- 第一名 Grok 4.7 只有 9.4%。
- 不加这道检查时,Muse Spark 1.3 以 26.7% 领先;加上之后剩 8.9%。三份看起来过关的里面,两份带着会误导读者的错误。
6. 医生:它先问诊,医生再接手。 Google 的问诊系统 AMIE 在一家真实诊所接了 100 位病人(它涉及的工作),0 次安全中止,90% 的诊断与医生一致,发表在《柳叶刀》。病人先和它谈,医生随后接手。
接住的几件有一个共同点:做完之后,有人或有东西能判断它对不对。证明可以交给机器核对,诊断有医生复核,看板一眼能看出对错。法律文书里一个写错的日期,读起来和写对的一样通顺。
二、有什么影响
数学家。
- Ethan Mollick 转述了几位数学家的第一手感受:问题是用人不会用的办法解出来的。两天后他又写道,至少一部分证明引出了很多人参与的快速接力改进。
- Epoch AI 统计,它跟踪的 18 个数学分支里有 3 个,过半的 arXiv 论文注明用了 AI;微分几何从 7 月的约 8% 到 9 月的约 57%。
呼叫中心。
- 美国劳工统计局的数字,按一位读者的整理:电话呼叫中心就业从 2025 年 9 月的 32.22 万降到 2026 年 8 月的 30.72 万,降 4.7%。他补了一句:这说明人数降了,不证明是 AI 造成的。
- Revelio 的研究还显示,在 12 个中等收入国家,招聘放缓的幅度大于离职。岗位是靠少招人缩下去的。
- 另一个方向的读数:有帖子引用一项 5,172 名客服的研究,AI 让最弱的人产出高 36%,顶尖的略降。
更多的人。
- McKinsey:到 2035 年美国的岗位可能比今天多,但约 1,100 万人需要换职业。
- Google Research 公布了一项对执业专利律师做了三个月的随机对照试验,同时测短期效率和长期技能的养成。
岗位数在降,留下的人里最弱的提升最大。两个读数说的是同一件事的两个阶段。
三、这周在争什么
这些问题这周都有了新的主张。每个问题可以投一票,每季度一次。
- AI 会取代大多数数学家吗? Kent Beck 问:我们证明定理,它证得更好,那我们现在是谁? 另一种回答是数学家转去解释 AI 给出的证明。
- AI 会取代大多数软件工程师吗? 主张最多的一个问题,多数人站在“需求大幅减少”一边,但没有一条是测量。
- AI 会取代大多数律师吗? 多数主张是“留下来,做更难的工作”。这周的 9.4% 是这个问题的第一条读数。
- 呼叫中心的工作岗位是在增加还是减少? 说“减少”的账号很多,但几乎都在转述同一张图。
- AI 会取代大多数销售代表吗? 两边都有人说。
- AI 代理会绕过爱彼迎直接订房吗? 这周新出现的问题。
你
以下是本期的判断和猜测,不是数据。
一,看你的工作,先问“我做错了,谁能发现、多快发现”。 能被机器或下一个环节很快验出来的活,会先被接手,数学就是这样到的今天。验不出来的活暂时安全,但原因不是 AI 做不了,而是没人敢信。
二,如果你做的是验不出对错的活,你的价值正在从“做”移到“担保”。 律师的签字、医生的复核,值钱的是有人为结果负责。
三,别把“它交出来了”当成“它做对了”。 法律任务里看起来过关的,三份有两份带错。把活交出去之前,先有一个你信得过的检查办法。
猜测:下一个出现“一周十年”的领域,会是另一个对错能自动判定的地方。 比如芯片验证、编译器、密码协议。
数据截至 2026 年 10 月 11 日 02:55(UTC)。浏览量是原帖在采集时的读数。数学发布的各项数字出自转述它的账号,以 OpenAI 的原文和仓库为准;其余数字出自发帖方本人的陈述。“被 AI 触及的工作”是机器对应的结果,没有经过人工审核。每条更新涉及哪些工作,见[全部更新](/updates);全部问题见[话题](/topics)。