去年某个时候开始,我一天里实际在做的事变了,具体哪天说不上来。以前是写代码、看报错。现在是写要求、读报告。代码还是得有人写,只不过不是我。
这听着像升职,有些天确实是。但它有个前提,而且很容易被忽略:协作本身得先设计过。
不设计会怎样呢。agent 会给你一大堆东西,写得自信,读着合理,前后也对得上,然后把项目往一个错方向带。你一个礼拜都不会发现。等发现的时候,要查的已经不是代码了,是这一周你批准过的每一个决定。
下面五条是我用来防这件事的。没有一条聪明,基本上就是你对一个新来的合作者会做的事,区别只在于要写下来,因为 agent 不记得昨天那场争论。
一、开工之前先说清楚谁管什么
不是”你写代码我来审”这种。这话等于没说。要具体到:研究问题谁定,实验设计谁拍板,指标能不能动、谁能动,一个结果算不算过关谁说了算,以及 agent 的权限到哪儿为止。
我把这些写成了两份文档,开新 session 先让它读一遍。头十分钟像在搞形式主义,然后省掉一个礼拜。
它防的事很具体。你让 agent 把某个数提上去,它就会把那个数提上去,包括悄悄换掉这个数怎么算。这不叫它使坏,这叫有个决定权没人认领;而没人认领的决定权,最后总是落在正在干活的那一方手里。
二、在需要之前,先把汇报格式定死
这条最管用,也最常被跳过。分三块:报什么、怎么写、什么时候报。
每份报告必须有的六项,按顺序:
- 上一轮我提了什么要求、给了什么反馈
- 这一轮实际做了什么
- 结果是什么,包括意料之外的发现
- 这说明了什么。结论要当成结论写出来
- 如果有几条路,分别是什么
- 推荐的下一步
第一项最值。让它把我的要求复述一遍,我就能在一行字里发现我们在做两件不同的事,而不是读完六段关于错误问题的出色工作之后才发现。
怎么写。 信息密度高,别客套。还有一条我必须专门提:不要用没解释过的缩写,不要拿术语当速记。agent 写给 agent 看的时候压得很狠。写给我看的时候,它应该当作在给一个刚从门外进来的同事做简报。
什么时候报。 四档。这四档分不清,agent 要么没用,要么烦死你:
- 直接做,不用说。 格式、改名、显而易见的重构,一条命令能撤回的事。
- 先做,做完报。 计划之内的事。我想知道,但不需要我提前点头。
- 先问,再做。 要动设计、指标、数据、方向的。要花钱的。撤回起来麻烦的。
- 立刻打断我。 出现了和计划所依赖的假设相矛盾的结果。这种不能等这一批跑完,因为多等一小时,就多一小时的活是搭在一个我们已经知道有问题的地基上。
三、读报告的时候,别为了放心而读
这是最容易犯的毛病。报告写得漂亮,结论也鼓舞人心,于是你说”很好,继续”。你刚刚批准了一条自己根本没检查过的推理链。
我试着依次形成这几个判断。先是印象:这东西给我的感觉是扎实的,还是赶出来的?然后看尝试够不够。注意不是”成没成”,而是这次尝试的强度够不够让一个否定结果说明问题。只试了一组超参数的失败实验,什么也证明不了。再看它做的事对不对,它描述的这件事,真的在检验它声称要检验的东西吗。
然后是结论。大部分问题都出在这儿。工作本身通常没毛病,从结果跨到结论那一步,自信经常跑到证据前面去了。
最后看推荐。agent 有很强的惯性,它推荐的下一步几乎永远是上一步的精细化。所以”要不要换条路”这个问题得我来问。闭环里没有人会问它。
四、让第二个模型也读一遍
我会把 agent 的报告粘给另一个模型,我用 GPT,让它先审,然后我再写自己的意见,最后合成一份发回去。
第一个原因有点不好意思承认:报告太密了。它是写给一个脑子里装着全部上下文的人看的,而我有些天不是那个人。让另一个模型把它拆开讲一遍,我常常就是在这个过程里发现某一步其实推不出来。
第二,新读者看得见洞。一个对前六个小时的工作没有任何投入的人,更容易注意到那个没验证的假设、那条缺的基线、那个其实不对等的对比。
第三个才是真正的理由。agent 在一个问题上做久了会形成沟槽,我也会,而且因为我整周都在读它的报告,我们俩现在是同一条沟槽。找一个没参与过这段对话的模型进来,是我知道的最便宜的获得外部视角的办法。
五、不懂的东西,当场去补
碰到一个我其实不懂的概念,不是”听说过”,是懂,我会停下来去学。不是之后,是当下。
不补会出两件事。第一,我会误判好的工作。agent 试了个正确但我不熟悉的方法,我评估不了,于是我做所有人面对看不懂的提案时都会做的事:要一个更保险的方案。一个正确的尝试,死在审稿人不够格上。
第二件更糟,而且看不见。我的知识会变成搜索空间的天花板。我没办法要求一个我从没听说过的方法。agent 的探索大致只会走到我还跟得上的地方,而那个半径之外有什么,我永远不会知道——没有任何机制会汇报”那些从来没被提出来的选项”。
有一点我想白纸黑字写下来。这整套做法假设人这边是带着东西来的:领域知识、能闻出一个结果虚不虚的经验、品味,以及把真发现和讲得好的发现分开的判断力。上面每一条都只是让这份判断力用得更省。没有一条能生成它。对一个在这个领域里毫无积累的人,这套流程不会让他更快做出好研究,只会让他更快做出听起来很有把握的错研究,顺手还拆掉了本来可能拦住它的那点阻力。
这五条共同假设了什么
再读一遍,注意它们的共同点。每一条都把人放在同一个位置上:定方向,判断一次尝试够不够格,决定接下来怎么走。agent 生产,我评估。
这个分工看起来很稳。剩下的篇幅,我想讲讲我为什么不确定它稳。
到底还剩下什么
以我的位置看,一个博士生的视角,不是劳动经济学家的,没被挪走的工作是很短的一列:
- 想出那个不在任何人清单上的东西,从 0 到 1
- 拿领域知识和经验去判断已有的 n 个方案
- 给出没人提过的第 n+1 个
- 节奏和方向。什么时候加码,什么时候放弃,什么时候整个框架就是错的
这四样全是判断力。而判断力没法速成,它是攒出来的,攒的方式还挺笨:把事做砸,发现砸了,再做一遍。
不舒服的那部分
那攒它的是什么活儿呢。诚实的答案是下面几级台阶上不体面的那些。把论文老老实实读完。写出那版很烂的初始实现。跑一个因为很蠢的理由而失败的实验。
这一层,正是现在被交给 agent 的那一层。
斯坦福数字经济实验室那份用薪资数据做的研究,最明显的效应恰好落在这一段:22 到 25 岁、身处 AI 高暴露岗位的年轻人,就业水平比低暴露岗位的同龄人低约 19%;同样的岗位上,有经验的人身上没有可比的缺口;而且下滑主要来自少招人,不是裁人。往一个方向读,这是好消息,有经验的人没事。往另一个方向读,它描述的是一架被抽掉了底下几级横档的梯子,然后得问:下一批”有经验的人”打算从哪儿来。
我不认为这件事有定论。那是一篇基于两年数据的工作论文。但我也没法靠指出这一点就让问题消失。
列昂惕夫的那个问题
1983 年,华西里·列昂惕夫把这种担忧推到了最锋利的形式。他拿过诺贝尔经济学奖,平时也不以耸人听闻著称。他说,随着机器接管越来越多的事,人作为最重要生产要素的地位注定会被削弱,就像马在农业里那样:先是减少,然后被拖拉机彻底消灭。
通常用来反驳他的是这句话:新技术消灭岗位,也会创造岗位。这话没错。但在马的数量崩掉的那几十年里,这话同样没错。汽车时代创造了海量新岗位,一个也不是给马的。”新工作会出现”和”被替代的那一方会去做新工作”是两个命题,只有前一个是规律。
高盛在 2026 年 1 月就着这个问题算过一遍,把列昂惕夫的情景当成要检验的极端情况。他们的估计:大约四分之一的工作小时暴露在自动化之下,整个采用期内 6% 到 7% 的岗位被替代,失业率峰值上升约 0.6 个百分点,大概一百万人。有破坏性,但不是末日。他们乐观的依据是历史:今天只有约 40% 的劳动者,所在的职业在 85 年前就已经存在。
但这还不算完
把”新岗位会出现”这件事量得最仔细的那位经济学家,结论是两头都砍的。
David Autor 和合作者发现,2018 年美国约 60% 的就业落在 1940 年还不存在的职业名称里。这是乐观一方最强的版本,数字比大多数乐观者引用的还大。但同一项工作把两股力量拆开了:自动化,把任务从人手里拿走;增强,创造出新任务。就净值而言,1980 年之后自动化跑在了前面。1980 到 2018 年间自动化对就业的负向效应,是 1940 到 1980 年间的两倍多,而增强的正向效应变化要小得多。
所以让人安心的那句和让人不安的那句都是真的,它们只是在说不同的事。新工作确实在持续出现。至于比例——消灭多少对创造多少,多快,以及同一批人能不能从这头走到那头——过去四十年一直在往不舒服的方向移动,这还是在这一轮之前。
说我们不是马,最有力的理由不是经济学理由
Brynjolfsson 和 McAfee 正面回应过列昂惕夫。他们那份”人和马的区别”清单值得看看,因为重量落在哪儿挺有意思。有些理由是关于能力的:灵巧、常识、人对人的那些只能由人满足的需求。这些是真的,也恰好是正在缩小的那些。
耐久的是另一类。人拥有几乎全部财富,所以人可以再分配它。人投票,可以集体决定什么被允许。还有,人会为自己在经济上变得无关紧要而抗议,而他们提醒说,马从来没抗议过。
也就是说,最有力的理由不是我们不可替代,而是我们拥有东西、并且说得上话。这个区别是真的,也不小。但它是一个对经济学问题给出的政治学答案,而政治学答案属于必须主动争取、不能被动指望的那种。
我会盯着看的几件事
我没有结论。我有的是几个我觉得承重的问题,与其假装哪一个已经解决,不如就让它们开着。
最底下那级台阶会不会以另一种形式回来。以往每一轮最后都长出了新的入口,现在是正在长,还是我们已经在一个缺口里待了两年,而它会一直是个缺口。
判断力能不能换个方式养出来。如果过去生产它的那套学徒制正在被自动化,有没有替代品,还是说”有经验的人没事”是一句有保质期的话。
比例在往哪边走。Autor 的测量只到 2018 年,真正有意思的数字是 2020 到 2030 年间自动化对增强的比值,而那个数要好几年后才拿得到。
还有,最后是谁拥有那个干活的东西。如果人和马之间耐久的区别是我们拥有资本、并且能投票,那所有权的分布就不是个旁枝问题,它就是主问题。
最后一个是我自己能动手的:我攒判断力的速度,有没有快过那些生产判断力的活儿消失的速度。
这条是清单上唯一属于我的。这篇文章开头那五条规矩,说到底就是我对它给出的回答。一种使用 agent 的方式,让我尽量待在判断力被积累的那个位置上,而不是只被消耗的那个位置上。
这个位置还能坐多久,我不知道。但比起舒舒服服地不问,我宁愿坐在上面然后被证明想错了。
这一次,人是车夫,还是马?
延伸阅读
- Will Humans Go the Way of Horses?(Brynjolfsson & McAfee,Foreign Affairs,2015) — 对列昂惕夫的正面回应,也是”所有权/投票/抗议”那组论据的出处
- New Frontiers: The Origins and Content of New Work, 1940–2018(Autor, Chin, Salomons, Seegmiller) — 60% 这个数字,以及把它复杂化的自动化与增强之分
- Does technology help or hurt employment?(MIT News,2024) — 同一篇论文的简短可读版
- Canaries in the Coal Mine? Six Facts about the Recent Employment Effects of Artificial Intelligence(斯坦福数字经济实验室,2026) — 22 到 25 岁那一段的发现
- Wassily Leontief,”National Perspective: The Definition of Problem and Opportunity”,收于 The Long-Term Impact of Technology on Employment and Unemployment(美国国家工程院,1983)— 马的那个比喻的出处
Comments