编者按:本文来自微信公众号极客公园(ID:geekpark),作者:张勇毅,编辑:靖宇,创业邦经授权转载。

「AI 用多了,人会不会逐渐变笨?」
这应该是过去三年被讨论最多的一个迷思之一,从 ChatGPT 走红那天就有。吵了三年多,两边都拿不出像样的证据:
担心的人只有体感,不担心的人只有立场。
8 月 18 日,《经济学人》给这场争论补上了迄今最硬的一份证据。
报道的主角是 2.7 万名中国中学生。用上 AI 之后,他们的作业分数平均涨了 18%,写一份作业的时间从 64 分钟缩到 45 分钟。到这里全是好消息,直到月考卷子发下来:闭卷考试里,这批学生的成绩比不用 AI 的同学低了 20%。
作业分曾是最可靠的「晴雨表」:作业越好,考试越好。而在用 AI 的学生中间,作业分越高,基本等于 AI 用得越深。于是曲线变成了:用得越狠的孩子,考试跌得越惨。
作业分,第一次开始撒谎。

作业分超过 100 的人之中,不用 AI 的人分数上涨到了 112,用 AI 之后一路跳水到 64。|图片来源:经济学人
《经济学人》的数据底稿,是斯德哥尔摩大学和香港大学三位经济学家 6 月挂出的论文,标题就叫《生成式 AI 学习惩罚》。

《生成式 AI 学习惩罚》|图片来源:SSRN
样本来自中国中部一个县,人口超过一百万。论文特意强调它的普通:像沿海之外的大多数中国县城。26811 名初高中生,5 所初中、4 所高中,装下当地九成中学生,从 2022 年 9 月跟到 2025 年 6 月,整整 30 个月。
这个县的作业在线上提交,系统记下每个人的用时;月考、中考、高考的成绩都进数据库——写多快、考多好,第一次成了直接测量的硬数据。谁在用 AI,则来自回收率超过 96% 的全员问卷。
2022 年 9 月,用 AI 的学生几乎为零。到 2025 年 6 月,这个数字是 80%。这条曲线有两次明显跳升,分别踩在 DeepSeek V2.5 和 R1 的发布点上。工具全是熟面孔:豆包、DeepSeek、文心一言、通义千问。

采纳曲线的两次跳升,都踩在 DeepSeek 发版上|图片来源:CEPR
结论就是开头那组数字:作业 +18%,用时 −30%,月考 −20%,相当于 1.4 个标准差。惩罚在各科并不均匀:社科类最重,跌 27%;数学 22%;英语 17%;语文最轻,9%。初中生比高中生惨四成,男生比女生惨。
看来变笨这件事也不优待聪明人:恰恰是原来成绩最好的那批孩子,跌得最狠。
升学考试的账要算得更小心。6 月底这项研究在中文互联网刷屏时,传播最广的说法是「中考暴跌 24%、高考暴跌 18%」。论文里的原意克制得多:这是用满两年以上学生的完整惩罚,全体 AI 用户的平均效应只有 7% 左右。
但这份「克制」本身才是更坏的消息:惩罚需要两年才长满。作者们专门点了一句,眼下那些几星期、几个月的短期研究,都在系统性低估 AI 的学习成本。
消失的模范生
这项研究 6 月刚出现时,英文讨论中其实还有一个安慰性的结论:有两成学生用 AI 但不外包作业,成绩没受损。所以问题不在 AI,在用法。
论文确实说了前半句。它给「外包」下了一个数值上的定义:作业用时少于 50 分钟算「内包」,少于 45 分钟才算是真「外包」。
刚开始用 AI 的学生里,外包的占 58%。而那些照常花时间写作业、只拿 AI 当家教的孩子,考试成绩和不用 AI 的同学几乎没有差别。
论文甚至发现,在 50 到 65 分钟的重叠区间里,两类孩子花同样的时间,考出几乎一样的分数。AI 本身不带毒性,毒性全在省下来的那段时间里。
如果论文停在这里,它就是一篇「工具无罪、用法有罪」的标准论文。
但论文其实更深一步地探讨了这个问题:用满 5 个月之后,外包的比例从 58% 涨到 81%,完全外包从 34% 涨到 50%。那批花 65 分钟以上认真写作业的「模范用户」,全部是刚上手不到 5 个月的新手。
以及采纳满 6 个月之后,没有一个 AI 学生的作业用时还超过 65 分钟。
26811 人的样本里,「好好用 AI」不是一种稳定的用法,是一个维持不到半年的过渡状态。论文作者的解释很短:AI 挤掉的,是强度最高的那部分努力。

用满六个月后,65 分钟以上的区间空了|图片来源:CEPR
它不是又一篇「AI 让成绩变差」的论文,它是在撕掉一个安慰的遮羞布:只要教会孩子正确使用,一切都会好起来。
数据给出的回答是,没有人能一直正确使用:毕竟作业分在涨,家长在群里点赞,老师看到的提交记录越来越整齐。每一个反馈都其实都在潜移默化中,形成一个畸形的激励机制:你做得很好,再快一点也没关系。
大人的考场
看到这里,这个研究似乎跟传统我们理解中、大脑已经发育健全的成年人关系不大。但同样的曲线,过去一年多,在成年人身上已经画了四次。
《柳叶刀·胃肠病学和肝病学》去年 8 月发表了一项波兰研究:四家内镜中心的 19 名资深医生,人均做过 2000 例以上肠镜,用了几个月 AI 辅助检查之后,回到没有 AI 的状态,腺瘤检出率从 28.4% 掉到 22.4%,相对下降 20%。

和中学生的月考,同一个数字。
这是医学界第一次在真实临床里测到「用 AI 之后,人的手艺生疏了」,主角还是这个星球上最不该被怀疑基本功的一群人。
第二次在写作者身上。麻省理工媒体实验室去年 6 月的脑电实验里,54 名学生戴着电极帽写作文。用 ChatGPT 那组的神经连接强度垫底,比纯靠自己写的那组最多低了 55%;写完不久,83% 的人连自己文章里的一句话都复述不出来。
研究团队给这个现象起了个名字:认知负债。
第三次在办公室里。微软研究院和卡内基梅隆大学去年调查了 319 名知识工作者,结论一句话就能说完:对 AI 输出越有信心的人,自己动脑核查的投入越少。
第四次在程序员身上。研究机构 METR 去年的对照实验里,资深程序员用上 AI 实测变慢了,自己却觉得快了 20%。今年 2 月它想复测,没做成,原因写在报告里:大多数开发者已经拒绝在没有 AI 的情况下工作。
和那个再也没人肯花 65 分钟写作业的教室,一模一样。

脱离 AI 之后,检出率没有回到从前|图片来源:METR
临床、脑电、问卷、对照实验,四次预警说的是同一件事:AI 在场,产出变好;AI 离场,能力变差。
回到开头那个吵了三年多的问题。这些研究给出的答案,比一句「会变笨」更难受:AI 没有降低任何人的智商,它是把「变聪明」的那道工序抽走了。分数照涨,产出照交,只是那份本该在 64 分钟里长出来的能力,没有长。
认知科学管这个叫「认知卸载」:把本该在自己脑子里跑的过程,交给外部工具。卸载不新鲜,计算器和导航都是。新鲜的是位置:AI 接走的不是运算和记路,是打草稿、试错、推演,恰好是心智模型长出来的那道工序。
落到日常工作上,这变化听着甚至像升级:从「写代码」变成「审代码」,从执行者变成把关人。
但把关的前提,是脑子里有一份自己的底稿。没亲手推演过的人,审的其实是个黑箱,AI 的逻辑链一旦错在深处,他连该从哪里起疑都不知道。学生的版本更简单:作业是草稿,考试是 Debug。草稿外包出去,Debug 那天就露馅。
区别只有一个。学生每个月都有一场闭卷考试,把这条曲线摆到台面上。而大多数成年人的工作,没有月考。
论文的最后留了一点余地。把时间拉长看,AI 学习惩罚正在收窄:同样用满 5 个月,2023 年初的学生平均损失 25%,2025 年 6 月只有 16%。

同样用满 5 个月,惩罚从 25% 收窄到 16%|图片来源:CEPR
师生在适应,工具侧其实也有人想办法,比如逼 AI 给答案时同步展示推演过程。但按作者们的判断,损失在变小,却没有归零的迹象。
9 月 1 日开学。全国的教室里,这场 26811 人的实验,会以更大的样本重跑一遍。
以后看到孩子的作业天天 100 分,也许得先问一句:这 100 分是孩子挣来的,还是豆包挣来的。
下一次把方案交给老板之前,这个问题,不妨也先问自己一遍。
本文为专栏作者授权创业邦发表,版权归原作者所有。文章系作者个人观点,不代表创业邦立场,转载请联系原作者。如有任何疑问,请联系editor@cyzone.cn。







