越会用 AI 的人,学习能力退化得越快

一、两边都拿不出像样的证据

1、两边都拿不出像样的证据

这应该是过去三年被讨论最多的一个迷思之一,从ChatGPT走红那天就有。吵了三年多,两边都拿不出像样的证据:

8月18日,《经济学人》给这场争论补上了迄今最硬的一份证据。

报道的主角是2.7万名中国中学生。

用上AI之后,他们的作业分数平均涨了18%,写一份作业的时间从64分钟缩到45分钟。

到这里全是好消息,直到月考卷子发下来:闭卷考试里,这批学生的成绩比不用AI的同学低了20%。

作业分曾是最可靠的「晴雨表」:作业越好,考试越好。而在用AI的学生中间,作业分越高,基本等于AI用得越深。

于是曲线变成了:用得越狠的孩子,考试跌得越惨。

作业分超过100的人之中,不用AI的人分数上涨到了112,用AI之后一路跳水到64。|图片

2、《经济学人》的数据底稿

《经济学人》的数据底稿,是斯德哥尔摩大学和香港大学三位经济学家6月挂出的论文,标题就叫《生成式AI学习惩罚》。

样本来自中国中部一个县,人口超过一百万。论文特意强调它的普通:像沿海之外的大多数中国县城。

26811名初高中生,5所初中、4所高中,装下当地九成中学生,从2022年9月跟到2025年6月,整整30个月。

这个县的作业在线上提交,系统记下每个人的用时;

月考、中考、高考的成绩都进数据库——写多快、考多好,第一次成了直接测量的硬数据。

谁在用AI,则来自回收率超过96% 的全员问卷。

2022年9月,用AI的学生几乎为零。到2025年6月,这个数字是80%。

这条曲线有两次明显跳升,分别踩在DeepSeek V2.5和R1的发布点上。

二、工具全是熟面孔与通义千问

1、工具全是熟面孔与通义千问

工具全是熟面孔:豆包、DeepSeek、文心一言、通义千问。

采纳曲线的两次跳升,都踩在DeepSeek发版上|图片

结论就是开头那组数字:作业 +18%,用时 −30%,月考 −20%,相当于1.4个标准差。

惩罚在各科并不均匀:社科类最重,跌27%;数学22%;英语17%;语文最轻,9%。

初中生比高中生惨四成,男生比女生惨。

看来变笨这件事也不优待聪明人:恰恰是原来成绩最好的那批孩子,跌得最狠。

升学考试的账要算得更小心。6月底这项研究在中文互联网刷屏时,传播最广的说法是「中考暴跌24%、高考暴跌18%」。

论文里的原意克制得多:这是用满两年以上学生的完整惩罚,全体AI用户的平均效应只有7% 左右。

2、作者们专门点了一句

但这份「克制」本身才是更坏的消息:惩罚需要两年才长满。作者们专门点了一句,眼下那些几星期、几个月的短期研究,都在系统性低估AI的学习成本。

这项研究6月刚出现时,英文讨论中其实还有一个安慰性的结论:有两成学生用AI但不外包作业,成绩没受损。所以问题不在AI,在用法。

论文确实说了前半句。它给「外包」下了一个数值上的定义:作业用时少于50分钟算「内包」,少于45分钟才算是真「外包」。

刚开始用AI的学生里,外包的占58%。而那些照常花时间写作业、只拿AI当家教的孩子,考试成绩和不用AI的同学几乎没有差别。

论文甚至发现,在50到65分钟的重叠区间里,两类孩子花同样的时间,考出几乎一样的分数。AI本身不带毒性,毒性全在省下来的那段时间里。

如果论文停在这里,它就是一篇「工具无罪、用法有罪」的标准论文。

但论文其实更深一步地探讨了这个问题:用满5个月之后,外包的比例从58% 涨到81%,完全外包从34% 涨到50%。

那批花65分钟以上认真写作业的「模范用户」,全部是刚上手不到5个月的新手。

三、以及采纳满6个月之后

1、以及采纳满6个月之后

以及采纳满6个月之后,没有一个AI学生的作业用时还超过65分钟。

26811人的样本里,「好好用AI」不是一种稳定的用法,是一个维持不到半年的过渡状态。论文作者的解释很短:AI挤掉的,是强度最高的那部分努力。

它不是又一篇「AI让成绩变差」的论文,它是在撕掉一个安慰的遮羞布:只要教会孩子正确使用,一切都会好起来。

数据给出的回答是,没有人能一直正确使用:毕竟作业分在涨,家长在群里点赞,老师看到的提交记录越来越整齐。

每一个反馈都其实都在潜移默化中,形成一个畸形的激励机制:你做得很好,再快一点也没关系。

看到这里,这个研究似乎跟传统我们理解中、大脑已经发育健全的成年人关系不大。但同样的曲线,过去一年多,在成年人身上已经画了四次。

《柳叶刀·胃肠病学和肝病学》去年8月发表了一项波兰研究:四家内镜中心的19名资深医生,人均做过2000例以上肠镜,用了几个月AI辅助检查之后,回到没有AI的状态,腺瘤检出率从28.4% 掉到22.4%,相对下降20%。

2、第二次在写作者身上

这是医学界第一次在真实临床里测到「用AI之后,人的手艺生疏了」,主角还是这个星球上最不该被怀疑基本功的一群人。

第二次在写作者身上。麻省理工媒体实验室去年6月的脑电实验里,54名学生戴着电极帽写作文。

用ChatGPT那组的神经连接强度垫底,比纯靠自己写的那组最多低了55%;

写完不久,83% 的人连自己文章里的一句话都复述不出来。

第三次在办公室里。微软研究院和卡内基梅隆大学去年调查了319名知识工作者,结论一句话就能说完:对AI输出越有信心的人,自己动脑核查的投入越少。

第四次在程序员身上。研究机构METR去年的对照实验里,资深程序员用上AI实测变慢了,自己却觉得快了20%。

今年2月它想复测,没做成,原因写在报告里:大多数开发者已经拒绝在没有AI的情况下工作。

临床、脑电、问卷、对照实验,四次预警说的是同一件事:AI在场,产出变好;AI离场,能力变差。

四、回到开头那个吵了三年多

1、回到开头那个吵了三年多

回到开头那个吵了三年多的问题。

这些研究给出的答案,比一句「会变笨」更难受:AI没有降低任何人的智商,它是把「变聪明」的那道工序抽走了。

分数照涨,产出照交,只是那份本该在64分钟里长出来的能力,没有长。

认知科学管这个叫「认知卸载」:把本该在自己脑子里跑的过程,交给外部工具。卸载不新鲜,计算器和导航都是。

新鲜的是位置:AI接走的不是运算和记路,是打草稿、试错、推演,恰好是心智模型长出来的那道工序。

落到日常工作上,这变化听着甚至像升级:从「写代码」变成「审代码」,从执行者变成把关人。

但把关的前提,是脑子里有一份自己的底稿。

2、Debug那天就露馅

没亲手推演过的人,审的其实是个黑箱,AI的逻辑链一旦错在深处,他连该从哪里起疑都不知道。

学生的版本更简单:作业是草稿,考试是Debug。草稿外包出去,Debug那天就露馅。

区别只有一个。学生每个月都有一场闭卷考试,把这条曲线摆到台面上。而大多数成年人的工作,没有月考。

论文的最后留了一点余地。把时间拉长看,AI学习惩罚正在收窄:同样用满5个月,2023年初的学生平均损失25%,2025年6月只有16%。

同样用满5个月,惩罚从25% 收窄到16%|图片

师生在适应,工具侧其实也有人想办法,比如逼AI给答案时同步展示推演过程。但按作者们的判断,损失在变小,却没有归零的迹象。

9月1日开学。全国的教室里,这场26811人的实验,会以更大的样本重跑一遍。

以后看到孩子的作业天天100分,也许得先问一句:这100分是孩子挣来的,还是豆包挣来的。

来源: 投中网-商业深度
产业标签 AI中国/大模型与AI Agent
赞(1) 支持本站
分享到

支持本站持续更新

如果这篇内容对你有帮助,欢迎扫码支持。

支付宝扫一扫

微信扫一扫

登录

找回密码

注册