AI 没出错,判断力却在退步:医生用满三个月,独立检出率掉 6 个百分点

Second-order thinking for people who use AI every day2026年9月22日 约 8 分钟

AI 的第一层收益是快,第二层代价按周和月落在技能、判断、习惯和数据上。六项研究和一次 ChatGPT 分享链接事故指向同一句话:效应跟着用法走,不跟着工具走。

二阶思维认知卸载批判性思维ChatGPTAI 教育

一分钟速览

  • 二阶思维问“因为那件事发生了,接着会发生什么”:慢效应落在技能、判断、习惯、数据和学习的五条通道上。
  • MIT 那 54 人写完就引不出自己的句子;319 名知识工作者里越信任 AI 的人越少做批判性思考;医生用 AI 三个月,独立检出率掉 6 个百分点。
  • 数字都只有一处转述来源,MIT 那项未同行评审;能带走的是一句提醒:收下答案前先问“然后呢”。

答案来得比手快,慢的那半落在别处

你提一个问题,答案在你手伸向咖啡杯之前就到了。它听起来很确定,而且大概率是对的。用上几周,这种速度就成为常态,像一件顺手的工具消失在握它的那只手里。

屏幕上显示的是第一层效应。更慢的那些落在技能、判断、习惯和数据上,按周和月累积。有一类专门用来提前看见这种效应的心智模型,来自 AI 行业之外,叫 second-order thinking(二阶思维):一阶思维问“发生了什么”,二阶思维问“因为那件事发生了,接着会发生什么”。投资人 Howard Marks 靠它建立职业生涯,把快的那一类称为“第一层思维”——简单、快速、人人可得;Farnam Street 的 Shane Parrish 把它整理成人人可练的模型。这两处归属来自投资与决策写作的传统,没有附上逐字出处。

它的形状很朴素:每一个后果都有后果,而第一个后果只是最响的那个。麻烦恰好在这里——AI 那个完成度很高、读起来很顺的答案,就是最响的一个。

类比一阶效应与二阶效应的区别饭后甜点:第一层是每一次都好吃,第二层是每晚一次的积累一年之后的样子。好吃始终先到,因为它正是甜点在起作用。

这些慢效应,最先落在哪里?

MIT 那 54 人写完了文章,几分钟后引不出自己的句子

MIT Media Lab 的 Nataliya Kosmyna 带队做过一项写作实验:54 个人写文章,分成三组——用 AI 助手、用搜索引擎、只靠自己的脑子。写完后的问卷里,AI 组对文章的所有权感最低;不少人过了几分钟,已经很难复述或引用自己刚写下的内容。字出来了,和字的连接没出来。这是小样本研究,也还没有经过同行评审:方向值得记住,分量不必压得太重。

第二项研究把镜头对准判断。Microsoft Research(微软研究院)与 Carnegie Mellon University(卡内基梅隆大学)的研究者调查了 319 名知识工作者,覆盖 936 个真实 AI 使用任务。结论的落点不在工具,而在信心放在哪里:越信任 AI,受访者自报的批判性思考越少;对自己的能力越有信心,思考参与得越多。

两项研究都是自我报告,第二项是观察性调查,给出的是相关关系,不能当成因果。这些数字目前也只有一处转述,没有独立核验。但它们指向同一个位置——变化的落点在写作者和判断者身上,不在答案里。

用 AI 写作的那一组,对文章的连接感最弱

用 AI 助手、搜索引擎或只靠自己写作,会不会影响写作者对文本的所有权感和对自己文字的即时提取能力?

实验设置
让参与者撰写文章并分组:使用 AI 助手、使用搜索引擎、不使用任何工具;随后测量所有权感与能否引用自己刚写的内容。任务时长、地点与测量工具在材料中未知。
样本与轮次
54 人;轮数与任务数量未知
判定指标
自我报告的文章所有权感,以及完成后数分钟内能否引用自己的文字;成功判定口径未知
对照或基线
搜索引擎组与无工具组作为对照条件

结果:AI 组报告的所有权感最低,不少人难以在完成几分钟后引用自己写下的句子

边界:样本小、未同行评审、自我报告指标;未给效应量与统计检验;不能外推到所有 AI 写作场景

信心放在哪里,比用哪个工具更能预测思考量

知识工作者在真实 AI 任务中的信心指向,与自报的批判性思考量有什么关联?

实验设置
对知识工作者进行问卷调查,围绕其真实 AI 使用任务展开;抽样方式、地区与行业构成未知。
样本与轮次
319 名知识工作者,936 个真实 AI 任务
判定指标
自报的批判性思考行为,以及对 AI、对自身能力的信心评分;量表口径未给
对照或基线
无明确对照(观察性调查)

结果:对 AI 的信心越高,自报的批判性思考越少;对自身能力的信心越高,思考参与越多

边界:相关设计无法确定因果方向;依赖自报;未给效应量、显著性与抽样代表性

少想一点至少还有点感觉,那更隐蔽的一层是什么?

从“这次省点事”到“默认把活交出去”

Michael Gerlich 在 SBS Swiss Business School 调查并访谈了 666 人。频繁使用 AI 与更低的批判性思维得分相关,中间连着一条习惯通道,研究者称为 cognitive offloading(认知卸载)——把脑力活交给工具,不是某一次的决定,而是默认做法。这是相关关系,不是因果证明;横截面数据也排不掉反向因果:也可能是本来就不太做批判性思考的人更常使用 AI。

关键区别落在“默认”和“决定”这两个词上。为一件明确的小事把活交出去,那是决定;从不想“要不要”,直接交出去,那是默认。习惯由重复建立,而每天用 AI,正好就是重复。

调查与访谈各占多少人、用的是哪套量表、效应量有多大,都没有随之给出。

类比默认卸载与决定卸载把一笔钱花出去,一种是提前想清楚这笔钱买什么,一种是顺手就花掉了。金额可能一样,账不一样。
频繁使用 AI 与更低批判性思维得分之间的习惯通道

频繁使用 AI 是否与更低的批判性思维得分相关,并且是否通过“认知卸载”这一习惯路径连接?

实验设置
由 SBS Swiss Business School 的 Michael Gerlich 对人群进行问卷调查与访谈;量表、访谈提纲与筛选条件未知。
样本与轮次
666 人;调查与访谈各自的人数未知
判定指标
批判性思维得分与 AI 使用频率的关联,以及认知卸载的中介路径;判定口径未知
对照或基线
无明确对照(观察性研究)

结果:频繁使用 AI 与更低的批判性思维得分相关,并通过认知卸载这一习惯连接;材料明确说明这是相关而非因果证明

边界:横截面相关,无法排除反向因果;依赖自报;未给效应量与中介检验细节

删掉那条对话,公开分享链接还留在搜索结果里

2025 年 8 月,OpenAI 移除了一项让共享对话可以被搜索引擎发现的功能。做这个决定之前,数千条私人聊天已经出现在 Google 的搜索结果里。

一阶效应很好理解:分享一条有用的对话,只需要一次点击。二阶效应藏在后面——留下的痕迹比对话本身活得久。删除一条对话,并不会删除已经生成的公开分享链接;对话和链接是两份记录。这是当时的产品行为,至于眼下是否仍然如此,没有可核验的说明。

把这个问题推广到任何工具,问法都是一样的:你粘贴进去的内容,寿命比你粘贴的那一刻长。它现在存在哪里、谁能看到、能存多久——在粘贴之前问,比在事情发生之后问便宜得多。

具体日期只到“8 月”,“数千条”也没有看到一手统计口径。这个案例能说明的是分享链接这种机制,不能说明所有 AI 工具都用同一套留存策略。

一次点击分享,换来一条比对话活得更久的链接

ChatGPT 的共享对话可以被搜索引擎发现;用户把私人内容粘贴进对话后,一次点击即可生成公开分享链接。

  1. 共享即公开

    分享一条有用的对话只需要一次点击,生成的链接可被搜索引擎索引。

    The first-order effect was that sharing a useful chat took one click.
  2. 私人聊天进入搜索结果

    数千条个人聊天内容出现在 Google 的搜索结果中。

    after thousands of personal chats surfaced in Google results
  3. 功能被移除

    2025 年 8 月,OpenAI 移除了让共享对话可被搜索引擎发现的功能。

    In August 2025, OpenAI removed a ChatGPT feature that let shared conversations be made discoverable by search engines
  4. 删除不等于撤回

    删除一条对话并没有删除已经生成的公开分享链接。

    Deleting a conversation did not delete the public share link.

结果:功能被移除,但已经生成的公开分享链接按材料描述的方式继续存在;由此得到的结论是:粘贴进去的内容比粘贴的那一刻活得更久。

不能据此证明:这个案例只说明一次具体产品变更与分享链接机制,不能证明所有 AI 工具的数据留存策略相同,也不能量化有多少用户实际受影响;具体日期、受影响人数与链接存续时长都没有一手数据。

基于证据重建事件顺序,非逐字对话

前四条通道都在往同一个方向漂,第五条为什么能反着来?

哈佛把 AI 导师改成一次只给一步,194 人的学习增益约两倍

哈佛的 Gregory Kestin 和 Kelly Miller 为一门 194 人的物理课做了一个 AI 导师,一次只揭示一个步骤,并让学生先尝试作答,之后才展示答案。结果,接受 AI 辅导那组的学习增益约为常规课堂学生的两倍。

设计细节是关键。同一项技术,包上“先自己试”的护栏,二阶效应就反过来:技能开始复利,而不是向未来借。Gerlich 的实验里能看到同一件事的两面——同一项实验内部,无引导的 AI 使用削弱了推理,结构化、有意识的提示让使用者保持认知投入,答案也更强。把这两条和前面的证据放在一起,“效应跟着用法走、不跟着工具走”就不再是一句态度,而是同一门课、同一项实验内部就能看到的差异。

这是单一课程、单一机构的结果。学习增益怎么测、基线差多少、置信区间是多少,都没有给出,“约两倍”目前也只是转述。它的口径不能直接搬到你自己的学习场景里。

同一套工具,三种用法走向三种结果

切换三种用法,看各自改变哪一层问题。

默认依赖

作用对象 · 不去想“要不要”,顺手就把脑力活交出去的人

它怎样起作用
认知卸载变成默认习惯,核查、推理、提取这些动作不再被调用
希望带来什么变化
频繁使用 AI 与更低的批判性思维得分相关;同一项实验内,无引导的 AI 使用削弱了推理表现
真正落地还缺什么
待补条件:横截面数据无法排除反向因果,量表口径与效应量都未给出,因此只能当方向,不能当结论
结构化提示

作用对象 · 愿意先想清楚自己要什么,再让工具参与的人

它怎样起作用
提问前先明确目标与结构,把脑力活按决定交出去,而不是按默认交出去
希望带来什么变化
同一项实验内,结构化、有意识的提示让使用者保持认知投入,答案也更强
真正落地还缺什么
待补条件:该实验的样本量、实验设计与“更强答案”的评判口径都未给出,无法判断可重复性
一次一步的导师

作用对象 · 目标是把知识留在自己身上的学习场景

它怎样起作用
工具一次只揭示一个步骤,学生先尝试作答,之后才展示答案
希望带来什么变化
194 人的物理课里,AI 辅导组的学习增益约为常规课堂学生的两倍
真正落地还缺什么
待补条件:单课程、单一机构,学习增益的测量方式、基线差异与置信区间都未给出
无引导使用与结构化提示,推理表现走向相反

无引导的 AI 使用与结构化、有意识的提示使用,对推理能力的影响是否不同?

实验设置
材料将其描述为 Gerlich 的后续实验,比较无引导使用与结构化、刻意提示两种条件;环境、任务与评判方式未知。
样本与轮次
未知(材料未给样本量与轮数)
判定指标
推理表现与认知投入,以及答案强度的评判方式;口径未知
对照或基线
两种使用方式互为对照,对照组具体设置未知

结果:无引导的 AI 使用削弱了推理能力;结构化、有意识的提示让使用者保持认知投入并产生更强的答案

边界:样本量、实验设计、评判者与“更强答案”的判定口径均缺失;无法判断可重复性

一次只给一步的 AI 导师,把学习增益做到约两倍

带有“一次一步、先尝试再看答案”设计的 AI 导师,会不会改变一门物理课的学习增益?

实验设置
在哈佛一门物理课中部署自建 AI 导师,设计上一次只揭示一个步骤,要求学生先尝试作答、之后才展示答案,并与常规课堂比较。
样本与轮次
194 名学生;分组方式、轮数与课程时长未知
判定指标
学习增益(learning gains),具体测量方式与判定口径未知
对照或基线
以同一课程的常规班级作为比较基准

结果:接受 AI 辅导组的学习增益约为常规课堂学生的两倍

边界:单课程、单一机构;未给基线差异、效应量与置信区间;“约两倍”为转述;不能推断其他学科或自学者场景

三个月后,单独检出率少了 6 个百分点

发表在 The Lancet Gastroenterology & Hepatology 上的一项研究跟踪了有经验的肠癌筛查医生。他们使用能帮助识别癌前病变的 AI 工具,三个月后,单独操作时的检出率下降了 6 个百分点。

AI 没有出错。它按承诺完成了工作。变化发生在医生身上:这份能力在悄悄下滑,而下滑发生在他们自己感觉不到的地方。要看见它,需要把三个月的时间窗放在一起比。

这就是二阶效应最难对付的地方——它不会自己出声。等你能感觉到的时候,往往已经过去了好几个月。所以“然后呢”不能等到事后才想,它必须变成一个习惯动作。

参与医生的人数、所在国家、检查例数,以及那 6 个百分点的置信区间,都没有公开细节。这是临床场景里的一个现象,不能直接搬到其他 AI 辅助的工作上。

五条通道:四条会漂移,一条能复利

第 6 节数据表格
通道观察对象与样本口径观察到的方向证据强度与缺口
技能MIT Media Lab 写作实验,54 人,分 AI 助手/搜索引擎/无工具三组AI 组对文章的所有权感最低,不少人几分钟后引不出自己的句子小样本、未同行评审、自我报告
判断Microsoft Research 与 Carnegie Mellon University 调查,319 名知识工作者、936 个真实 AI 任务越信任 AI,自报批判性思考越少;越信任自己,思考参与越多观察性调查,相关不是因果
习惯SBS Swiss Business School,调查与访谈 666 人频繁使用 AI 与更低批判性思维得分相关,经由认知卸载横截面相关,量表与效应量未给出
数据OpenAI 于 2025 年 8 月移除共享对话可被搜索引擎发现的功能删除对话不删除公开分享链接,痕迹比对话活得久日期只到“8 月”,“数千条”无一手口径
学习哈佛 194 人物理课,AI 导师一次只给一步学习增益约为常规课堂学生的两倍单课程单机构,测量方式与置信区间未给出
与 AI 协作三个月后,医生的单独检出率掉了 6 个百分点

长期与 AI 工具协作后,经验丰富的筛查医生在单独操作时的表现会不会发生变化?

实验设置
The Lancet Gastroenterology & Hepatology 发表的研究跟踪有经验的肠癌筛查医生,使用帮助识别癌前病变的 AI 工具,比较三个月时间窗内的表现;国家、医院与纳入标准未知。
样本与轮次
未知(材料未给医生人数与检查例数)
判定指标
单独操作时的检出率,以百分点变化表示
对照或基线
以三个月时间窗的对比作为参照

结果:使用 AI 工具三个月后,医生单独检出率下降 6 个百分点;材料强调 AI 本身表现符合承诺,变化发生在医生身上

边界:未给样本量、置信区间与对照设计细节;不能外推到其他临床或非临床场景;“当事人未察觉”为材料叙述

既然它不会自己出声,能挪动的到底是什么?

速度就是产品本身,能挪动的只有提问的时间点

答案有点反直觉:工具挪不动,能挪动的只有问“然后呢”的时间点。

速度不是可以修掉的缺陷,它就是整个产品。把完成好的答案立刻送到你面前,正是 AI 有价值的原因;而一个被原样收下、没有参与的完成答案,又恰好是那些研究反复描述的条件。速度与能力借用来自同一个特性,形成一个真实的悖论:让你更快的工具,也可以让你更慢地学会东西。

所以问题不是用不用、用多少。那项研究里的 AI 按承诺完成了工作,哈佛那门课里 AI 辅导组的学习增益约为常规课堂的两倍,工具在它该做的事情上没有问题。区别在于:脑力活是按默认交出去的,还是按决定交出去的。

落到动作上很短。在收下一个答案之前问自己一句:如果我就这样接下它,什么会变强,什么会变弱。答案可能是这件事根本不重要,那就直接收下——这本身就是一次决定;答案也可能是让工具把步骤摊开、一次一步地走,当下慢一点,但那部分归你。

AI 给出的答案是第一层效应。你会变成什么样,是第二层效应。

收下答案之前,这一问怎么落地

条件与选择
  1. 条件这件事本身不重要
    结果直接收下输出
    可以怎么做把它当成一次明确的选择,而不是默认动作
  2. 条件你想留下的是能力
    结果让工具把步骤摊开,一次一步地走
    可以怎么做先自己试,再让工具补上缺的那一步
  3. 条件你只是习惯性把活交出去
    结果脑力活被默认卸载,核查与推理不再被调用
    可以怎么做先花两分钟说清自己到底要什么,再提问
  4. 条件你越来越信任工具的答案
    结果自报的核查行为随之减少
    可以怎么做把核查写进流程,而不是依赖当时的自觉

适用范围:这些分支来自一篇面向日常使用者的指南,不是经过验证的规则;三种做法也没有在同一项实验里被直接比较,不能承诺效果。