到了 2026 年,AI 仍然会“幻觉”,并且相当多的时候会给出错误答案。尽管如此,法国和意大利大学的学者发现,获得 AI 建议会抑制批判性思维,使人们更有可能自信地复述聊天机器人提供的错误信息。
“对人类来说,能够说出‘我不知道’非常重要,因为这代表着认识到自身知识的局限,”米兰-比可卡大学(University of Milano-Bicocca)副教授瓦莱里奥·卡普拉罗(Valerio Capraro)在一次电话采访中说。
“但现在有了 AI,几乎每个问题我们都能轻松得到答案,所以我们想知道,这是否会影响人类说‘我不知道’、暂缓判断的能力。”
卡普拉罗及其合著者、法国高等师范学院(École Normale Supérieure)的基亚拉·马尔科乔(Chiara Marcoccia)和罗马大学萨皮恩扎分校(Sapienza University of Rome)的沃尔特·夸特罗奇奥奇(Walter Quattrociocchi)着手研究,获取 AI 建议会如何影响人们承认无知的意愿。
他们论文的标题已经揭示了研究发现:AI 建议会抑制人们说“我不知道”的意愿,即使建议是错误的,而且准确率还有激励机制。
卡普拉罗说,他和同事设计了一组大语言模型通常答错的问题。在这项研究中,他们让参与者回答关于电影视觉细节的问题,比如《像贝克汉姆一样踢球》(Bend It Like Beckham)中球队制服的颜色,或《像高速公路上的猫》(Like a Cat on a Highway)里莫妮卡开的是什么车。
研究人员预期,这类细节大多不会出现在模型的训练数据中,而实验所用模型的确如此(Step 3.5 Flash)。他们还测试了较新的前沿模型(GPT-5.5、Claude Sonnet 4.6、Gemini 3.5 Flash),这些模型没答对车辆问题,但在其他细节上往往答对了。
他们之所以使用 Step 3.5 Flash,是因为如论文所述,它通常是错的,因此,判断力下降就不能被解释为把任务合理地交给一个可靠工具。
“我们把受试者分成了两组,”卡普拉罗解释道。“一组必须在没有 AI 建议的情况下回答这些问题,另一组则可以向 AI 寻求建议。我们发现,在基线条件下,44% 的人表示不知道答案,也就是暂缓判断。而有了 AI 建议后,这一比例只有 3%。因此,暂缓判断几乎崩塌了。”
卡普拉罗说,更有意思的是,一旦可以使用 AI 帮助,准确率也崩塌了。换句话说,他们比起自己的判断,更信任 AI 的答案。
“在基线条件下,27% 的人给出了正确答案,”他说。“有了 AI 建议后,只有 9% 的人给出正确答案。所以一些本来会答对的人去问了 AI,结果反而答错了。”
此外,获得 AI 建议还让人们对自己的正确性更加自信。他说,基线水平是 30%,但在 AI 帮助下,自信度上升到 76%。尽管存在幻觉的可能,他们还是相信了机器人。
“所以基本上,人们变得糟糕得多——准确率只有原来的三分之一——但自信心却翻了一倍,”他说。
研究人员还在有金钱激励的条件下进行了实验,这确实带来了一些改善。愿意暂缓判断并承认无知的比例从 3% 提高到 8%,准确率从 9% 提高到 16%,但仍低于基线条件下分别为 44% 和 27% 的水平。
虽然研究人员选择的是电影冷知识问题,但他们认为,这一发现可以推广到其他领域。
卡普拉罗表示,他认为这是一个需要在社会层面加以解决的问题,应通过 AI 素养和教育政策举措来应对。“当然,模型提供商也应该努力改进,但我猜他们的激励并不太一致,”他说。“更有前景的做法会是在教育层面。”
“我非常担心儿童,因为成年人已经学会了批判性思维。但对于那些基本上从出生起就接触这些系统的孩子来说,风险在于他们甚至都学不会基本的批判性技能。” ®