[易学堂]AI 医疗建议的信任陷阱:不够准确却被高度信任?

本次介绍的论文探讨了公众对AI生成的医疗建议存在显著过度信任现象:即使面对低准确性内容,非专业用户对其信任度与医生建议相当,且更倾向于遵循潜在有害的指导,研究同时发现专家与非专家群体均受来源标签影响。这一结果提醒我们,AI生成的医疗建议目前仍只能作为辅助工具,不能替代专业医生的判断;除了提高准确率,理解患者信任AI建议的心理机制同样重要,尤其是在实际应用中,错误信息可能带来严重后果。尽管验证了跨平台一致性,但受限于GPT-3模型与样本年龄集中于年轻人,未来需通过前瞻性多中心研究验证结论普适性。
图片
研究背景 随着大型语言模型(Large Language Models, LLMs)不断发展,人工智能(AI)生成的医疗建议在在线问诊平台中被广泛使用。尽管这类模型具有快速、结构清晰的特点,其输出信息存在“幻觉”(hallucination)现象,即生成表面合理但事实错误的内容。过去研究主要聚焦于AI在医学考试中的表现或医生对AI辅助系统的态度,而非专业用户如何感知和信任AI生成的医疗内容,以及这种信任是否存在风险,仍缺乏系统证据。考虑到AI医疗建议可能影响用户健康决策,本研究通过三个实验系统评估了非专业用户对AI生成医疗回答的判断、信任度和行为倾向,并引入医生评价以揭示专家与公众的认知偏差。 研究方法 研究数据来源于在线医疗平台HealthTap的150个真实医患问答对,涵盖预防、症状、诊断等六大医学领域。利用GPT-3生成对应的AI回答,并由四名执业医师根据准确性将其分为高/低两类:高准确性回答需至少三名专家评为“正确”,低准确性回答则多数为“可能正确”或“错误”。研究招募300名非专业参与者完成三项实验:实验一要求参与者区分医生与AI生成的回答,并评估其可理解性;实验二在盲态下评估回答的有效性、可信度、完整性及后续行为倾向(如遵循建议的意愿);实验三通过随机标签(“医生”“AI”或“医生辅助AI”)分析来源标注对信任的影响。补充实验邀请六名医生参与盲审与非盲审,验证专家对AI回答的评估偏见。
图片
研究结果 参与者在判断AI或医生回答的来源时,准确率接近随机(约50%),信心评分也无显著差异,表明他们难以通过语言特征识别信息来源。语言学分析亦发现,AI与医生回答在字数、情感倾向、可读性等指标上无显著差异。 在未知来源条件下,高准确性AI回答在有效性(95% vs. 医生81%)、可信度(4.26/5 vs. 3.85/5)和完整性(4.03/5 vs. 3.55/5)上显著优于医生回答。更值得关注的是,低准确性AI回答尽管存在错误,仍获得与医生回答相近的评价,且参与者表达出同样程度的采纳意愿。这一现象提示,低质量AI建议可能具有误导性,用户却难以察觉。
图片
来源标签对用户信任有显著影响。即使是相同内容,被标注为“医生”的AI回答可信度更高,而标注为“AI”时得分降低。专家评分也表现出类似偏差,在盲态下对AI回答的评价明显高于非盲态,说明标签不仅影响非专业用户,也能影响专业医生的判断。 研究创新点 本研究首次系统性揭示了非专业用户对AI医疗建议存在”准确性免疫”的信任偏差——即使面对低准确性内容,公众的信任度仍与医生建议相当,且更倾向于采取潜在风险行为。通过将用户实验与专家盲审结合,研究创新性提出”来源标签”是调节信任感知的核心杠杆:当AI回答被标注为”医生”来源时,其可信度显著提升,这一效应在医学专家群体中同样存在。这一发现直接挑战了”提升模型准确性即可增强信任”的传统假设,提示医疗AI的设计需从单纯追求技术性能转向更复杂的感知心理学框架,尤其需关注标签披露机制与风险可视化策略。 研究局限性 尽管研究验证了跨平台一致性,但仍存在多维局限:首先,基于GPT-3的模型可能低估新一代AI(如GPT-4)的误导潜力;其次,受试者以年轻技术熟练人群为主,未能覆盖老年群体及医疗知识匮乏者,可能弱化实际风险程度;再者,实验设计的单轮问答范式无法模拟真实诊疗中的动态交互(如病史追问、症状演变追踪),可能高估AI在复杂场景下的可信度;最后,回顾性数据收集存在选择偏倚风险,极端医疗案例的缺失可能影响结论普适性。 临床意义与展望 本研究发现,公众对AI医疗建议的信任可能与其实际准确性严重脱节,这种”信任-准确性错位”在低质量内容中危害尤甚。未来应加强AI输出内容的验证机制,避免误导患者,并引入透明的可信度提示或风险分级系统。同时,应推动AI与医生协同使用,避免将AI视为独立替代者。政策制定也需规范平台内容来源披露,公众教育亦需提高用户对AI局限的认知能力,从技术、制度与教育多方面保障患者安全。