
[易学堂]大语言模型能否成为可靠的生育顾问?
大语言模型正以前所未有的速度融入医疗信息体系,在患者教育、健康咨询和医患沟通等环节展现出不小潜力。本文评估了早期版本的 ChatGPT 在回答生殖健康相关问题时的表现。结果显示:虽然模型具备较强的信息整合和语言表达能力,但在应对存在争议或商业色彩的话题时,容易出现内容片面甚至误导的情况。这也暴露出当前生成式 AI 的核心局限——它并不真正“理解”医学,而是基于网络数据生成看似合理的答案。
随着技术迭代升级,新一代大模型在理解力和推理能力方面已有明显进步。但如果要真正应用于复杂、敏感的医疗场景,单靠模型本身仍然不够。我们认为,未来的医疗类大模型应结合权威医学知识库与本地真实世界数据,才能提升其输出内容的专业性、准确性和临床实用性。如何在确保信息可信的前提下,将这类工具更好地服务于临床实践,是技术研发者和医学界共同需要思考的问题。
Beilby K, Hammarberg K. ChatGPT: a reliable fertility decision-making tool? Hum Reprod. 2024 Mar 1;39(3):443-447. doi: 10.1093/humrep/dead272. PMID: 38199794; PMCID: PMC10905498.

研究背景
随着生成式人工智能(Generative AI)工具的迅速普及,越来越多用户开始尝试使用ChatGPT等语言模型获取健康相关信息,特别是在对个人隐私要求较高、医疗决策较为复杂的领域,例如生育与不孕治疗。ChatGPT是否能在这个过程中扮演可靠的信息提供者角色?它能否提供足够准确、全面、个性化的建议?本文围绕这一问题,通过实验评估、文献综述与实践观察,对ChatGPT在生殖健康领域的应用前景进行了全面探讨。
ChatGPT在生殖医学中的问答实验设计
文章作者设计了一项针对ChatGPT回答质量的实证研究,提出10个模拟真实患者常见提问的提示词,涵盖从常规科普知识到存在争议的话题。问题包括:年龄对生育的影响、卵巢储备检测(如AMH)、选择性卵子冷冻(elective egg freezing)、试管婴儿附加疗法(IVF add-ons)以及何时应终止治疗等。提示词分为三类:有明确医学共识的、带有科学争议的、可能涉及商业推广的。
两位不孕症领域的专家独立对ChatGPT的回答进行评分,结果显示:10个回答中,有5个被评为“高质量”,4个为“中等质量”,仅1个被评为“低质量”。表现最差的回答是对“哪些IVF附加疗法有助于提高怀孕率?”这一问题的回答,内容中存在未经证实的商业推介倾向。
这些结果显示,ChatGPT在处理结构清晰、事实明确的问题时表现良好,能整合多源信息,生成有逻辑、有深度的回答。然而,在遇到术语模糊或存在市场宣传色彩的话题时,其回答容易失真。
表现机制与影响因素:ChatGPT生成内容背后的逻辑
语言模型的核心原理是基于训练数据进行预测式语言生成。ChatGPT并非“理解”问题本身,而是从其所见数据中“推测”最有可能出现在某个上下文中的答案。因此,它的回答在数据一致性较强的领域(如“女性最佳生育年龄”)中表现稳健;而在信息分歧明显的领域(如“抗穆勒氏管激素(AMH)测试是否值得做”),则可能展现出信息碎片化或倾向性回答。
此外,提示词本身对回答质量有显著影响。研究指出,结构良好的提示词能显著提升回答准确性和完整度,而用语模糊或带有预设倾向的问题,反而可能引导模型给出含混或迎合式答案。例如,“我应该选择什么样的治疗方式?”这样的开放式问题,很容易触发模型“迎合用户”的模式,生成缺乏严谨判断的建议。
这也揭示了ChatGPT使用中的一个关键前提:它不是一个真正能替代医生的“咨询工具”,而更像是一个内容再组织者,其输出质量高度依赖用户的输入技巧与训练数据的可靠性。
与传统搜索引擎对比:ChatGPT的优势与边界
文章进一步比较了ChatGPT与Google在获取健康信息方面的表现。相较于Google的关键词检索机制,ChatGPT可直接生成完整、语言自然的答案,显著降低了用户对专业背景和信息筛选能力的依赖。在一个研究中,ChatGPT对术后护理的问答准确率甚至优于Google排名靠前的网页摘要,显示出其在“快速获取结构化答案”方面的优势。
不过,Google的显著优势在于引用来源清晰,用户可以自行查证信息来源;而ChatGPT目前大多不标注具体出处,这在医学、科研等高信任度领域是一项严重限制。此外,ChatGPT容易生成“幻觉”内容,即文本形式上看似合理,但其内容却并不准确甚至无中生有,特别是在涉及细节、数字、罕见病种时尤为明显。
因此,在实际使用中,ChatGPT适合用于快速了解常见健康问题的基本知识、比较治疗方案的普遍看法、理解专业术语等任务,但不宜作为决策依据的唯一信息来源。
ChatGPT“考试”成绩优异,能否胜任健康顾问?
值得注意的是,ChatGPT在一系列医学类考试中取得了令人瞩目的成绩:从美国医师执照考试、皮肤科专业测验到法律课程考核,都达到了及格甚至优异水平。尤其是ChatGPT-4版本在短时间内比ChatGPT-3性能显著提升,在医学模拟考试中的准确率可达90%以上,显示出其强大的信息提取与语言整合能力。
然而,考试成绩不等同于临床判断。作者引用了多项研究指出,ChatGPT仍不能替代医生在个体化评估、伦理判断与情绪支持方面的角色。即便在一项AI“模拟医生答疑”的实验中,ChatGPT也只是能给出“大致合理”的治疗建议,却在用药细节与疗程计划方面存在明显瑕疵。
更重要的是,ChatGPT本身也承认自身不是“医生”。在一篇模拟访谈中,它表示:“AI可以协助处理大量健康信息,但并不能替代医生的专业判断和人际互动能力。”
结语:AI可以辅助决策,但不能代替判断
虽然当前网络信息环境良莠不齐,但这并不意味着我们应完全依赖AI生成内容。ChatGPT在信息整合和语言表达方面确有优势,尤其对于教育资源有限、信息筛选能力不足的用户群体,是一种低门槛的辅助工具。但其潜在的偏见、幻觉、缺乏可验证来源的问题仍不可忽视。
真正理想的应用方式,是将ChatGPT作为医生沟通前的“知识准备器”,或辅助医疗服务的信息支持工具,并在未来结合高质量的本地医疗数据构建可信的医疗语言模型。这需要AI技术研发人员、医疗专家与伦理监管机构的共同努力。
换句话说,ChatGPT不是“Dr. Chat”,但可能是更聪明的“搜索助手”,而我们真正需要的,是会用这个助手的人。
