[易学堂]当只有低质量胚胎可供选择时,AI能否帮助胚胎学家?

本次介绍的论文聚焦辅助生殖领域低质量胚胎评估的现实挑战:仅存低质量胚胎可供移植时如何挑选最具有移植潜力的胚胎。该研究针对临床痛点设计实验,验证了 AI 在细分场景中的价值,为临床在 “无优质胚胎可选” 时的精准决策提供了客观依据,也为 AI 在辅助生殖细分场景的应用奠定了研究基础。 论文题目:Never a lost cause: can artificial intelligence (AI) help embryologists when only poor-quality embryos are available? 论文作者:Nina Gidel-Dissler, Guillaume Canat et al. 发表期刊:Reproductive BioMedicine Online(RBMO) 发表时间:2025. 3  图片 研究背景 在辅助生殖技术中,胚胎质量评估是决定移植成功率的核心环节。传统形态学评估方法依赖胚胎学家主观判断,存在显著的操作者间和操作者内差异,尤其对低质量胚胎的评估更为困难。研究显示,低质量胚胎仍有 10%-30% 的移植妊娠率,但传统分级系统难以精准识别其中真正具有妊娠潜力的个体。延时成像(TLS)技术与人工智能(AI)的结合为胚胎评估提供了新工具,但此前研究多聚焦于随机胚胎的整体评估,鲜少针对 “仅存低质量胚胎可供移植” 这一临床常见场景。本研究旨在探索 AI 系统 EMBRYOLY 在低质量胚胎评估中的价值,填补这一领域的空白。 研究设计 本研究数据来源于 2019-2024 年间 4 个国家 15 个生殖中心的 3214 次取卵周期,涉及 15767 个胚胎,涵盖 3 种延时成像系统(Embryoscope+、GERI、MIRI),其中包括 7 个未参与算法初始训练的独立诊所数据以验证泛化能力。数据包含胚胎动态影像、患者临床信息及移植结局,排除培养少于 4 天的胚胎。研究采用 EMBRYOLY 系统的三种核心算法:GardNet 基于 Gardner 量表自动分级胚胎形态,将低质量胚胎定义为扩张阶段≤2(B1-B2)或扩张≥3 但内细胞团(ICM)和 / 或滋养外胚层(TE)为 C 级;FH-ranking 模型基于 Transformer 架构,通过胚胎动态影像预测临床妊娠概率;混合模型结合 FH-ranking 评分与患者临床特征,生成个性化移植置信度。实验通过四个子集展开分析,分别验证 EMBRYOLY 与胚胎学家的决策一致性、FH-ranking 评分与妊娠结局的关联性、AI 对妊娠效率的影响及混合模型推荐的不同质量胚胎妊娠率。
图片
数据收集及排除标准 主要发现 研究显示,29% 的胚胎组中,胚胎学家仅能选择低质量胚胎进行移植,凸显了低质量胚胎评估的临床必要性。在决策一致性方面,EMBRYOLY 与胚胎学家对首选低质量胚胎的选择一致率达 66%,显著高于 17% 的随机概率,其中单胚胎移植时一致性为 71%,多胚胎移植时为 49%。FH-ranking 评分与低质量胚胎的临床妊娠(OR=1.03,P<0.001)和活产(OR=1.02,P<0.001)均显著相关,且在多个独立诊所的亚组分析中保持稳定。模拟 AI 辅助决策的结果显示,在仅能选择低质量胚胎的场景中,胚胎学家单独决策的首次周期妊娠率为 37%,妊娠周期为 1.78;而遵循 EMBRYOLY 推荐后,首次周期妊娠率提升至 61%(P=0.02),妊娠周期缩短至 1.44(P=0.01),分别实现 65% 的效率提升和 19% 的周期减少。混合模型分析则表明,尽管低质量胚胎中仅 10% 被评为高移植置信度(非低质量胚胎为 29%),但高置信度的低质量胚胎妊娠率达 46%,与高置信度非低质量胚胎的 50% 无统计学差异(P=0.54),证明 AI 能识别 “隐藏潜力” 的低质量胚胎。
图片
FH-ranking 评分与低质量胚胎移植结果的关系 研究意义 本研究的临床与学术意义深远。从临床实践角度,它首次证实了客观训练的 AI 系统在低质量胚胎评估中的实用价值。29% 的胚胎组中仅存低质量胚胎的现状,意味着 EMBRYOLY 的应用能直接覆盖大量临床需求,帮助胚胎学家在传统分级系统可能 “误判” 的场景中做出更精准的决策。其与胚胎学家 66% 的决策一致性,既验证了 AI 的可靠性,又能作为 “第二意见” 减少人为主观偏差,尤其在多胚胎移植等复杂场景中提供补充参考。AI 对妊娠效率的提升具有突破性:首次周期妊娠率提升 65%、妊娠周期减少 19%,直接减轻了患者的治疗负担与心理压力,同时提高了辅助生殖技术的资源利用效率。而高置信度低质量胚胎与优质胚胎相当的妊娠率(46% vs 50%),颠覆了 “低质量即低潜力” 的固有认知,为临床保留更多潜在可移植胚胎提供了依据,避免了不必要的胚胎丢弃。
图片
比较胚胎学家单独和借助FH-ranking 模型时劣质胚胎临床妊娠周期长度和第一周期临床妊娠率 研究局限 尽管研究价值显著,但其局限性仍需正视。首先,低质量胚胎的识别依赖 GardNet 算法,虽经 83% 的准确率验证,但未全部经胚胎学家手动复核,可能存在少量误判,影响后续分析的基础。其次,低质量胚胎的定义基于 Gardner 分级,而国际上还存在 ASEBIR、Istanbul 等其他分级系统,基于单一标准的结论可能限制其在采用不同分级体系的临床中心的应用。再者,双胚胎移植(DET)占比 16%,此类案例中妊娠结局可能受多个胚胎共同影响,难以明确单一胚胎的贡献,为 FH-ranking 模型的排序能力评估引入噪声。此外,数据存在一定选择偏差:仅纳入培养 4 天以上的胚胎(因需符合 Gardner 分级),而临床中部分胚胎可能在更早阶段移植,导致 AI 在这类场景中的表现未被验证;约 5% 的卵母细胞玻璃化冷冻案例被视为独立队列,虽符合临床实践,但可能影响数据的同质性。
图片
劣质胚胎与非劣质胚胎的临床妊娠率与模型移植置信度的变化 未来展望 未来研究可从多方面突破局限:一是扩大数据范围,纳入采用 ASEBIR、Istanbul 等分级系统的中心数据,验证 AI 在不同标准下的适用性;二是补充胚胎学家对 AI 识别的低质量胚胎的手动复核,提高基础数据的准确性;三是针对双胚胎移植设计专项分析,通过单胚胎移植的随访数据优化模型对多胚胎场景的评估能力。同时,可整合单细胞转录组、表观遗传等分子数据,挖掘低质量胚胎妊娠潜力的生物学标志物,增强 AI 评估的机制解释性;针对培养少于 4 天的胚胎开发适配的评估模型,覆盖更全面的临床场景。最终,通过持续优化算法与扩大验证,推动 AI 辅助低质量胚胎评估成为临床常规,进一步提升辅助生殖技术的精准度与成功率