[易学堂]深度学习助力 IVF:精准识别胚胎发育关键事件 2026-07-292025-12-01 作者 Fertsy 近年来,AI技术与IVF的结合不断深入,已经逐渐从实验室研究走向产业化阶段。我们将持续介绍本领域近期的优秀论文,与有兴趣的同道共同交流进步。 本次介绍的这篇论文,在训练过程中采用了多种品牌时差培养箱的数据。说明作者已经注意到不同时差培养箱之间的成像质量、培养皿光学特征之间的差异,有意通过融合多种不同来源的图片数据弥合这些差异的影响。从工程角度来看,不同培养箱的数据不仅是图片质量的不同,在数据接口、图片前处理等方面也有很大差异,在产品化一个AI系统的过程中都需要加以考虑。 Canat G, Duval A, Gidel-Dissler N, Boussommier-Calleja A. A novel deep learning approach to identify embryo morphokinetics in multiple time lapse systems. Sci Rep. 2024 Nov 22;14(1):29016. doi: 10.1038/s41598-024-80565-1. PMID: 39578525; PMCID: PMC11584792. 研究背景 时差成像系统(TLS)的广泛应用提升了 IVF 领域对胚胎形态动力学的精细化分析能力。然而,当前的评估仍然依赖胚胎学家的主观判断,不同实验室间的一致性较低。尽管人工智能(AI)已在胚胎评估中得到一定应用,但现有模型主要集中于预测胚胎植入潜能或染色体倍性,而缺乏对完整发育过程的动态识别。此外,大多数 AI 研究仅基于单一 TLS 设备训练,难以适用于不同成像系统,限制了临床应用价值。 本研究提出了一种新型深度学习架构,能够自动识别胚胎发育过程中的 11 个关键形态动力学事件(从单细胞至囊胚形成),并适用于 EmbryoScope、GERI 和 MIRI 等不同 TLS 平台。 研究方法 本研究收集了 1909 例胚胎的时差影像数据,其中 EmbryoScope 1183 例,GERI 103 例,MIRI 100 例。数据集按 1305 例训练集、324 例验证集、278 例独立测试集划分。研究提出了一种生物事件提取(BEE, Biological Event Extraction)模型,由视觉特征提取、时间序列建模和序列优化三部分组成。 模型采用 Transformer 结构的视频编码器进行视觉特征提取,并使用门控循环单元(GRU)建模形态变化的时间依赖关系。为了确保预测结果符合生物学规律,研究引入了隐藏马尔可夫模型(HMM)进行序列优化。此外,研究采用改进的交叉熵损失函数增强模型对胚胎发育顺序的学习能力,并通过统一时间窗口(±2h)评估模型性能,以提高检测精度和临床可解释性。 研究结果 模型在 11 个形态动力学事件上的加权平均 F1-score 达 66.3%,其中 t2、t4、t6、tsb 和 tb 事件的 F1-score 均超过 69%。在不同 TLS 设备上的 F1-score 分别为 EmbryoScope 69.5%、GERI 58.9%、MIRI 52.3%。在囊胚形成检测方面,模型的准确率达到 96%,高于现有自动化方法。预测事件时间误差均值控制在 ±2 小时内,R² 评分为 0.95,说明模型在时间预测方面表现稳定。 研究创新点 本研究突破了传统 AI 评估方法仅依赖单帧静态特征的局限,实现了从单细胞到囊胚阶段的完整时间序列分析。HMM 处理优化了事件预测的顺序一致性,改进的损失函数提高了模型对形态变化时间点的敏感度。与以往主要针对单一 TLS 设备的 AI 研究不同,该模型在多种 TLS 设备数据上进行训练,提升了泛化能力。此外,采用固定时间窗口(±2h)进行 F1-score 计算,使性能评估更贴近临床需求。 研究局限性 不同 TLS 设备的检测精度存在差异,GERI 和 MIRI 设备的数据相对较少,影响了模型的泛化能力。对于碎片化严重或发育异常的胚胎,模型的识别能力仍需提升,未来可通过扩充异常胚胎数据集来优化。由于本研究未进行跨诊所独立验证,仍需更大规模的临床测试来评估模型的稳定性。此外,TLS 影像通常采用单焦平面,未来可结合多焦点成像技术,以提高对复杂形态变化的捕捉能力。 临床意义与展望 本研究提出了一种基于 Transformer + GRU + HMM 的深度学习架构,可在多个 TLS 系统上自动识别胚胎发育过程中的关键形态动力学事件。与传统人工评估方法相比,该模型能够提供更稳定、更标准化的形态学分析结果,减少主观误差,提高胚胎选择的一致性。未来,该方法可与胚胎植入结局数据结合,进一步优化 AI 预测模型,助力个性化胚胎筛选,提高 IVF 成功率。同时,随着 AI 在胚胎学领域的深入应用,如何更好地结合临床实践,提高评估效率,将成为未来值得探讨的问题。