在经历漫长的促排卵,取卵,取精,受精后,受精卵被放置在特殊的培养箱中成长发育,经过3-5天的等待,由胚胎学家挑选质量最好的胚胎来进行下一步的移植。能否筛选出最有发育潜力的胚胎,是整个试管婴儿流程的关键环节。

现有的胚胎质量评估技术,主要依赖形态学分析,以及基因检测两种方式。基因检测方法的成本较高,而且仅适用于一定范围的人群,因此形态学分析仍然是主要的胚胎筛选技术手段。形态学分析指的是通过肉眼观察显微镜下的胚胎形态和发育变化过程,对胚胎质量进行评分。由于主要依靠人工来判断,主流的评分体系缺乏量化的指标描述,因此评价过程存在主观性较强、一致性较低等缺陷,培养一名有经验的胚胎学家也需要花费大量的时间。
以囊胚阶段评分为例,下面的图表摘自两种不同的评分体系
![]() | ![]() |
左图是2022年伊斯坦布尔共识[1]总结的评分标准,右图是另一种常用的Gardner评分标准的一部分[2]。两者都采用 many、fewer 、very few 这类抽象的描述语言来进行分级。很显然对于不同的胚胎学家、不同的生殖中心,甚至同一个人在不同的时间,都会存在不同的尺度和标准,难以保持标准的一致性。

2019年发表于Natue子刊 NPJ Digital Medicine的一篇文章[3]里描述了一次著名的实验,由5名有经验的胚胎学家,对239个囊胚的图片进行打分(分为好,一般,差,不确定四个档次),结果只在89个胚胎上五个人可以取得完全的一致。
Bormann等人进一步就此进行了一项详细的前瞻性双盲实验,并在2020年的 Fertility and Stertility 杂志上发表了实验结果[4]。该实验采用了回顾性的数据,目的是比较胚胎学家和AI算法在一致性和主观性上的区别。实验选择748个70hpi的胚胎(分裂期)图片和742个113hpi的胚胎(囊胚期)图片,分别由10个胚胎学家和AI模型来进行形态学评估,将胚胎质量分为1-5分五个档次(5分最佳)。
结果显示,胚胎学家在评分上展现了巨大的分歧(分裂胚阶段变异系数CV达到83%,囊胚阶段为45%)。有趣的是,实验中将胚胎照片随机旋转90度、180度和270度以后,再打乱顺序发给实验组和对照组进行重复评估,以此来测试不同方式的一致性,结果人类的表现同样让我们失望。

A 分裂期胚胎评估结果分布图 B 囊胚评估结果分布图
虚线表示每个胚胎学家的评估结果概率分布;实线表示综合投票后的结果;红线表示AI的评估结果分布;黑色线条表示实际分布
这些实验都表明,想要进一步提升辅助生殖实验室胚胎选择的准确性和一致性,进而提高整个IVF过程的成功率,降低病患的痛苦和成本,IVF实验室需要一种智能化和自动化的系统来帮助胚胎学家更好的分析胚胎质量。
引用文献:
[1] The Istanbul consensus workshop on embryo assessment: proceedings of an expert meeting[J]. Human Reproduction, 2011,26: 1270–1283.
[2] Gardner DK, Sakkas D. Assessment of embryo viability: the ability to select a single embryo for transfer-a review. Placenta. 2003; 24 Suppl B:S5-12. PubMed PMID: 14559024.
[3] Deep learning enables robust assessment and selection of human blastocysts after in vitro fertilization, Nature – NPJ Digital Medicine , 04 April 2019
[4] Bormann CL, etc. Consistency and objectivity of automated embryo assessments using deep neural networks. Fertility and Sterility. 2020 Apr;113(4):781-787.e1.

