2025年,肿瘤学期刊《Cancers》发表了一篇AI分析HE切片预测乳腺癌分子分型的研究成果——Validation of an Artificial Intelligence Model for Breast Cancer Molecular Subtyping Using Hematoxylin and Eosin-Stained Whole-Slide Images in a Population-Based Cohort,该研究由挪威斯塔万格大学医院病理系团队完成,本研究中使用了Hamamatsu Photonics K.K的NanoZoomer扫描仪参与完成了全切片图像的数字化,结合AI实现了以更快的速度和更低的成本准确预测乳腺癌不同亚型,为每位乳腺癌患者确定更有效的治疗方案,这项研究可能有助于改善诊断流程。

临床痛点:精准指导个体化治疗方案
乳腺癌是女性最常见的恶性肿瘤之一。通过免疫组织化学(IHC)检测全切片中ER、PR、HER2和Ki-67的表达,可将其分为luminal A、luminal B、HER2-positive和三阴性乳腺癌(TNBC)四种分子亚型,各亚型间治疗方案和预后判断差异显著,因此准确分型对制定个体化治疗方案至关重要。
随着数字病理学的推广应用以及AI的快速发展,病理学领域正迎来重要突破。AI技术有望从常规H&E染色切片中反推分子信息,减少病理医师资源短缺带来的治疗不足和判读差异所导致的过度治疗。基于此提出利用AI模型从H&E切片中预测乳腺癌分子分型,进一步优化个体化治疗方案,该模型理论上相较于IHC或分子检测具有更高的可重复性、更低的成本和更快的速度。
技术突破:HE图像预测乳腺癌分子亚型
本研究基于真实临床样本,纳入了来自挪威单一研究中心的 538 例原发性乳腺癌病例(即 SBC 数据集),不含IHC显示 HER2 2+和缺少分子分型标志物的病例,由两名病理学专家根据挪威乳腺癌指南(NBCG)进行分型判读。
1、数据预处理:将所有病例颜色归一化,处理染色和图像采集的色彩差异。随后使用组织分割模型,在20×放大倍数下将组织区域切分为大小为512×512像素互不重叠的patch,筛除伪影和无信息图块,仅保留组织含量至少为60%的图块,转化为适合后续模型处理的形式。
2、特征提取:使用基于卷积神经网络(CNN)的预训练MIL特征提取器,计算深度特征向量,提取组织形态和纹理特征用于重新训练最终分类器,使模型适应SBC数据集特征。
3、模型训练和验证:使用SBC数据集对预训练模型的最终分类层进行了微调,同时采用了欠采样(undersampling)和过采样(oversampling),并结合加权类别交叉熵损失函数,以应对数据集内部的类别不平衡。随后,对微调后的模型在不同的分子亚型分类任务(CLF)上进行了评估,包括二分类(TNBC与非TNBC)、三分类(luminal、HER2阳性与TNBC)以及四分类(luminalA、luminalB、HER2阳性与TNBC)中进行特定分类任务预测训练。

通过深度学习联合分析H&E/IHC病理特征,预测乳腺癌分子分型及治疗方案,模型在区分TNBC与非TNBC的二分类任务中表现良好,AUC达0.823,准确率为0.833,F1 score为0.824。然而,随着分类任务复杂度提高,区分三种和四种分子亚型时,模型性能显著下降。多分类任务仍需进一步优化,以提高临床适用性。
硬核性能数据:用“金标准”教会AI
随着国内病理数字化的推进,数字切片扫描仪为医疗行业提供了重要载体。专业病理切片扫描仪的高分辨率扫描图像,为AI在病理领域的应用和质控诊断提供重要信息,滨松在数字病理领域具有丰厚经验,2005年发布首台切片扫描仪,至今深耕中国市场已有20余年,高精度光学系统与稳定成像性能可清晰呈现了细胞轮廓、细胞核的大小和形态等特征,其图像数据色彩还原准确,拼接处理精准满足AI训练要求,不丢失图像信息是病理数字化最实在的价值。
全景数字化图像是由多个高倍视野图像,通过无缝拼接融合而成的金字塔式结构图像。然而,拼接过程中的错位可导致病变细节改变及图像信息丢失。由于组织纹理本身复杂多变,肉眼难以直接判断图像数据的完整性。
如何验证扫描设备所生成数字图像是否存在失真?可采用已知尺寸的标准网格片进行测试。如图,在扫描100 μm的正方形网格图像中,若设备性能不达标则出现明显错位的情况,图中大约10 μm的信息出现丢失,表明原始病理切片图像同样不完整、存在信息缺失。符合质控标准的滨松设备可为下游AI训练和开发提供真实扫描图像集。

