跳转到正文
随风
Nature Medicine · 2019Brief Communication · 3 pages · 2 主图Nature 原文本地 PDFPMC 全文

Deep learning can predict microsatellite instability directly from histology in gastrointestinal cancer

从常规 H&E 病理切片直接预测消化道癌的 MSI 状态 —— 让更多癌症患者能被筛出适合免疫治疗的候选者

发表:Nature Medicine 2019, 25(7):1054-1056;DOI 10.1038/s41591-019-0462-y;检索日期 2026-07-23

先给结论

AUC 0.77–0.84 三个 TCGA 队列的患者级 MSI 检测 AUC(CRC-KR 快速冷冻最好、CRC-DX FFPE 最难)
ResNet-18 × 2 两阶段流水线:肿瘤检测器(AUC > 0.99)+ MSI 分类器
H&E only 不需要 PCR / 免疫组化,用常规染色切片即可预测 MSI

临床上 MSI-H 的胃肠道癌患者对免疫检查点抑制剂响应特别好,但只有不到一半的患者被 routinely 检测 MSI。本文证明:用一个不算大的 ResNet-18,就能从最普通的 H&E 病理切片直接把 MSI 从 MSS 里分出来,AUC 0.77–0.84。虽然还没到诊断级替代,但足以做”哪些患者值得进一步做 MSI 检测”的初筛。

关键洞察:作者证明了”病理形态学的确编码了分子层面的信息”这个假设 —— MSI-H 肿瘤的组织学(比如 poor differentiation、mucinous、TIL 密度)本来就有区别,只是人眼系统识别的能力有限,深度网络能把它拉到 clinical-utility 边缘。

研究动机

临床背景:MSI 决定免疫治疗响应

微卫星不稳定(Microsatellite Instability, MSI)是 DNA 错配修复缺陷(dMMR)的后果,主要出现在:

  • 结直肠癌(CRC):约 15% 为 MSI-H
  • 胃腺癌(STAD):约 15% 为 MSI-H
  • 子宫内膜癌等:也有较高比例(本文未覆盖)

关键临床意义:MSI-H 患者对 PD-1/PD-L1 免疫检查点抑制剂响应显著优于 MSS 患者。KEYNOTE-016 试验后,FDA 批准了 pembrolizumab 用于 dMMR/MSI-H 实体瘤(首个 tumor-agnostic 适应症)。

临床痛点:MSI 检测未 routinely 做

  • 目前主流 MSI 检测方式:PCR fragment analysisMMR 蛋白免疫组化(MLH1/MSH2/MSH6/PMS2)
  • 这两种都需要额外送检,很多医院并不对每个患者都做
  • 相比之下,H&E 染色是每个病理标本的标配 —— 如果能直接从 H&E 预测 MSI,就可以在所有患者中做初筛
Figure 1:两阶段深度学习工作流
Figure 1:先定位肿瘤区域,再切分并颜色归一化 tiles,最后训练第二个网络区分 MSI 与 MSS。图源:Kather et al., Nature Medicine 2019(PMCID: PMC7423299)。

为什么这篇论文重要:不是因为 AUC 高(其实 0.77–0.84 只能算中等),而是因为证明了这条路可行。之后一整个 MSI-from-histology 的研究方向被这篇引爆。

数学表示及建模

本文并非数学论文,方法层面主要复用 ResNet(He et al. 2016)的残差学习。核心公式:

y=F(x,{Wi})+xy = \mathcal{F}(x, \{W_i\}) + x

其中 F\mathcal{F} 是残差映射(几层卷积),xx 是残差连接(skip connection)。ResNet 的核心贡献是通过残差连接缓解深层网络的梯度消失。

MSI 分类任务是二分类:

P(MSItile)=softmax(fMSI(tile))P(\text{MSI} \mid \text{tile}) = \text{softmax}(f_{\text{MSI}}(\text{tile}))

Patient-level 得分:所有 tumor tiles 的 MSI score 聚合(论文提到 median,具体聚合函数细节需查全文核证)。

⚠️ 待核证:patient-level 聚合的确切方法(median / mean / 加权投票?)本文正文未展开,需查 Methods 或 Supplementary。

核心公式与方法

两阶段流水线

Stage 1 · 肿瘤检测
  • 模型:ResNet-18
  • 训练数据:94 slides / 81 patients,手工标注
  • 目标:把整张 WSI(whole slide image)里的肿瘤区域识别出来
  • 性能:out-of-sample AUC > 0.99
Stage 2 · MSI 分类
  • 模型:另一个 ResNet-18
  • 输入:Stage 1 检测出的肿瘤 tiles
  • 输出:每个 tile 的 MSI score ∈ [0, 1]
  • 训练标签:来自 TCGA 的 MSI/MSS ground truth

Tile-based 处理

  • 每张 WSI 切分为 tiles(论文未明说 tile 尺寸,惯例是 224×224 或 512×512)
  • 每个 tile 做颜色归一化(color normalization)—— 消除不同扫描仪、染色批次的偏差
  • 只在 tumor tiles 上跑 MSI 分类
Figure 1:MSI 分类网络
Figure 1d–e:第二个 ResNet-18 在肿瘤 tiles 上训练并输出患者级 MSI/MSS 预测。

实验设计

本文使用三个独立 TCGA 队列 + 一个多中心独立验证队列

队列N 患者样本类型Tiles 数用途
TCGA-STAD315FFPE 石蜡100,570训练 + 测试(胃癌)
TCGA-CRC-KR378快速冷冻60,894训练 + 测试(结直肠癌)
TCGA-CRC-DX360FFPE 石蜡93,408训练 + 测试(结直肠癌)
DACHS待核证多中心 CRC 队列独立验证

关键设计选择:同时用 FFPE(临床最常用的石蜡包埋)和快速冷冻两种样本类型跑,是为了证明方法能迁移到临床实际场景。FFPE 是医院日常存档格式,而快速冷冻主要在研究场景 —— 如果只在冷冻样本上有效,临床价值大打折扣。

⚠️ 待核证:DACHS 队列的具体样本数、纳入标准、模型是否 fine-tune;训练 / 测试 / 验证的具体切分比例(如 patient-level split 避免数据泄漏)。这些细节需查 Methods 与 Supplementary Table 1。

实验结果

Patient-level AUC(主要终点)

0.81 TCGA-STAD 胃癌 FFPE — 95% CI [0.69, 0.90]
0.84 TCGA-CRC-KR 结直肠癌快速冷冻 — 95% CI [0.73, 0.91]
0.77 TCGA-CRC-DX 结直肠癌 FFPE — 95% CI [0.62, 0.87]

CRC-KR(快速冷冻)表现最好、CRC-DX(FFPE)最差。这符合直觉:冷冻样本组织形态保存更好,特征更清晰;FFPE 处理会引入形态学噪声。但 FFPE 是临床常态,所以 0.77 的 AUC 才是最有临床意义的数字

Tile-level MSI Score 分布

Figure 2:MSI/MSS 空间预测与跨队列验证
Figure 2:MSI/MSS 空间预测图、DACHS 外部验证 ROC,以及 MSIness 与免疫特征的相关性。
队列MSI tiles score (median [CI])MSS tiles score (median [CI])p-value
TCGA-CRC-DX (FFPE)0.61 [0.12, 0.82]0.29 [0.08, 0.57]1.1×10⁻⁶
TCGA-CRC-KR (冷冻)0.50 [0.17, 0.80]0.22 [0.06, 0.60]7.3×10⁻¹¹

解读:两个 CI 有明显重叠 → 单个 tile 无法可靠判定 MSI;但 patient-level 聚合所有 tiles 的信息后 AUC 显著(0.77–0.84),说明”多 tile 投票”是必要的。

我的评论

亮点:
  • 首创性:MSI-from-H&E 深度学习方向的开山之作(1400+ 引用足以说明)
  • 临床可行:FFPE 石蜡样本表现证明能落地到医院日常工作流
  • 跨组织泛化:胃癌和结直肠癌都能训 + 一个 DACHS 外部验证
  • 方法简洁:没堆花哨结构,就是 ResNet-18 × 2;证明基础深度学习已足够
局限:
  • AUC 仍不够诊断级:0.77-0.84 只能做初筛,不能替代 PCR/IHC
  • ResNet-18 相对简单:后续研究用 Transformer/attention 效果显著更好(见 One More Thing)
  • 缺少前瞻性验证:TCGA + DACHS 都是回顾性数据集
  • tile-level 分类噪声大:MSI/MSS tile 分布重叠明显,依赖 patient-level 聚合
  • 子宫内膜癌未覆盖:MSI 高发的另一大类癌症本文未纳入

笔者按:这篇作为 病理 AI + 分子表型预测 的经典入门必读。它的价值不是 SOTA 数字(早被超越),而是范式验证:证明了”病理形态学 → 分子标签”这条通路对深度学习是可解的。理解 病理 AI 的读者应从这篇开始追溯。

对课题相关:若在做从空转 / H&E 预测分子标签类工作,这篇是必引;它的两阶段(先找 tumor 再分类)设计模式在空间转录组 + 病理 AI 场景仍然通用。

One More Thing

后续影响溯源:这篇论文(2019)之后,MSI-from-H&E 领域大约每 6 个月出一次 SOTA 更新。到 2024 年,MSIntuit CRC(Bilal et al.)等已获得 FDA / CE 认证,成为真正落地的诊断产品。方法学演进路径:

  1. 2019 ResNet-18 tile-based(本文)
  2. 2020-2021 EfficientNet / MIL(Multiple Instance Learning)
  3. 2022-2023 attention-based MIL / Transformer
  4. 2024+ foundation models(CTransPath, UNI, Virchow)+ 少样本迁移

⚠️ 待核证:以上时间线为笔者按记忆整理,具体年份和方法归属需查综述(比如 Chen et al. Nat BME 2024)核证。

Reference / Evidence