医学影像AI如何像放射科医生一样学习诊断?RadiSim-CL课程学习视觉语言模型解读
医学影像AI长期存在一个尴尬:模型在公开基准上“看图识病”很准,一到真实临床却常常“认得出病灶、下不了诊断”。上海科技大学沈定刚团队联合联影智能在《npj Digital Medicine》发表RadiSim-CL,把训练过程改造成“课程学习”,让模型像放射科医生一样从基础到进阶、由浅入深地学。在覆盖MR、CT、DR三种模态的24个零样本任务上,它在最难的疾病分型与分级环节显著领先——脑膜瘤WHO分级准确率0.764,而通用基线BiomedCLIP只有0.349。
医学影像 AI 目前最大的尴尬,是"会看图、不会诊断":模型在公开基准上识别病灶很准,一到真实临床却常常"认得出病灶、下不了诊断"。2026 年,上海科技大学沈定刚团队联合联影智能在《npj Digital Medicine》发表 RadiSim-CL,给出了一条直接模仿放射科医生成长路径的思路——把训练过程改造成"课程学习",让模型像医生一样从基础到进阶、由浅入深地学。结果在覆盖 MR、CT、DR 三种模态的 24 个零样本任务上,它在最难的"疾病分型与分级"环节显著领先:脑膜瘤 WHO 分级准确率达到 0.764,而通用医学基线 BiomedCLIP 只有 0.349。
研究背景:医学影像AI为什么"认得出"却"诊断不了"?
放射影像(MR、CT、DR)是疾病诊断和治疗评估的重要依据,但影像数据的增速远远跑赢医生数量——全球放射科人力年增长仅 0.7%,阅片压力持续加大。
现有医学视觉语言模型(MVLM,即把影像和文本对齐、用自然语言理解医学图像的模型)虽然展现了潜力,却有三大短板:
- 数据质量:部分模型依赖噪声较高的公开图文数据;
- 适用范围:部分模型局限于单一疾病或单一模态;
- 评价方式:现有评测难以反映放射科医生"从基础识别到复杂诊断推理"的能力形成过程。
一句话总结:这些模型往往被塞进一个"大杂烩"里随机训练,于是它们"认得器官、认得出病名",却很难做更高级的细粒度鉴别——而这恰恰是临床诊断最核心、最难的部分。
创新点:RadiSim-CL如何"像放射科医生一样学习"?
RadiSim-CL 的核心主张,用一句话概括就是:没有放射科医生一上来就学脑膜瘤分级,能力是按顺序长出来的。
作者观察到,放射科医生的成长有明确阶梯:先分清 MR、CT、DR,再能说出图像里是什么器官、在哪个位置,接着能识别异常和疾病,最后才能做疾病分型与分级。于是他们把这条路径原样搬进训练,设计了三阶段课程学习(Curriculum Learning):
- 基础知识理解:先学医学图像与文本的基础对应关系;
- 解剖知识获取:再强化对人体解剖结构及空间关系的理解;
- 高级诊断推理:最后学异常检测、疾病诊断、分型和分级等高阶任务。
为了支撑这套"课程",团队专门构建了 RadiSim 数据集:从 6118 万组影像-文本对出发(含 962 万组私有医院数据、5156 万组来自 PMC-OA、CheXpert、MIMIC-CXR 等 7 个公开库的数据),经过系统清洗、筛选和语义增强,最终筛出 1200 万组高质量放射影像-文本对,并按知识层级组织为基础医学图文、解剖结构相关、诊断报告相关三大类。
技术原理:三阶段课程学习 + 双塔视觉语言模型
一句话讲机制:让"看图"和"读文"两个编码器,按从易到难的课程顺序逐步对齐。
RadiSim-CL 采用经典的双塔(dual encoder)视觉语言架构:一个图像编码器(ViT-B/16 SigLIP)负责看影像,一个文本编码器(基于 BioMedBERT)负责读报告,两者被投影到同一个 768 维空间里,通过"图像-文本"对比学习拉近匹配对、推远不匹配对。所谓"零样本"诊断,就是在推理时把候选疾病类别名称编码成文本向量,与图像向量算相似度,得分最高的就是模型判断。
关键创新不在架构,而在训练顺序。传统做法是把所有图文对丢进一个池子随机采样,导致"腹部轴位 CT"和"低分化浸润性腺癌"从第一步起就以同等权重出现;RadiSim-CL 则把 1200 万图文对按难度分成三层,每个阶段都在前一阶段的 checkpoint 上继续微调,让早期学到的视觉-语义结构保留到更难的教材里。配套地,它用 SigLIP 损失替代批量 softmax,避免把"语义相近但并非同一对"的图文对误罚——这对很多描述几乎相同的放射报告尤其重要。
数据说话:多模态零样本诊断表现如何?
RadiSim-CL 在覆盖 MR、CT、DR 三类模态、共 24 个零样本子任务的五阶段评估里,呈现一个清晰规律:基础任务与最强基线打平,越到"细粒度推理"环节,优势越大。
| 任务 | RadiSim-CL | 最强基线对比 |
|---|---|---|
| 影像模态识别(准确率) | 0.996 | 高于 BiomedCLIP / MedSigLIP |
| MRI 十器官识别(Macro AUC) | 0.888 | 与 SOTA 相当 |
| 脑肿瘤检测(AUC) | 0.953 | 与 SOTA 相当 |
| 脑肿瘤分型·外部MR(准确率) | 0.835 | BiomedCLIP 0.727 |
| 脑膜瘤 WHO 分级(准确率) | 0.764 | MedCLIP 0.668 / BiomedCLIP 0.349 |
| 肺腺癌亚型 AAH/MIA/IAC(准确率) | 0.806 | BiomedCLIP 0.648 |
最说明问题的是脑膜瘤分级——这是放射诊断里典型的"高难动作",需要区分 WHO 1–3 级的细微结构差异。RadiSim-CL 做到 0.764,而通用医学模型 BiomedCLIP 只有 0.349、MedSigLIP 只有 0.402,差距悬殊。消融实验进一步坐实了"课程学习"的功劳:在肺炎诊断上,把训练从"随机混合"改成"课程式",AUC 直接从 0.315 跳到 0.852,说明训练顺序和数据组织方式对医学视觉语言模型的能力形成至关重要。
应用前景与局限
RadiSim-CL 的价值在于,它为医学影像 AI 提供了一条可扩展、贴合临床认知的预训练范式:不必为每个病种、每种模态单独收集标注、单独训练,一个经过课程学习练就的通用底座,就能在多种模态、多个诊断层级上做零样本辅助诊断——对放射影像辅助诊断、智能筛查和临床决策支持系统的构建都有直接参考意义。
但也要冷静看局限。作者明确指出:模型目前只处理静态图文对,缺少时间/纵向信息,尚无法追踪疾病进展;也尚未扩展到自动报告生成、多模态电子病历(EMR)整合和实时决策支持;训练顺序的优化、可解释性增强,以及"捷径学习(shortcut learning)“和域偏差的检测与抑制,仍是安全落地前必须补的课。它被定位为决策支持与筛查辅助工具,不能替代医生在高风险场景下的综合临床判断。
结论
医学影像 AI 从"认得出"到"诊断得了”,差的往往不是更大的模型,而是更合理的训练路径。RadiSim-CL 用"像放射科医生一样学习"的课程学习策略,证明了一条朴素的道理:按临床认知顺序组织数据、由浅入深地训练,比把海量图文对一锅炖更能长出高级诊断推理能力。它不追求炫技的新架构,却在一个长期被"随机采样"掩盖的环节——训练顺序——上做出了扎实的改进,这或许比单个模型的分数更值得临床落地参考。
| 论文标题 | Learning Like a Radiologist: A Medical Vision-Language Model for Radiological Image Analysis via Curriculum Learning |
| 作者 | Minhui Tan, Qingxia Wu, Boyang Zhang, Genqiang Ren, Jianlong Nie, Zhong Xue, Yiqiang Zhan, Sean Zhou, Xiaohuan Cao, Dinggang Shen |
| 机构 | 上海科技大学(沈定刚团队,第一完成单位)、上海联影智能、北京联影智能、上海临床研究中心 |
| 期刊 | npj Digital Medicine(数字医学) |
| 发表时间 | 2026年6月(在线发表,Article in Press) |
| DOI | 10.1038/s41746-026-02713-3 |
| PubMed | 待分配(Article in Press) |
论文原文信息地址:https://www.simomia.com/blog/2026-10-05-radsim-cl-curriculum-learning-vlm/
参考文献
- Tan M, Wu Q, Zhang B, et al. Learning Like a Radiologist: A Medical Vision-Language Model for Radiological Image Analysis via Curriculum Learning. npj Digital Medicine. 2026. DOI: 10.1038/s41746-026-02713-3
- Zhai X, Mustafa B, Kolesnikov A, et al. Sigmoid Loss for Language Image Pre-Training. IEEE/CVF International Conference on Computer Vision (ICCV). 2023. DOI: 10.48550/arXiv.2303.15343
相关问题 FAQ
医学视觉语言模型(MVLM)是什么?
医学视觉语言模型,是指把医学影像和自然语言文本对齐、让模型"既看得懂图、又读得懂报告"的一类模型。它通过对比学习拉近"图像-文本"匹配对,从而具备零样本诊断能力——推理时把候选疾病名称编码成文本向量,与图像向量算相似度即可给出判断,无需针对每个任务重新标注训练。RadiSim-CL 正是这类模型,覆盖 MR、CT、DR 三种模态。
课程学习(Curriculum Learning)在医学影像AI里有什么用?
课程学习就是模仿人类"由易到难、循序渐进"的学习方式,先学简单任务、再逐步加难,而不是把全部数据随机混在一起训练。在 RadiSim-CL 里,它把 1200 万图文对按"基础医学知识—解剖知识—高级诊断推理"三层组织,每个阶段在前一阶段基础上继续微调。消融实验证明它确实有效:肺炎诊断任务上,课程式训练让 AUC 从 0.315 提升到 0.852,说明训练顺序对医学视觉语言模型的能力形成至关重要。
RadiSim-CL 能取代放射科医生吗?
不能。RadiSim-CL 被作者明确定位为决策支持与筛查辅助工具,而非替代医生。它目前只处理静态图文对、缺少时间与纵向信息,尚未扩展到自动报告生成、多模态电子病历整合和实时决策支持,且存在可解释性不足、“捷径学习"和域偏差等风险。在高风险的临床场景中,最终的综合诊断仍需医生把关。
📄 论文原文信息
| 论文标题 | Learning Like a Radiologist: A Medical Vision-Language Model for Radiological Image Analysis via Curriculum Learning |
| 作者 | Minhui Tan, Qingxia Wu, Boyang Zhang, Genqiang Ren, Jianlong Nie, Zhong Xue, Yiqiang Zhan, Sean Zhou, Xiaohuan Cao, Dinggang Shen |
| 期刊 | npj Digital Medicine, 2026 |
| 发表时间 | 2026年6月(在线发表,Article in Press) |
| DOI | 10.1038/s41746-026-02713-3 |
| PubMed | PMID: 待分配 |