医学影像AI如何摆脱海量标注依赖?NeuroVFM健康系统学习方法及其临床验证
前沿AI靠互联网数据训练却在神经影像上力不从心,密歇根大学团队提出健康系统学习范式,用524万份临床CT/MRI影像自监督训练出通用神经影像基础模型NeuroVFM,诊断AUROC超92%,报告生成关键错误约为GPT-5的一半。
一、研究背景
过去两年,医学影像AI的主流思路是"互联网尺度学习"——把海量网络图文喂给 GPT-5、DINOv3 这类前沿大模型,再迁移到医疗任务。这条路线在自然图像上大获成功,却在神经影像(脑 CT / MRI)上频频碰壁。
原因很现实:神经影像几乎不出现在互联网上。脑部 CT 和 MRI 是三维体数据,格式复杂、高度依赖专业解读,更关键的是三维重建后可能还原出患者面部,涉及隐私合规。于是,通用视觉-语言模型在脑影像上缺乏训练素材,而医院 PACS 档案里却躺着数百万份从未被利用的临床影像。
这个矛盾——“通用模型没数据、医院有数据没模型”——正是密歇根大学团队这项研究的出发点。
二、研究创新点
2026 年 7 月,密歇根大学机器学习神经外科实验室的 Todd Hollon 团队在《Nature Medicine》发表研究,提出一种全新范式——“健康系统学习”(health system learning):不做数据策展、不用人工标注、不依赖放射报告监督,直接从一家医院近 20 年(2005—2025)积累的、原封不动的常规临床影像里自监督学习。
团队据此训练出通用神经影像基础模型 NeuroVFM(Neuroimaging Vision Foundation Model),训练集 UM-NeuroImages 包含 566,915 例神经影像检查、共 524 万个临床 CT/MRI 体积。一个冻结的视觉编码器,即可覆盖 156 项诊断任务(82 项 CT + 74 项 MRI),并延伸至放射学报告生成。
三、技术原理
NeuroVFM 的核心是 Vol-JEPA,一种体积级联合嵌入预测架构,它区别于传统掩码自编码器(MAE)的关键在于"在隐空间预测,而非在像素空间重建"。
具体做法是:先把三维影像切成体积 token,去除背景后,划分为较小的可见区域(context)和更大的掩码目标区域;在线(student)3D 视觉 Transformer 编码 context,再由 predictor 结合位置编码预测掩码区域在隐空间中的表示;离线(teacher)编码器看到完整影像提供目标,通过指数滑动平均(EMA)更新、梯度停止,最终用平滑 L1 损失对齐预测与目标。
打个比方:像素重建好比被要求画出幕布后的每一根线,而隐空间预测只需描述"幕布后是什么概念"。医学影像充满扫描噪声与无关纹理,重建式模型会把容量浪费在记忆这些"线"上;JEPA 预测的是"概念",学到的表征自然聚焦于解剖结构而非伪影。
四、实验结果
在 156 项诊断任务上,NeuroVFM 的 CT 宏平均 AUROC 达 92.68、MRI 达 92.49,全面超过 HLIP、NeuroMAE、DINOv3、BiomedCLIP 等基线。
更引人注目的是报告生成。把轻量开源语言模型 Qwen3-14B 以 LLaVA 式接入编码器后,NeuroVFM 生成的放射学报告,关键发现错误率约为 GPT-5 的一半(约 10% 对约 20%),幻觉发现和左右侧错误更少,临床专家偏好比例超过 2:1。
在一项为期一周(2026 年 1 月 18—25 日)、覆盖 1,155 例急诊神经影像的前瞻性研究中,NeuroVFM 对急症与非急症的分诊平衡准确率达 92.6%,远高于 GPT-5 系统的 71.2%。
值得一提的是成本:整个 Vol-JEPA 预训练只用了不到 1,000 GPU 小时,而 DINOv3 式基线需要其 7 倍以上。
五、应用前景
这项工作的价值,对影像辅助诊断和多模态影像融合分析尤为直接。NeuroVFM 把 CT 和 MRI 映射到同一个神经解剖隐空间,天然解决了多模态影像融合的表示难题;接上语言模型即可生成结构化报告初稿,为影像报告智能生成提供了新思路。
更重要的是,健康系统学习范式与私有化部署高度契合——模型就在医院自己的影像和流程里训练,数据不出院,天然满足医疗数据安全与患者隐私要求。这与思陌医学影像分析"本地化部署、数据不出院"的服务定位一致,也为医院用自有数据训练专属影像AI提供了可复制的技术框架。
当然,研究也坦诚披露了局限:在 155 名确有危急发现的患者中,NeuroVFM 生成的报告漏掉了 21 例关键发现(作者强调是漏掉影像学发现,而非错误分诊);模型目前仍是研究工具,未经批准用于临床决策,跨机构验证仍有待开展。
六、结论
NeuroVFM 表明,构建通用医学影像AI未必依赖互联网海量数据或昂贵的人工标注——医院日常诊疗产生的影像本身,就可能成为训练高质量基础模型的原料。健康系统学习这一范式,为临床基础模型提供了可扩展的框架,也让"一家医院训练自己的专属影像AI"从理想走向现实。
参考文献
- Kondepudi A, Rao A, Zhao C, et al. Health system learning enables generalist neuroimaging models. Nat Med. 2026;32(8):2831-2837. DOI: 10.1038/s41591-026-04497-1
- Zhou Y, Chia MA, Wagner SK, et al. A foundation model for generalizable disease detection from retinal images. Nature. 2023;622:156-163. DOI: 10.1038/s41586-023-06555-x
- Zhang S, Xu Y, Usuyama N, et al. A multimodal biomedical foundation model trained from fifteen million image-text pairs. NEJM AI. 2025;2(4):AIoa2400640. DOI: 10.1056/AIoa2400640
论文原文信息地址:https://www.simomia.com/blog/2026-09-14-neurovfm-health-system-learning/
📄 论文原文信息
| 论文标题 | Health system learning enables generalist neuroimaging models |
| 作者 | Akhil Kondepudi, Akshay Rao, Chenhui Zhao, Yiwei Lyu, Samir Harake, Soumyanil Banerjee, Jacob Ogle, Rushikesh Joshi, Anna-Katharina Meissner, Xinhai Hou, Cheng Jiang, Asadur Chowdury, Ashok Srinivasan, Brian Athey, Vikas Gulani, Aditya Pandey, Honglak Lee, Todd Hollon |
| 期刊 | Nature Medicine, 2026; 32(8): 2831-2837 |
| 发表时间 | 2026年7月10日(在线发表) |
| DOI | 10.1038/s41591-026-04497-1 |
| PubMed | PMID: 42432292 |