医学影像AI如何一个模型看懂多种医学影像?MedGemma开源多模态基础模型解读
医院里有胸片、病理切片、眼底照、皮肤镜等多种医学影像,但大多数AI模型只精通一种。2026年10月,Google团队在《Nature Medicine》发表开源医学视觉语言基础模型MedGemma,同时覆盖放射、病理、眼科、皮肤四类影像,还能生成放射报告——81%的胸片报告被放射科医生判定为可做出与原报告相同甚至更好的临床决策,计算成本却比最大的对比模型低约500倍。
医院里有胸片、病理切片、眼底照、皮肤镜等多种医学影像,但大多数医学影像 AI 模型只精通其中一种。2026 年 10 月,Google 团队在《Nature Medicine》发表开源医学视觉语言基础模型 MedGemma,用一个模型同时覆盖放射、病理、眼科、皮肤四类影像,还能直接生成放射报告。最直观的结果是:它生成的胸片报告中,81% 被美国认证放射科医生判定为"可做出与原报告相同甚至更好的临床决策"——超过此前更大的 Med-Gemini(73%),而计算成本却比最大的对比模型低约 500 倍。
研究背景:医学影像AI为什么需要"一个模型看懂多种影像"?
医疗场景的影像数据天然多样:放射科的胸片、病理科的切片、眼科的眼底照、皮肤科的皮损照片,各自格式不同、任务各异。过去的主流做法是每个病种、每种模态单独收集标注、单独训练一个专用模型,成本高、周期长,且换一个任务就要推倒重来。
更大的约束在于隐私:医疗数据敏感,很多场景要求模型能在本地、离线运行,数据不出院。这决定了模型既要有跨模态的通用理解力,又要足够轻、足够开放。于是,“开源、可本地部署的医学基础模型"成为一条被看好的技术路线——Google 的 Health AI Developer Foundations(HAI-DEF) 计划正是为此而生,MedGemma 就是该计划里最新、最核心的一块。
创新点:MedGemma如何做到"一模型多用”?
MedGemma 是一套基于 Gemma 3 的医学视觉语言基础模型,包含 4B 和 27B 两种规模,可"看图 + 读文 + 写文"。它的核心创新有三点:
- 医学视觉编码器 MedSigLIP:由通用视觉编码器 SigLIP-400M 改造而来,在脱敏的胸片、皮肤、眼底、病理及 CT/MRI 切片上继续预训练,给大模型"换上一双医学眼睛";
- 跨模态覆盖:一个模型同时应对放射、病理、眼科、皮肤四类影像,并保留了通用大模型读临床文本、总结病历的能力;
- 开放权重:模型权重、教程、模型卡全部公开,开发者可下载到本地 GPU 上离线推理,满足数据不出院的合规需求。
值得强调的是它的报告生成能力。MedGemma 不只是"看图识别病灶",还能输出一段可读的放射报告草稿,直接嵌入放射科医生的工作流。
技术原理:医学图文对齐 + 多模态编码
一句话讲清机制:把通用大语言模型,接到一个医学影像专用的视觉编码器上,再用海量"影像-文本"配对数据把两者对齐。
具体来说,MedGemma 的多模态版本由两部分组成——负责"看"的 MedSigLIP 视觉编码器,和负责"读、写、推理"的 Gemma 3 文本模型。输入图像会被归一化到 896×896 分辨率、编码成 256 个 token,再与文本一起送进语言模型。训练数据覆盖 2D 放射影像、病理切片、眼底、皮肤图像,以及医学问答对、基于 FHIR 的电子病历数据和化验报告等,让模型既能"看懂图",又能"读懂病历"。
关键在于通用能力几乎没有损失:MedGemma 在 MMLU Pro、Global MMLU Lite、MMMU 等通用基准上,相对同规模通用模型只有轻微下降。这意味着它既能做专业医学任务,也能正常完成指令遵循、多样对话等通用交互——这对下游应用落地很关键。
数据说话:跨模态与报告生成表现如何?
MedGemma 最亮眼的地方,是用更小的体量追平甚至反超了更大的模型。以下列出几组关键结果:
| 能力 | MedGemma 表现 | 对比基线 |
|---|---|---|
| 胸片报告生成(临床等效率) | 81% | 更大的 Med-Gemini 为 73% |
| 胸片报告 GREEN 分(ReXGradient / IU-Xray) | 0.566 / 0.724 | ReXrank 排行榜第一 |
| MedQA 医学问答(4B / 27B) | 64.4% / 89.8% | Gemma 3 4B 仅 50.7% |
| 分布外多模态问答提升 | +2.6%~10% | 相对 Gemma 3 底座 |
| 胸片病灶分类提升 | +15.5%~18.1% | 相对 Gemma 3 底座 |
| 智能体(agentic)评测提升 | +10.8% | 相对 Gemma 3 底座 |
在报告生成上,MedGemma 4B 在第三方 ReXrank 排行榜上拿下 ReXGradient 数据集 GREEN 分 0.566、IU-Xray 数据集 0.724,位居榜首。在医学问答上,27B 文本版以测试时扩展(test-time scaling)在 MedQA 上达到 89.8%,接近领先开源推理模型,推理成本却只有其约十分之一。微调后收益同样可观:电子病历信息检索错误率下降 50%,气胸分类、病理切片分类达到与专用 SOTA 相当的水平。
作者还报告了一个"效率优势":MedGemma 4B 与最昂贵的对比模型之间,计算成本相差约 500 倍。在医疗落地场景里,开发成本和算力都是硬约束,这个"体量小、性能强"的特性,比单纯的最高分更有现实意义。
应用前景与局限
MedGemma 的价值在于给医学影像 AI 提供了一条统一、开放、可本地部署的底座路线:不必为每个病种单独造轮子,一个开源基础模型就能覆盖多种模态、多种任务,再做任务级微调即可适配下游——对放射报告辅助生成、多模态辅助诊断、临床决策支持系统的构建都有直接参考意义。
但要冷静看待局限。作者明确提醒:现有基准可能已接近饱和,分数高不等于临床可用;公开基准被反复用于训练和评测,存在测试数据泄露的风险;模型在解剖定位(胸片 IoU 仅 0.16)、多区域报告等任务上仍有明显提升空间;而 4B 小模型在需要复杂指令遵循的智能体场景里表现不佳。它被定位为研究与开发底座,任何临床部署都需经过独立的验证与监管。
结论
医学影像 AI 正在从"一个病种一个专用模型",走向"一个基础模型覆盖多种影像"。MedGemma 用开源的方式证明:一个中等体量、开放权重的医学视觉语言模型,可以在胸片、病理、眼底、皮肤等多种影像上同时胜任理解与报告生成,并以更低算力接近甚至超越更大的模型。它的真正意义不在于某一项最高分,而在于把"多模态 + 可本地部署 + 开放可微调"这三件事放进同一个模型里,为下游医学影像应用降本增效铺路。
| 论文标题 | An open vision-language model for diverse medical applications |
| 作者 | Andrew Sellergren, Sahar Kazemzadeh, Fereshteh Mahvar, et al. |
| 机构 | Google Research / Google DeepMind(Health AI Developer Foundations 计划) |
| 期刊 | Nature Medicine(自然·医学) |
| 发表时间 | 2026年10月6日 |
| DOI | 10.1038/s41591-026-04626-w |
| PubMed | 待分配(在线发表) |
论文原文信息地址:https://www.simomia.com/blog/2026-10-07-medgemma-open-multimodal-vlm/
参考文献
- Sellergren A, Kazemzadeh S, Mahvar F, et al. An open vision-language model for diverse medical applications. Nature Medicine. 2026. DOI: 10.1038/s41591-026-04626-w
- Google. MedGemma 1.5 model card. Health AI Developer Foundations. 2026. https://developers.google.com/health-ai-developer-foundations/medgemma/model-card
相关问题 FAQ
医学影像AI怎么做?开源多模态基础模型能带来什么?
过去做医学影像 AI,往往要为一个病种、一种模态单独收集标注、单独训练一个专用模型,成本高、周期长。开源多模态基础模型提供了另一条路:直接下载一个已在多种影像上预训练好的底座模型(如 MedGemma),再用少量任务数据做微调即可适配下游,既省去从零训练的算力,又能通过本地部署满足数据不出院的合规要求。这也正是"医学影像AI怎么做"的一个关键趋势——从"每个任务单独造轮子"转向"一个开放底座 + 轻量微调"。
MedGemma 和 MedSigLIP 有什么区别?
两者是同一套体系里的两个角色。MedSigLIP 是一个医学专用的视觉编码器(由 SigLIP-400M 改造),负责"看"影像,适合结构化输出任务,如数据高效的分类、零样本分类和语义检索;MedGemma 则是"看图 + 读文 + 写文"的完整视觉语言模型,负责需要生成文本的任务,如放射报告生成、视觉问答和病历总结。需要生成文字用 MedGemma,只需图像表征用 MedSigLIP。
MedGemma 能取代放射科医生吗?
不能。MedGemma 被作者定位为研究与开发底座,而非临床替代工具。论文明确提醒,现有基准可能已饱和、存在测试数据泄露风险,模型在解剖定位、多区域报告等任务上仍有明显不足,4B 小模型在复杂智能体场景下也表现不佳。任何临床部署都必须经过独立的验证与监管,最终诊断决策仍需医生把关。
📄 论文原文信息
| 论文标题 | An open vision-language model for diverse medical applications |
| 作者 | Andrew Sellergren, Sahar Kazemzadeh, Fereshteh Mahvar, et al. |
| 期刊 | Nature Medicine, 2026 |
| 发表时间 | 2026年10月6日 |
| DOI | 10.1038/s41591-026-04626-w |
| PubMed | PMID: 待分配 |