医学影像AI如何让诊断结论有据可查?UniBiomed多模态基础模型及其84个数据集验证
现有医学影像AI往往只能「给结论」却「找不到病灶」,医生难以把AI诊断结果与影像证据对应起来。香港科技大学陈浩团队联合哈佛大学等机构提出通用基础模型UniBiomed,把多模态大模型与分割模型融合,在2700万图像三元组上训练,84个数据集验证中让诊断发现与病灶分割一步到位。
研究背景:医学影像AI的结论为何难以「有据可查」?
今天的主流医学影像AI,大多"能看病"却"说不出在哪"。一个模型可以给出"疑似肺结节"的判断,却无法精确圈出结节在 CT 上的位置;另一个模型能生成一段规范的影像报告,却拿不出对应的图像证据。医生面对这种"有结论、无依据"的输出,只能退回原始影像重新逐帧核对,AI 的价值大打折扣。
这个困境的根源,在于**“诊断"和"定位"两条技术路线长期割裂**:擅长生成文本的多模态大语言模型(MLLM)不懂精确勾画病灶边界;擅长医学图像分割的模型(如 SAM 系列)又不会生成诊断文字。两者各管一段,中间缺了"把结论对应到图像区域"的桥梁。
换句话说,临床真正需要的,是一种可落地、可解释的"接地气"解读(grounded interpretation)——AI 每说一句话,都要能指出这句话在影像里的证据所在。
创新点:UniBiomed如何把「诊断」与「定位」合二为一?
2026 年 6 月 4 日,香港科技大学陈浩团队联合哈佛大学、南方医科大学第三附属医院、香港中文大学、香港大学、康奈尔医学院等机构,在《Nature Communications》发表研究,提出通用生物医学影像解读基础模型 UniBiomed。
UniBiomed 的核心主张很明确:让 AI 同时生成准确的诊断发现、并分割出对应的生物医学目标,把"下结论"和"指位置"放进同一个模型里。它有三大特点:
- 覆盖广:支持 CT、MRI、OCT、PET、病理、超声、眼底、皮肤、内镜、眼科等 10 种影像模态,从器官到病灶到细胞都能处理。
- 数据大:构建了 2700 万组"图像—区域标注—文本描述"三元组数据集,规模与多样性远超以往单一分割或单一问答数据集。
- 任务统一:在同一个训练过程中同时打通图像分割、疾病识别、区域感知诊断、视觉问答(VQA)、报告生成五类任务,而不像传统分割模型只能干一件事。
技术原理:多模态大模型 + 分割模型如何融合?
UniBiomed 的技术骨架可以概括为”一个大脑 + 一只巧手"。
“大脑"是多模态大语言模型(MLLM),负责看懂图像并生成诊断文字;“巧手"是分割大模型(Segment Anything Model,SAM2),负责勾画病灶轮廓。两者通过一个关键设计连接:MLLM 输出的语言信息,会和用户指令一起注入 SAM2 的提示编码器,让分割模型"知道该切哪里”。
在训练策略上,团队用**低秩自适应(LoRA)**轻量微调 MLLM,而 SAM2 只微调提示编码器和掩码解码器、冻结视觉编码器——这样既保留了基础模型的泛化能力,又控制了训练成本。
这条路线带来的直接好处是:分割不再是孤立任务,而是"听得懂指令"的分割。医生可以用自然语言下指令(如"把左肺的结节标出来”),模型既识别病变,又同步给出精确掩码,实现端到端的医学图像分割与分析。
数据说话:84个数据集上的表现如何?
UniBiomed 在 70 个内部数据集 + 14 个外部数据集(共 84 个)上做了系统验证,覆盖多模态分割、接地气疾病识别、接地气报告生成等任务:
| 任务 | 对比对象 | 关键结果 |
|---|---|---|
| 多模态图像分割 | BiomedParse | Dice 平均提升 10.25%(60 个内外部数据集) |
| 接地气疾病识别 | LISA | Dice 提升 3.86%、识别准确率提升 3.29% |
| ROI 分类 | MedPLIB | 准确率提升 8.32% |
| 接地气报告生成 | GLaMM / LISA | BLEU、METEOR、ROUGE_L 全面领先 |
其中,针对接地气疾病识别,团队额外构建了含 27 万张图像、15 类异常 的专用数据集;在 RadGenome 数据集上的接地气报告生成同样超过了重新实现的 GLaMM 和 LISA。作者强调,UniBiomed 不仅做分割,还能做 ROI 分类、视觉问答和报告生成——这是 MedSAM、SegVol、SAT 等传统分割基础模型做不到的。
应用前景与局限
UniBiomed 的价值在于,它把"报告生成“和”病灶定位“焊在了一起,让 AI 的诊断结论第一次有了可核对的视觉证据。对阅片量大、需要快速复核 AI 结论的影像科医生来说,这种"结论 + 定位"一步到位的形态,能显著降低"AI 说了但我不信"的核对成本。
但也要清醒看待。本研究以公开数据集和回顾性验证为主,尚未经过前瞻性临床队列检验;报告生成与分割的"准确性"主要靠 BLEU、Dice 等指标衡量,与真实诊断准确率仍有距离;2700 万三元组的文本描述来自公开数据集的既有诊断发现,难免继承原始标注的偏差。作者也明确,模型定位是辅助影像解读工具,而非替代临床判断的自主诊断系统。
结论
医学影像AI的下一程,难点已经不再是"能不能分割"或"能不能生成报告”,而是能不能把结论和证据连起来。UniBiomed 用"多模态大模型 + 分割模型"的融合,在 84 个数据集上证明了一件事:让 AI 边诊断边定位,是可行且更接近临床使用习惯的方向。它为医学影像AI从"给出答案"走向"给出可信答案"提供了一条清晰的技术路径。
| 论文标题 | A universal foundation model for grounded biomedical image interpretation |
| 作者 | Linshan Wu, Yuxiang Nie, Sunan He, Jiaxin Zhuang, Luyang Luo, Hao Chen 等 |
| 机构 | 香港科技大学、哈佛大学、南方医科大学第三附属医院、香港中文大学、香港大学、康奈尔医学院等 |
| 期刊 | Nature Communications |
| 发表时间 | 2026年6月4日(在线发表) |
| DOI | 10.1038/s41467-026-73986-1 |
| PubMed | PMID: 42243102 |
论文原文信息地址:https://www.simomia.com/blog/2026-09-25-unibiomed-grounded-biomedical-interpretation/
参考文献
- Wu L, Nie Y, He S, et al. A universal foundation model for grounded biomedical image interpretation. Nat Commun. 2026;17(1):7173. DOI: 10.1038/s41467-026-73986-1
- Ma J, He Y, Li F, et al. Segment anything in medical images. Nat Commun. 2024;15:654. DOI: 10.1038/s41467-024-44824-z
- Zhao T, Gu Y, Yang J, et al. BiomedParse: a biomedical foundation model for image parsing of everything everywhere all at once. Nat Methods. 2024;21:2485-2495. DOI: 10.1038/s41592-024-02499-w
相关问题 FAQ
医学图像分割算法有哪些?UniBiomed 和传统分割模型有什么不同?
主流的医学图像分割算法大致分为两类:一类是传统深度分割网络(如 U-Net),针对单一器官或单一模态训练,泛化能力有限;另一类是近年兴起的医学分割基础模型(如 MedSAM、SegVol、BiomedParse),用海量数据预训练后适配多任务。UniBiomed 的独特之处在于,它把分割模型和能生成文字的多模态大模型融合在一起,既能听懂自然语言指令做分割,又能同时产出诊断发现和影像报告,而不像 MedSAM 等只专注分割本身。
“接地气”(grounded)解读是什么意思?为什么 AI 的结论要能对应到图像区域?
“接地气”(grounded)解读指的是:AI 每给出一个诊断结论,都能同时指出这个结论对应的图像区域或病灶位置,让结论"有据可查"。临床医生对 AI 的顾虑之一,就是结论像"黑盒"——不知道它为什么这么说。当 AI 能把"疑似结节"和"结节的具体位置"一起呈现时,医生就能快速核对证据、决定采信与否,这正是 UniBiomed 要解决的核心问题。
UniBiomed 这类多模态基础模型会取代影像科医生吗?
不会。UniBiomed 的定位是辅助影像解读工具,用于生成参考结论和标注病灶、减轻医生重复劳动;其验证以公开数据集和回顾性为主,尚未经过前瞻性临床队列检验,报告生成与分割的指标也不同于真实诊断准确率。最终诊断责任仍由医生承担。
📄 论文原文信息
| 论文标题 | A universal foundation model for grounded biomedical image interpretation |
| 作者 | Linshan Wu, Yuxiang Nie, Sunan He, Jiaxin Zhuang, Luyang Luo, Hao Chen, et al. |
| 期刊 | Nature Communications, 2026 |
| 发表时间 | 2026年6月4日(在线发表) |
| DOI | 10.1038/s41467-026-73986-1 |
| PubMed | PMID: 42243102 |