← 行业动态

医学影像AI如何让诊断结论有据可查?UniBiomed多模态基础模型及其84个数据集验证

现有医学影像AI往往只能「给结论」却「找不到病灶」,医生难以把AI诊断结果与影像证据对应起来。香港科技大学陈浩团队联合哈佛大学等机构提出通用基础模型UniBiomed,把多模态大模型与分割模型融合,在2700万图像三元组上训练,84个数据集验证中让诊断发现与病灶分割一步到位。

研究背景:医学影像AI的结论为何难以「有据可查」?

今天的主流医学影像AI,大多"能看病"却"说不出在哪"。一个模型可以给出"疑似肺结节"的判断,却无法精确圈出结节在 CT 上的位置;另一个模型能生成一段规范的影像报告,却拿不出对应的图像证据。医生面对这种"有结论、无依据"的输出,只能退回原始影像重新逐帧核对,AI 的价值大打折扣。

这个困境的根源,在于**“诊断"和"定位"两条技术路线长期割裂**:擅长生成文本的多模态大语言模型(MLLM)不懂精确勾画病灶边界;擅长医学图像分割的模型(如 SAM 系列)又不会生成诊断文字。两者各管一段,中间缺了"把结论对应到图像区域"的桥梁。

换句话说,临床真正需要的,是一种可落地、可解释的"接地气"解读(grounded interpretation)——AI 每说一句话,都要能指出这句话在影像里的证据所在。

创新点:UniBiomed如何把「诊断」与「定位」合二为一?

2026 年 6 月 4 日,香港科技大学陈浩团队联合哈佛大学、南方医科大学第三附属医院、香港中文大学、香港大学、康奈尔医学院等机构,在《Nature Communications》发表研究,提出通用生物医学影像解读基础模型 UniBiomed。

UniBiomed 的核心主张很明确:让 AI 同时生成准确的诊断发现、并分割出对应的生物医学目标,把"下结论"和"指位置"放进同一个模型里。它有三大特点:

  • 覆盖广:支持 CT、MRI、OCT、PET、病理、超声、眼底、皮肤、内镜、眼科等 10 种影像模态,从器官到病灶到细胞都能处理。
  • 数据大:构建了 2700 万组"图像—区域标注—文本描述"三元组数据集,规模与多样性远超以往单一分割或单一问答数据集。
  • 任务统一:在同一个训练过程中同时打通图像分割、疾病识别、区域感知诊断、视觉问答(VQA)、报告生成五类任务,而不像传统分割模型只能干一件事。

技术原理:多模态大模型 + 分割模型如何融合?

UniBiomed 的技术骨架可以概括为”一个大脑 + 一只巧手"。

“大脑"是多模态大语言模型(MLLM),负责看懂图像并生成诊断文字;“巧手"是分割大模型(Segment Anything Model,SAM2),负责勾画病灶轮廓。两者通过一个关键设计连接:MLLM 输出的语言信息,会和用户指令一起注入 SAM2 的提示编码器,让分割模型"知道该切哪里”。

在训练策略上,团队用**低秩自适应(LoRA)**轻量微调 MLLM,而 SAM2 只微调提示编码器和掩码解码器、冻结视觉编码器——这样既保留了基础模型的泛化能力,又控制了训练成本。

UniBiomed多模态大模型与分割模型融合的技术流程示意图

这条路线带来的直接好处是:分割不再是孤立任务,而是"听得懂指令"的分割。医生可以用自然语言下指令(如"把左肺的结节标出来”),模型既识别病变,又同步给出精确掩码,实现端到端的医学图像分割与分析。

数据说话:84个数据集上的表现如何?

UniBiomed 在 70 个内部数据集 + 14 个外部数据集(共 84 个)上做了系统验证,覆盖多模态分割、接地气疾病识别、接地气报告生成等任务:

任务 对比对象 关键结果
多模态图像分割 BiomedParse Dice 平均提升 10.25%(60 个内外部数据集)
接地气疾病识别 LISA Dice 提升 3.86%、识别准确率提升 3.29%
ROI 分类 MedPLIB 准确率提升 8.32%
接地气报告生成 GLaMM / LISA BLEU、METEOR、ROUGE_L 全面领先

其中,针对接地气疾病识别,团队额外构建了含 27 万张图像、15 类异常 的专用数据集;在 RadGenome 数据集上的接地气报告生成同样超过了重新实现的 GLaMM 和 LISA。作者强调,UniBiomed 不仅做分割,还能做 ROI 分类、视觉问答和报告生成——这是 MedSAM、SegVol、SAT 等传统分割基础模型做不到的。

UniBiomed在84个数据集上的分割与报告生成关键结果对比

应用前景与局限

UniBiomed 的价值在于,它把"报告生成“和”病灶定位“焊在了一起,让 AI 的诊断结论第一次有了可核对的视觉证据。对阅片量大、需要快速复核 AI 结论的影像科医生来说,这种"结论 + 定位"一步到位的形态,能显著降低"AI 说了但我不信"的核对成本。

但也要清醒看待。本研究以公开数据集和回顾性验证为主,尚未经过前瞻性临床队列检验;报告生成与分割的"准确性"主要靠 BLEU、Dice 等指标衡量,与真实诊断准确率仍有距离;2700 万三元组的文本描述来自公开数据集的既有诊断发现,难免继承原始标注的偏差。作者也明确,模型定位是辅助影像解读工具,而非替代临床判断的自主诊断系统。

结论

医学影像AI的下一程,难点已经不再是"能不能分割"或"能不能生成报告”,而是能不能把结论和证据连起来。UniBiomed 用"多模态大模型 + 分割模型"的融合,在 84 个数据集上证明了一件事:让 AI 边诊断边定位,是可行且更接近临床使用习惯的方向。它为医学影像AI从"给出答案"走向"给出可信答案"提供了一条清晰的技术路径。

论文标题A universal foundation model for grounded biomedical image interpretation
作者Linshan Wu, Yuxiang Nie, Sunan He, Jiaxin Zhuang, Luyang Luo, Hao Chen 等
机构香港科技大学、哈佛大学、南方医科大学第三附属医院、香港中文大学、香港大学、康奈尔医学院等
期刊Nature Communications
发表时间2026年6月4日(在线发表)
DOI10.1038/s41467-026-73986-1
PubMedPMID: 42243102

论文原文信息地址:https://www.simomia.com/blog/2026-09-25-unibiomed-grounded-biomedical-interpretation/

参考文献

  1. Wu L, Nie Y, He S, et al. A universal foundation model for grounded biomedical image interpretation. Nat Commun. 2026;17(1):7173. DOI: 10.1038/s41467-026-73986-1
  2. Ma J, He Y, Li F, et al. Segment anything in medical images. Nat Commun. 2024;15:654. DOI: 10.1038/s41467-024-44824-z
  3. Zhao T, Gu Y, Yang J, et al. BiomedParse: a biomedical foundation model for image parsing of everything everywhere all at once. Nat Methods. 2024;21:2485-2495. DOI: 10.1038/s41592-024-02499-w

相关问题 FAQ

医学图像分割算法有哪些?UniBiomed 和传统分割模型有什么不同?

主流的医学图像分割算法大致分为两类:一类是传统深度分割网络(如 U-Net),针对单一器官或单一模态训练,泛化能力有限;另一类是近年兴起的医学分割基础模型(如 MedSAM、SegVol、BiomedParse),用海量数据预训练后适配多任务。UniBiomed 的独特之处在于,它把分割模型和能生成文字的多模态大模型融合在一起,既能听懂自然语言指令做分割,又能同时产出诊断发现和影像报告,而不像 MedSAM 等只专注分割本身。

“接地气”(grounded)解读是什么意思?为什么 AI 的结论要能对应到图像区域?

“接地气”(grounded)解读指的是:AI 每给出一个诊断结论,都能同时指出这个结论对应的图像区域或病灶位置,让结论"有据可查"。临床医生对 AI 的顾虑之一,就是结论像"黑盒"——不知道它为什么这么说。当 AI 能把"疑似结节"和"结节的具体位置"一起呈现时,医生就能快速核对证据、决定采信与否,这正是 UniBiomed 要解决的核心问题。

UniBiomed 这类多模态基础模型会取代影像科医生吗?

不会。UniBiomed 的定位是辅助影像解读工具,用于生成参考结论和标注病灶、减轻医生重复劳动;其验证以公开数据集和回顾性为主,尚未经过前瞻性临床队列检验,报告生成与分割的指标也不同于真实诊断准确率。最终诊断责任仍由医生承担。

📄 论文原文信息

论文标题A universal foundation model for grounded biomedical image interpretation
作者Linshan Wu, Yuxiang Nie, Sunan He, Jiaxin Zhuang, Luyang Luo, Hao Chen, et al.
期刊Nature Communications, 2026
发表时间2026年6月4日(在线发表)
DOI10.1038/s41467-026-73986-1
PubMedPMID: 42243102