近日,同济大学电子与信息工程学院教师史淼晶、王瀚漓等联合同济大学附属同济医院消化内镜中心,围绕消化系统疾病智慧诊疗与报告自动生成,开发了首个基于多模态大模型的内镜诊疗系统。相关成果以“Bootstrapping Multimodal Large Language Model with Medical Knowledge for Automatic Esophagogastroduodenoscopy Diagnosis and Reporting”为题,发表于自然子刊《Nature Communications》。
论文一作和通讯作者分别来自电信学院岳子杰、史淼晶团队以及同济医院孙会会、许树长团队;主要作者马一鲲、岑天宇为史淼晶教授的博士生。

图1 本研究流程图
内镜检查是诊断消化系统疾病的重要临床手段,但诊断结果依赖内镜医生的专业经验,易出现误诊和漏诊。此外,内镜医生在完成检查后需撰写内镜报告,以记录检查所见并指导后续治疗方案的制定。该过程平均耗时约7分钟,严重制约了临床诊疗效率。
针对上述问题,研究团队提出了一种基于多模态大语言模型的消化系统疾病智能诊断与报告自动生成方法MLLM-EDR。该方法以内镜视频为输入,利用多模态大语言模型挖掘其视觉特征,进而实现解剖部位识别、背景黏膜分类、消化系统疾病诊断和内镜报告生成等任务。此外,搭建了医学知识引导的视觉特征精炼模块,利用大语言模型生成19种常见消化系统疾病的医学知识描述,进而将医学知识与内镜视觉特征交互融合,引导模型关注与疾病相关的关键病灶区域,从而提升诊断的准确性以及报告生成的完整性和可靠性。
研究团队收集了迄今为止最大的多模态内镜数据集,包含来自4461名患者的203838张内镜图像和4461份内镜报告。实验结果表明,MLLM-EDR的性能优于现有人工智能方法和内镜医生。尤其在消化道早癌诊断方面,MLLM-EDR表现出显著优势。此外,MLLM-EDR能够生成详细全面的文本报告,其完整性和准确性已达到高级内镜医生撰写报告的水平。在工作效率方面,MLLM-EDR仅需13.48秒即可完成报告生成。研究团队还进一步证明,在MLLM-EDR的辅助下,初级内镜医生的表现甚至超过了未得到辅助的高级内镜医生。上述结果表明,MLLM-EDR在优化内镜诊疗流程、提高诊断准确性、提升报告质量以及减轻内镜医生工作负担方面具有重要的临床应用潜力。
本研究是电子与信息工程学院与同济医院双方团队积极响应同济大学“人工智能+”行动计划,面向医工交叉领域,继在柳叶刀子刊《eClinicalMedicine》发表有关利用视觉基础模型进行消化系统食管胃交界处腺癌诊断工作“Development and validation of an AI foundation model for endoscopic diagnosis of esophagogastric junction adenocarcinoma: a cohort and deep learning study”后取得的又一重要成果,相关课题获得同济大学“医学+X”跨学科研究计划重点支持。
参考文献:
Miaojing Shi, Zijie Yue, Huihui Sun, Bo Li, Yikun Ma, Tianyu Cen, Ying Chen, Xiaofen Wu, Hanli Wang, Jun Wang, Shuchang Xu. Bootstrapping Multimodal Large Language Model with Medical Knowledge for Automatic Esophagogastroduodenoscopy Diagnosis and Reporting[J]. Nature Communications, 2026. doi: 10.1038/s41467-026-75377-y
论文链接:
https://www.nature.com/articles/s41467-026-75377-y
数据和源代码链接:
https://github.com/viscom-tongji/EDG-diagnosis-and-reporting