基础模型成医疗器械新趋势,但定义与价值仍存争议
过去一年,GE医疗、飞利浦等医疗器械公司纷纷推出或宣布构建用于MRI等影像的"基础模型"(foundation model),FDA亦在更新AI设备数据库时探索标记此类产品。然而,专家指出,基础模型的定义仍不清晰,现有工具是否真正帮助放射科医生与患者亦难以判断。斯坦福学者认为,基础模型虽在罕见病检测与AI开发速度上具潜力,但市场上尚未看到其明确优势。

编者按:本文是医疗器械行业基础模型应用两篇系列报道的第一篇。第二篇报道将于周二发布。
越来越多的医疗器械公司开始推广"基础模型"(foundation model)——一种可适配多种任务的人工智能类型。然而,该技术在医疗器械行业中的应用仍存疑问。
过去一年中,GE医疗推广了一款MRI研究基础模型;飞利浦宣布计划与英伟达合作构建MRI基础模型;在去年北美放射学会(RSNA)年会上,多篇摘要聚焦如何评估与改进基础模型。美国食品药品监督管理局(FDA)亦更新了其AI医疗器械数据库,表示正在探索识别和标记包含基础模型产品的方式。
然而,专家表示,基础模型的定义尚不明确,且难以判断当前可用工具是否真正帮助了放射科医生和患者。
什么是基础模型?
斯坦福大学放射学系博士后学者Magdalini Paschali指出,基础模型具备几个关键特征:在大型数据集上训练,且数据多为未标注;能处理多种数据类型,如图像、文本、病史和基因组学;可应对多种任务,例如检测训练中未见过的疾病。

Paschali今年早些时候在RSNA的《Radiology》期刊上发表了一篇论文,试图更清晰地界定该技术。
斯坦福大学放射学与生物医学数据科学助理教授Akshay Chaudhari表示,在实践中"几乎一切都可以被定义为基础模型"。
Chaudhari称,"基础模型"一词于2021年在斯坦福首次提出。在医疗领域,最早的版本之一是2022年底谷歌Med-PaLM的亮相——一个用于回答医学问题的大型语言模型。
Chaudhari表示,基础模型自2023年起在RSNA上开始受到更多关注。
放射学中使用的传统深度学习模型(如检测肺炎的模型)通常聚焦于特定健康状况,依赖标注数据。Radiology Partners临床人工智能副首席医疗官Nina Kottler举例说,放射科医生需要浏览图像,圈出肺炎实例或在文本报告中标注。
Chaudhari指出,基础模型在数百万张图像而非数千张图像上训练,要求标注数据并不现实。
基础模型更准确吗?
一些医疗器械开发商声称基础模型比窄域AI模型更准确。例如,生产放射分诊软件的Aidoc表示,基础模型能够加快开发更准确的AI工具。
专家表示,设备准确性取决于其构建方式。斯坦福的Paschali称,未经任何专门化或额外训练、直接"开箱即用"的基础模型,其表现可能不如特定AI工具;但一旦接触过示例和上下文,它可能表现更好。
"我们能做的最好的事情,就是查看FDA许可文件中的摘要陈述。至少在市场上,我们尚未真正看到这些基础模型的益处。"

Akshay Chaudhari
斯坦福大学放射学与生物医学数据科学助理教授
Kottler表示,由于基础模型在海量数据上训练,它们在发现罕见事件(如脑动脉瘤)方面可能表现更佳。
"当只有少数人患有某种疾病时,找到它就像大海捞针,"Kottler说,"你需要非常准确的模型才能做到这一点。"

基础模型另一个优势领域是加速其他AI模型的开发。Kottler表示,构建传统窄域AI模型可能需要六个月来清洗数据、标注数据和训练;而基础模型的不同迭代可在数周内完成。
然而在实践中,这些优势是否已转化为患者或医护团队的实际获益,难以知晓。斯坦福的Chaudhari表示,对于已通过FDA审批的基础模型,公开信息很少能支撑企业的主张。
"我们能做的最好的事情,就是查看FDA许可文件中的摘要陈述,"他说,"至少在市场上,我们尚未真正看到这些基础模型的益处。"
评估基础模型
目前,已获FDA授权的基础模型均被设计用于解决特定任务,例如Aidoc的肋骨骨折分诊工具即构建于该公司的基础模型之上。Aidoc使用其肋骨骨折分诊工具的旧版本作为前代设备,获得了510(k)许可。510(k)流程要求制造商证明其设备与可在美国销售的前代设备具有实质等同性。
Chaudhari表示,对于融合语言与图像或视频的更广泛模型,目前尚无指导方针。
一些医院已建立评估AI模型的体系,但这些体系并不完善。例如,医院会确定需求——如识别X光图像中肺炎的模型或起草X光报告的模型。
"然后他们会从本院收集1000张已知标签的图像,举办一场竞赛,看哪家供应商在该数据集上表现最佳,"Chaudhari说,"这很初级,但这确实是我们目前最好的方法,因为这是评估本地性能是否真正适合特定任务的唯一途径。"

对于拥有数据科学团队的大型学术医疗中心,这可能可行,但"很多医院只会直接部署模型,然后从中获得质量存疑的数据,"Chaudhari补充道。
Paschali表示,要测试基础模型的准确性,首先应根据模型声称的功能定义指标和任务。医院还应测试模型在不同患者亚群和不同扫描仪类型中的表现。最后,医院应对模型进行"压力测试",以识别可能出现的潜在问题,例如针对极罕见疾病的情况。
"这就是为什么与放射科医生密切合作非常重要,因为他们能帮助我们以非常彻底的方式设计压力测试,"Paschali说,"因为他们见过太多病例,知道哪些任务即使对他们来说也很困难。"
有希望的是,基础模型在不同州、不同类型医院和影像设备的大型数据集上训练,可能在部署前需要更少的评估。
"我不认为我们已经达到那个程度,至少世界上没有证据,"Chaudhari说,"但这就是这些基础模型所能提供的诱惑。"
另一个目标是,在美国放射科医生持续短缺且影像数量不断增长的背景下,解放放射科医生的时间。
"如果我们要求他们验证输出、逐一复核所有内容,"Chaudhari说,"那真的兑现了这些模型的承诺吗?"