此音频为自动生成。如有问题请告知我们 反馈.

技术开发者、电子健康记录供应商和医院正在努力应对如何治理人工智能的问题,因为未来主义的算法在患者护理的运营和交付中变得越来越普遍。

人工智能采用率的增长,加上缺乏联邦政府的全面监管, 导致一些人担心行业在构建和实施这些技术方面可能拥有过大的自由度,专家们上周在佛罗里达州奥兰多举行的HIMSS会议上表示。

医院和开发者表示他们正在谨慎行事,建立了大量的内部控制和标准小组,以确保AI工具——包括基于生成式AI的工具——准确且无偏见。但鉴于算法正变得越来越复杂,阻碍了监督,这些措施可能还不够。

“对于现代AI系统,你能做到的最透明就是展示我们如何训练它的机制,以及我们如何衡量其行为。中间发生的事情是一个黑匣子。没有人知道。这是一个谜,”健康软件公司Athenahealth数据科学团队的高级架构师Heather Lane在接受采访时表示。

华盛顿目前正在努力制定一项监督AI的战略, 新的HHS工作组已于1月启动相关工作

随着监管威胁的逼近,构建AI的科技公司和从中受益的医院正在警告华盛顿不要制定可能扼杀AI未来的政策,因为其 有潜力降低医院成本、缓解医生职业倦怠并改善患者护理。

“医疗系统与政府之间存在共识——他们期望我们落实安全保障,”新泽西州医院运营商Hackensack Meridian Health的首席执行官Robert Garrett在关于人工智能的小组讨论中表示。“我们不想做的是扼杀创新。”

‘新视野’

过去一年中,谷歌和微软等科技巨头为医疗机构推出了一系列人工智能工具,并 与大型医院连锁集团合作 探索新的应用场景。它们还在 与大型电子健康记录供应商对接 ,如Epic和Meditech,以将其算法直接整合到临床医生的工作流程中。

因此,对探索人工智能感兴趣的医院从未拥有过如此多的选择。无论是经过验证的预测性人工智能(通过分析数据做出预测——越来越被视为“传统”人工智能),还是更具未来感的生成式人工智能(能够生成原创内容),都是如此。

生成式人工智能于2022年底大举进入公众视野,当时OpenAI推出了ChatGPT,这是一个基于名为GPT的大型语言模型构建的类人聊天机器人。

此后围绕医疗保健领域生成式人工智能的许多讨论,都集中在该技术是否以及何时能够取代医生。专家表示,即使这种情况真的发生,也还很遥远。

如今使用生成式人工智能的医疗机构大多聚焦于行政管理中的低风险、高回报应用场景,例如总结病历、改善护士换班交接或转录医患对话。

一位医生将听诊器放在一位老年患者的胸前。
Atrium Health的一名医生正在检查患者,同时AI支持的临床文档软件正在聆听并转录这次互动。
图片由微软提供
 

加利福尼亚州的斯坦福医疗保健系统正在试验来自EHR供应商的新软件,该软件可自动起草临床医生对患者留言的回复, 斯坦福大学应用系统主管Gary Fritz在一次小组讨论中表示。

位于田纳西州纳什维尔的范德比尔特大学医学中心甚至创建了自己的内部GPT支持聊天机器人,此前他们发现一些临床医生在现场使用ChatGPT,据Yaa Kumah-Crystal(VUMC健康IT临床主任)介绍。

梅奥诊所首席信息官Cris Ross在接受采访时表示,梅奥诊所最近发布了一份内部提案征集,征集使用生成式AI的项目,收到了超过300份回复。这家学术医疗系统此后已将范围缩小到约10个项目。

生成式AI“让我们非常 兴奋,因为我们的大量数据是基于语言和/或多模态的,”Ross说。“由于语言工具的强大功能,新的视野已经打开。”

内部管控力度加大

随着AI采用的加速, 对负责任AI的担忧也在增加。这项技术远非完美:生成式AI 已知会产生幻觉,即提供事实上不正确或不相关的答案。模型漂移——AI的性能随时间变化或退化——也是一个问题。

这项技术还引发了关于隐私、伦理和问责制的更大问题。 偏见是医疗领域 尤为严重的担忧, 一个正在努力消除 医疗服务提供和结果中历史性不平等的行业。专家表示,如果算法基于有偏见的数据训练或以有偏见的方式应用,它将延续这些偏见。

处于AI应用前沿的EHR供应商和医院表示,他们已经建立了强大的内部控制机制来监控其模型,包括验证和频繁审计。

Meditech,一家面向医院的主要供应商,已 与谷歌合作开展AI项目,其首席运营官Helen Waters在接受采访时表示,该公司在自己的数据集上广泛测试其模型,以确保信息受到保护且输出可靠。

Waters表示:“在向客户发布任何内容之前,我们在验证过程中做了大量工作。”

美国最大的EHR供应商Epic也采取了类似措施。Epic研发高级副总裁Seth Hain在接受采访时表示,一旦其所有AI模型进入客户的EHR系统,监控软件就会持续跟踪其性能。

医疗系统也保持警惕。医院高管表示,他们正在成立治理委员会来监督AI试点项目,对员工进行技术培训,并持续监控任何AI工具。

总部位于匹兹堡的综合医疗系统Highmark Health创建了一个委员会,以在生成式AI用例出现时进行监督, Highmark旗下科技子公司enGen的总裁Brian Lucotch在接受采访时表示。  Lucotch表示,该系统还成立了多个小组,致力于重新设计Highmark的业务流程,并围绕AI对员工进行培训。

非营利巨头 Providence 在针对传统 AI 的监督和接收流程之外,还围绕生成式 AI 建立了专门的治理结构,Providence 首席战略与数字官 Sara Vaezy 通过电子邮件告诉 Healthcare Dive。

这家覆盖七个州的医疗系统还在 建设基础设施,以便在 AI 部署的每个阶段(从开发到维护)进行测试、验证和监控,Vaezy 表示。

类似地,学术医疗系统 Duke Health 已建立了“基于算法的临床决策支持监督流程”,Duke 健康创新研究所的数据科学家 Michael Gao 在关于 AI 采用策略的小组讨论中表示。 该流程始于 AI 项目启动之后,并监控模型的公平性和可靠性,包括任何漂移或偏倚迹象,Gao 表示。

VUMC 也有一个流程

用于模型的接收和审查,同时确保其输出仍然适用于其患者群体,VUMC 研究与创新高级副总裁 Peter Embí 在关于 AI 落地运营的小组讨论中表示。 但“我

们知道的一件事是,当我们实际部署这些工具时,相比过去处理过的几乎所有其他工具,情况都会发生变化,”Embí 表示。 “而当这些情况发生变化时,它们可能产生非常重大的影响,甚至可能非常有害。” 监管难度日益加大

一些 AI 伦理学家和计算机科学家警告称,现有的治理可能不足以监督日益复杂的模型。

传统预测性 AI 的工作原理清晰明了,当其偏离用途时也显而易见,

传统预测性AI的工作原理清晰明了,何时偏离其目的也显而易见, 雅典娜健康公司的莱恩说道。

但对于生成式人工智能,“要掌握我们所说的‘基准真相’——即明确的正确答案——要困难得多,”莱恩说。

莱恩表示,例如,如果一个旨在标准化保险信息的人工智能输出错误,你可以参照原始数据集来明确判断。但对于基于非标准化临床笔记来总结患者完整病史的生成式人工智能,“变数要大得多,”莱恩说。“没有两位临床医生会以完全相同的方式书写同一份笔记。而生成式人工智能也不会连续两次以相同方式书写。”

因此,杜克健康首席数据科学家迈克尔·彭西纳表示,评估这些工具极其困难。

可解释性——即了解人工智能系统如何得出特定决策——的概念“已经无从谈起,”彭西纳在关于人工智能落地的小组讨论中表示。“它 确实有效,但我们并不真正知道原因。”

而在定量分析大型语言模型的表现时,“确实没有标准可言,”彭西纳说。“你如何衡量——一份书面笔记——它有多好?”

研究发现,现有AI模型的治理体系可能不够严谨,这进一步加剧了这些担忧。 即使是资源充足的机构, 根据1月发表在《新英格兰医学杂志》上的一项研究,即便有明确的预测工具使用和评估程序,它们仍在努力识别和缓解问题。

当人工智能的运作影响患者护理时,治理上的漏洞可能成为巨大问题——即使是更可了解的传统模型也是如此。

加州非营利医疗巨头萨特健康公司曾使用一种预测性AI工具,用于标记潜在的气胸病例——即空气积聚在肺部之外但胸腔之内的情况——供放射科医生参考,萨特的首席放射科医生杰森·维斯纳在一次关于AI在医疗服务中应用的小组讨论中表示。

该工具在假阳性和假阴性问题被解决之前就已集成到放射科医生的影像系统中,导致临床医生在接诊患者时看到气胸警告,尽管没有其他证据表明存在这种严重病症。

该算法在三周半后被撤下。但“有一段时间我们本可能对患者造成伤害,”维斯纳说。

华盛顿行动缓慢

AI的快速发展和应用正发生在一个多位专家描述为“拼凑式”的监管环境中。

包括 医疗保险和医疗补助服务中心国家协调员办公室 以及食品药品监督管理局在内的多个联邦机构,已针对AI的使用和质量发布了专项监管规定。 一些州也通过了 医疗AI相关立法。然而,华盛顿尚未制定出监管医疗AI的具体策略。

这一情况预计今年将有所改变,因为一个 新的卫生与公众服务部工作组正在着手构建 一套监管框架,在AI进入市场前对其进行评估,并在上市后持续监测其性能和品质。

工作组在整体战略框架方面“取得了重大进展”,并将在4月底前交付成果,包括人工智能质量与保障计划,HHS副部长顾问Syed Mohiuddin通过电子邮件告诉Healthcare Dive。Mohiuddin与ONC负责人Micky Tripathi共同领导该工作组。


“人工智能技术发展如此迅速——法规能跟得上吗?我认为不能。”

Robert Garrett

Hackensack Meridian Health首席执行官


与此同时,人工智能开发者和医疗服务提供者表示,解决方案在于私营部门 携手合作 ,分享最佳实践并制定自律准则。

由此产生的标准组织已发布 可信赖人工智能应用蓝图 ,并计划 在实践中落实这些标准 ,例如对成员使用的算法进行清点并跟踪结果。

在一次采访中,微软首席医疗官兼医疗保健副总裁David Rhew 强调,此类网络 属于公私合作伙伴关系,联邦政府目前对私营企业的实践持续拥有发言权。

但实施挑战“不会由任何一家公司甚至政府来解决。它将由正在实践的组织来解决,”Rhew表示。

一些高管表示,鉴于技术发展的闪电速度,政府在监督人工智能方面可能没有更大的角色可扮演。 鉴于技术进步的闪电般速度。

​​​“人工智能技术发展如此迅速——监管能跟得上吗?我认为不能。治理应该源自医疗行业本身,我们可以与监管机构紧密合作,”哈肯萨克大学的加勒特表示。

一些专家担心,鉴于将AI应用竞相推向市场的巨大利润动机,开发者可能会完全放任自流。对这些服务的需求正在导致 科技巨头的收入和利润滚雪球式增长 ,同时它们的 估值飙升.

“如果每个人都能在没有监管或联盟的情况下自觉遵守道德和负责任的行为,那当然最好,但这不太可能,”梅奥诊所的罗斯表示。

ONC认证与测试副主任杰夫·史密斯通过电子邮件告诉Healthcare Dive,私营部门的努力将在制定医疗AI标准方面“发挥关键作用”。但“参与这些治理组织并不能取代监管的必要性。”

在监管与创新之间寻求平衡

AI开发者表示他们愿意接受监管,但华盛顿需要谨慎,避免实施过多监管而扼杀新的进展。 

例如,过去围绕电子健康记录技术的监管曾让供应商不满,认为拖慢了产品上市速度。技术开发者不希望AI领域重蹈覆辙,尤其是考虑到该技术发展如此之快。

“我可以告诉你,我不希望它过于繁重。但我们也不希望它来得太晚。必须有一种试金石式的检验,证明我们能产出足够的信息来验证我们的假设、验证我们的模型,告诉你为什么应该信任它们,”Meditech的Waters表示。

政府在持续监控AI工具方面可以发挥帮助作用, Oracle首席健康官Nasim Afsar在接受采访时表示。

例如,在私营部门于开发和实施阶段完成尽职调查后,监管机构可以检查算法的输出结果。

“我们如何确保在多个关卡中算法都在做它们需要做的事情?首先是开发关卡,然后是医疗保健服务系统中的实施关卡,之后还需要有持续监控的环节,”Afsar表示。“从政策角度来看,这应该是什么样子?”


“我不希望它过于繁重。但我们也不希望它来得太晚。”

Helen Waters

Meditech首席运营官


Google Cloud全球医疗战略与解决方案总监Aashima Gupta认为,当AI开始用于高风险用例(如作为诊断工具)时,监管机构应更加深入地介入。

“这一切发展得太快了,仅仅一年时间,我们就在谈论各种用例。有很多讨论,而现在我们谈论的是具有实际影响的实际用例。这绝对需要监管,”Gupta在接受采访时表示。

其他专家表示,要求AI开发者提高透明度将大大有助于使其产品更值得信赖。

这一点尤其重要,因为实际上只有少数几家巨头公司负责构建大型语言模型,而“我们其余的人在某种程度上只能任其摆布,”Athenahealth的Lane表示。

“我希望看到他们提供更详细的定量信息,说明系统在正确性、遗漏方面的表现,不仅仅是在他们倾向于在白皮书中发布的受控测试集上,而是在相关的现实世界条件下,”Lane说。“如果有人能迫使大型科技公司在这方面做出改变,那非政府莫属。”

前路艰难

尽管AI利益相关方对希望华盛顿采取何种行动意见不一,但他们在一点上达成共识:试图为AI设置护栏的监管机构正面临一项西西弗斯式的任务,他们要监管的是一项不断变化且已掌握在医生手中的技术。

华盛顿将不得不应对一系列悬而未决的问题:监管不同类型的AI技术、考虑不同组织间的工作流程差异、确保所有患者都能获得AI服务、保证准确性且不加剧医疗差距,Epic的Hain表示。

“这是一条充满挑战的路径,”Hain说。

尽管私营部门主导的标准制定组织不断涌现,但美国卫生与公众服务部仍需尽快就这些问题做出表态。监管机构深知自己正走在钢丝上。

“确保人工智能在医疗保健领域得到公平、恰当、有效、可靠且安全的使用至关重要,”ONC的史密斯表示。“在满足这一关键需求的同时,让创新蓬勃发展,是ONC政策的首要目标。”

尽管如此,涉足人工智能领域的公司仍在观望华盛顿的动向——看是否会出台法规来填补标准组织未覆盖的空白,同时让私营部门自由创新,或是提出繁重的测试和报告要求,从而可能拖慢人工智能飞速发展的步伐。

“我希望在证明我们需要更多监管之前,政策能更宽松而非严格,因为这些技术将拯救生命。我们真的不想拖慢它们的步伐,”梅奥诊所的罗斯表示。“我们希望在确保安全的前提下,尽可能快地推进。”