中文

面向医疗保健的大语言模型打击

计算与语言 2025-07-14 v2 人工智能

摘要

我们报告了在2024年机器学习用于医疗保健会议(pre-conference workshop)上进行的设计过程和发现,该工作坊于2024年8月15日举行。会议参与者包括计算与临床 expertise 的混合体,尝试发现漏洞——即大语言模型(LLM)输出可能导致临床伤害的真实临床提示。与临床专家合作进行打击,可识别LLM开发者缺乏临床expertise而无法识别的漏洞。我们报告发现的漏洞,对其进行分类,并呈现对漏洞在所提供的所有LLM中的复制研究结果。

关键词

引用

@article{arxiv.2505.00467,
  title  = {Red Teaming Large Language Models for Healthcare},
  author = {Vahid Balazadeh and Michael Cooper and David Pellow and Atousa Assadi and Jennifer Bell and Mark Coatsworth and Kaivalya Deshpande and Jim Fackler and Gabriel Funingana and Spencer Gable-Cook and Anirudh Gangadhar and Abhishek Jaiswal and Sumanth Kaja and Christopher Khoury and Amrit Krishnan and Randy Lin and Kaden McKeen and Sara Naimimohasses and Khashayar Namdar and Aviraj Newatia and Allan Pang and Anshul Pattoo and Sameer Peesapati and Diana Prepelita and Bogdana Rakova and Saba Sadatamin and Rafael Schulman and Ajay Shah and Syed Azhar Shah and Syed Ahmar Shah and Babak Taati and Balagopal Unnikrishnan and Iñigo Urteaga and Stephanie Williams and Rahul G Krishnan},
  journal= {arXiv preprint arXiv:2505.00467},
  year   = {2025}
}