中文

通过迭代偏好对齐平衡医疗 AI 助手的安全性与有用性

人工智能 2025-12-05 v1 计算与语言 计算机与社会

摘要

大型语言模型 (LLM) 在医疗领域的应用日益增长,但确保其安全可信赖仍是部署的障碍。对话式医疗助手必须在避免不安全从容和过度拒绝良好查询之间取得平衡。我们提出了一种迭代后部署对齐框架,通过应用康纳-伯尔斯基优化 (KTO) 和直接偏好优化 (DPO) 对模型进行细化,以针对特定领域的安全信号进行优化。使用 CARES-18K 基准测试进行对抗鲁棒性评估,我们在多个循环中评估了四个 LLM (Llama-3B/8B、Meditron-8B、Mistral-7B)。我们的结果显示,在有害查询检测方面的安全性相关指标提升最高可达 42%,同时也呈现了与错误拒绝之间的有趣权衡,从而暴露了架构相关的校准偏差。我们还进行了消融研究,以识别自评估何时可靠,何时需要外部或微调评估家才能实现最大性能提升。我们的发现强调,在设计对话式医疗助手时,必须采用平衡患者安全、用户信任和临床实用性的最佳实践。

关键词

引用

@article{arxiv.2512.04210,
  title  = {Balancing Safety and Helpfulness in Healthcare AI Assistants through Iterative Preference Alignment},
  author = {Huy Nghiem and Swetasudha Panda and Devashish Khatwani and Huy V. Nguyen and Krishnaram Kenthapadi and Hal Daumé},
  journal= {arXiv preprint arXiv:2512.04210},
  year   = {2025}
}

备注

ML4H 2025 Proceedings, Best Paper Award