中文

VITAL:用于基准测试医疗领域多元对齐的新数据集

计算与语言 2025-06-03 v2 人工智能 机器学习

摘要

对齐技术已成为确保大型语言模型(LLMs)生成符合人类价值观输出的核心。然而,现有的对齐范式通常建模平均或单一的偏好,未能考虑跨文化、人口统计和社区的多元观点。这一局限性在医疗相关场景中尤为关键,由于文化、宗教、个人价值观和冲突意见的影响,多元性在此至关重要。尽管在多元对齐方面取得了进展,但此前尚无工作聚焦于医疗领域,这可能是由于缺乏公开可用的数据集。为填补这一空白,我们引入了 VITAL,一个新的基准数据集,包含 13.1K 个蕴含价值观的情境和 5.4K 个专注于医疗领域的多项选择题,旨在评估和基准测试多元对齐方法。通过对八种不同规模的 LLMs 进行广泛评估,我们证明了现有的多元对齐技术在有效适应多样化的医疗保健信念方面存在不足,凸显了在特定领域定制 AI 对齐的必要性。这项工作突出了当前方法的局限性,并为开发特定于医疗领域的对齐解决方案奠定了基础。

关键词

引用

@article{arxiv.2502.13775,
  title  = {VITAL: A New Dataset for Benchmarking Pluralistic Alignment in Healthcare},
  author = {Anudeex Shetty and Amin Beheshti and Mark Dras and Usman Naseem},
  journal= {arXiv preprint arXiv:2502.13775},
  year   = {2025}
}

备注

Accepted to ACL 2025 (Main Proceedings)