中文

HRIPBench:面向支持药物使用者的 LLM 危害减少信息提供基准测试

计算与语言 2025-07-30 v1 计算机与社会

摘要

数以百万计的个体因药物使用而面临健康风险。危害减少作为公共卫生策略,旨在改善健康结果并降低安全风险。一些大语言模型(LLM)已展现出相当程度的医学知识,具有潜力满足药物使用者(PWUD)的信息需求。然而,这些模型在相关任务中的表现尚未得到广泛探索。我们引入HRIPBench,一个用于评估LLM在危害减少信息提供中的准确性和安全风险的基准测试。基准数据集HRIP-Basic包含2,160组问答证据对。其覆盖范围包括三个任务:检查安全边界、提供定量值、推断混合使用药物的风险。我们构建指令方案和RAG方案,以评估模型基于内在知识和领域知识集成的行为。我们的结果表明,当前最先进的LLM在提供准确的危害减少信息方面仍存在挑战,有时会对PWUD造成严重的安全风险。在危害减少情境中使用LLM应谨慎限制,以避免引发不良的健康后果。 WARNING:本文包含可能引发伤害的非法内容。

关键词

引用

@article{arxiv.2507.21815,
  title  = {HRIPBench: Benchmarking LLMs in Harm Reduction Information Provision to Support People Who Use Drugs},
  author = {Kaixuan Wang and Chenxin Diao and Jason T. Jacques and Zhongliang Guo and Shuai Zhao},
  journal= {arXiv preprint arXiv:2507.21815},
  year   = {2025}
}

备注

15 pages, 5 figures, 12 tables, a dataset