中文

超越安全捆绑:审计Helpful and Harmless数据集

计算与语言 2025-06-05 v3 计算机与社会

摘要

为了减轻大型语言模型 (LLMs) 的危害,从人类反馈中学习 (LHF) 已被用于引导LLMs产生旨在更少危害和更有帮助的输出。尽管LHF在实践中被广泛采用,但这种反馈的质量及其作为安全缓解技术的有效性仍不明确。本研究通过审计Anthropic广泛使用的Helpful and Harmless (HH) 数据集来解决这些问题。我们的工作包括:(1) 通过人工和自动评估对数据集内容进行彻底调查;(2) 展示该数据集对模型安全性影响的实验;(3) 对引用该数据集的100篇最具影响力论文进行分析。通过我们的审计,我们展示了HH数据集中识别的概念化失败和质量问题如何通过导致不同人口群体间差异化的安全行为而产生额外的危害。我们的发现强调了在LLMs中需要更细致、更上下文敏感的安全缓解方法。

关键词

引用

@article{arxiv.2411.08243,
  title  = {Beyond the Safety Bundle: Auditing the Helpful and Harmless Dataset},
  author = {Khaoula Chehbouni and Jonathan Colaço Carr and Yash More and Jackie CK Cheung and Golnoosh Farnadi},
  journal= {arXiv preprint arXiv:2411.08243},
  year   = {2025}
}

备注

NAACL Main Conference 2025 - Accepted as an Oral