中文

SafeWorld:地理多样性安全对齐

计算与语言 2024-12-10 v1 人工智能

摘要

在快速演进的大型语言模型(LLM)领域,确保安全性是一个至关重要且被广泛讨论的话题。然而,现有工作往往忽视了全球范围内文化和法律标准的地理多样性。为了展示地理多样性安全标准带来的挑战,我们引入了SafeWorld,这是一个专门设计用于评估LLM生成响应能力的新型基准,这些响应不仅要有帮助,还要在多样化的全球背景下具有文化敏感性和法律合规性。SafeWorld包含2342个测试用户查询,每个查询都基于来自50个国家和493个地区/种族的高质量、人工验证的文化规范和法律政策。在此基础上,我们提出了一种多维自动安全评估框架,用于评估响应的语境适当性、准确性和完整性。我们的评估揭示当前LLM难以满足这些标准。为了增强LLM对地理多样性安全标准的对齐,我们为直接偏好优化(DPO)对齐训练合成了有帮助的偏好对。偏好对的构建旨在鼓励LLM在必要时适当行为并提供对相关文化规范和政策的精确引用。我们训练得到的SafeWorldLM在所有三个评估维度上均大幅超越所有竞争模型,包括GPT-4o。全球人工评估者也指出在有用性和有害性评估中胜率高出近20%。我们的代码和数据可在此处找到:https://github.com/PlusLabNLP/SafeWorld。

关键词

引用

@article{arxiv.2412.06483,
  title  = {SafeWorld: Geo-Diverse Safety Alignment},
  author = {Da Yin and Haoyi Qiu and Kung-Hsiang Huang and Kai-Wei Chang and Nanyun Peng},
  journal= {arXiv preprint arXiv:2412.06483},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024