中文

多语言对齐棱镜:平衡全局与局部偏好以减少伤害

计算与语言 2024-07-09 v2 人工智能 机器学习

摘要

“对齐”这一概念的关键关切是隐含的问题:“对齐到什么上?”AI系统正在全球范围内广泛应用,但安全对齐往往聚焦于单一语言的均质场景。此外,偏好训练和安全措施常常过拟合到西方中心数据集中常见的伤害。本文探讨了在平衡双重目标时不同对齐方法的可行性:即在解决和优化非均质语言和文化偏好问题的同时,最小化全球和局部伤害。我们收集了第一套在不同语言中人工标注的红队测试提示语,区分全球性和局部性伤害,作为理解在语言和地理分布非平稳的情况下,对齐技术可靠性的实验室。虽然目前文献很少覆盖此场景(主要聚焦于英语伤害缓解),但它捕捉了全球范围内与AI系统交互的真实情形。我们在6种语言上建立了最新对齐技术的先例,性能基本保持不变。我们的工作为跨语言迁移和保障面向全球用户群体的AI系统提供了重要见解和新型优化方法。

关键词

引用

@article{arxiv.2406.18682,
  title  = {The Multilingual Alignment Prism: Aligning Global and Local Preferences to Reduce Harm},
  author = {Aakanksha and Arash Ahmadian and Beyza Ermis and Seraphina Goldfarb-Tarrant and Julia Kreutzer and Marzieh Fadaee and Sara Hooker},
  journal= {arXiv preprint arXiv:2406.18682},
  year   = {2024}
}