中文

探索大型语言模型中人类价值的多语言概念:价值对齐在语言间是否一致、可迁移且可控?

计算与语言 2024-10-03 v3

摘要

先前的研究揭示,某些抽象概念在LLM的表示空间中线性表示为方向,主要集中在英语上。本文将这一研究扩展到多语言语境,特别关注与人类价值相关的概念(即价值概念),因其对AI安全具有重要意义。通过涵盖7种人类价值类型、16种语言和3个具有不同多语言性(例如单语、双语和多语)的LLM系列的全面探索,我们首先实证确认了LLM中以多语言形式存在的价值概念。进一步对这些概念的跨语言特征进行分析,揭示了由语言资源差异引起的3个特征:跨语言不一致性、扭曲的语言关系以及高资源与低资源语言之间的单向跨语言迁移,所有这些都体现在价值概念上。此外,我们验证了利用主导语言作为源语言对LLM价值对齐能力进行跨语言控制的可行性。最终,认识到LLM的多语言性对我们结果的显著影响,我们整合了发现,并为LLM预训练的多语言数据组成提供了审慎的建议。

关键词

引用

@article{arxiv.2402.18120,
  title  = {Exploring Multilingual Concepts of Human Value in Large Language Models: Is Value Alignment Consistent, Transferable and Controllable across Languages?},
  author = {Shaoyang Xu and Weilong Dong and Zishan Guo and Xinwei Wu and Deyi Xiong},
  journal= {arXiv preprint arXiv:2402.18120},
  year   = {2024}
}

备注

EMNLP 2024 findings, code&dataset: https://github.com/shaoyangxu/Multilingual-Human-Value-Concepts