中文

跨语言潜在空间中多语言大语言模型的去偏技术

计算与语言 2025-08-26 v1 人工智能 机器学习

摘要

去偏技术如 SentDebias 旨在减少大型语言模型(LLM)中的偏见。以往研究通过直接应用于 LLM 表示来评估其跨语言可迁移性,揭示了其在不同语言间的有效性有限。本文因此提出在联合潜在空间中进行去偏,而非直接在 LLM 表示上操作。我们使用在平行中文演讲稿上训练的自编码器构建了良好对齐的跨语言潜在空间。我们的实验使用 Aya-expanse 和两种去偏技术,对四种语言(英语、法语、德语、荷兰语)进行测试,结果表明:a) 自编码器有效构建了良好的跨语言潜在空间,b) 在所学得的跨语言潜在空间中应用去偏技术显著提高了整体去偏性能和跨语言可迁移性。

关键词

引用

@article{arxiv.2508.17948,
  title  = {Debiasing Multilingual LLMs in Cross-lingual Latent Space},
  author = {Qiwei Peng and Guimin Hu and Yekun Chai and Anders Søgaard},
  journal= {arXiv preprint arXiv:2508.17948},
  year   = {2025}
}

备注

EMNLP 2025 Main