中文

分析日语大语言模型在刻板印象触发提示下的安全性

计算与语言 2025-03-06 v2 计算机与社会

摘要

近年来,大语言模型 (LLM) 因其巨大潜力而备受关注,但对其固有刻板印象和偏见所引发的不安全行为的担忧也迅速出现。大多数关于 LLM 中刻板印象的研究主要依赖于间接评估设置,即提示模型在与特定社会群体相关的句子对之间进行选择。最近出现了直接评估方法,通过检查模型的开放式回答来克服以往方法的局限性,如标注者偏差。大多数现有研究聚焦于以英语为中心的 LLM,而对非英语模型(尤其是日语模型)的研究仍然匮乏,尽管这些模型的开发和应用日益增长。本研究在直接评估设置下检验了日语 LLM 在回应刻板印象触发提示时的安全性。我们通过将按年龄、性别和其他属性分类的 301 个社会群体术语与 12 个日语刻板印象诱导模板相结合,构建了 3,612 个提示。我们分析了分别在日语、英语和中文上训练的三个基础模型的回答。我们的发现表明,LLM-jp 作为一个日语原生模型,表现出最低的拒绝率,并且与其他模型相比更有可能产生有毒和负面的回答。此外,提示格式显著影响所有模型的输出,生成的回答包含对特定社会群体的夸大反应,且因模型而异。这些发现突显了日语 LLM 中伦理安全机制的不足,并表明即使是高准确率的模型在处理日语提示时也可能产生有偏见的输出。我们提倡改进日语 LLM 的安全机制和偏见缓解策略,为超越语言边界的 AI 伦理讨论做出贡献。

关键词

引用

@article{arxiv.2503.01947,
  title  = {Analyzing the Safety of Japanese Large Language Models in Stereotype-Triggering Prompts},
  author = {Akito Nakanishi and Yukie Sano and Geng Liu and Francesco Pierri},
  journal= {arXiv preprint arXiv:2503.01947},
  year   = {2025}
}

备注

This paper has been submitted to IEEE Transactions on Artificial Intelligence for possible publication