中文

通过指令微调将性别包容性融入大语言模型

计算与语言 2025-08-27 v1

摘要

想象一种具有阳性、阴性和中性语法性别的语言,然而,由于历史和政治惯例,阳性形式主要用于指代男性、女性和混合性别群体。这就是当代波兰语的现实。这种不公平语言体系的一个社会后果是,在波兰语文本上训练的大语言模型(LLM)继承并强化了这种阳性偏差,生成性别失衡的输出。本研究通过使用 IPIS 数据集对 LLM 进行微调来解决这个问题,该数据集是波兰语和波兰语到英语翻译指令的人工编写的性别包容性校对集合。基于理论语言学框架,我们设计了一个带有明确波兰语性别包容性指南的系统提示。在我们的实验中,我们对多语言 LLM(Llama-8B、Mistral-7B 和 Mistral-Nemo)以及波兰语专用 LLM(Bielik 和 PLLuM)进行了 IPIS 微调。我们的方法旨在将性别包容性作为这些模型的固有特征,为缓解波兰语生成中的性别偏差提供系统性解决方案。

关键词

引用

@article{arxiv.2508.18466,
  title  = {Integrating gender inclusivity into large language models via instruction tuning},
  author = {Alina Wróblewska and Bartosz Żuk},
  journal= {arXiv preprint arXiv:2508.18466},
  year   = {2025}
}