通过内容完整性保持实现身份鲁棒的语言模型生成
计算与语言
2026-01-15 v1
摘要
大型语言模型(LLM)的输出通常因用户的社会人口属性而异,导致在事实准确性、效用和安全性方面存在差异,即使对于人口统计信息无关的客观问题也是如此。与先前关于刻板印象或代表性偏见的工作不同,本文研究了核心响应质量的身份依赖性退化。我们实证表明,尽管事实知识在不同身份间被稳健编码,但这种退化源于有偏的生成行为。受这种不匹配的启发,我们提出了一个用于身份鲁棒生成的轻量级、免训练框架,该框架选择性地中和非关键身份信息,同时保持语义上必不可少的属性,从而维持输出内容完整性。在四个基准测试和 18 个社会人口身份上的实验表明,与原始提示相比,身份依赖性偏见平均减少了 77%,相对于基于提示的防御减少了 45%。我们的工作填补了在缓解提示中用户身份线索对核心生成质量影响方面的关键空白。
引用
@article{arxiv.2601.09141,
title = {Identity-Robust Language Model Generation via Content Integrity Preservation},
author = {Miao Zhang and Kelly Chen and Md Mehrab Tanjim and Rumi Chunara},
journal= {arXiv preprint arXiv:2601.09141},
year = {2026}
}