通过幽默探讨 LLM 中关于身份的反事实不公效应
计算与语言
2026-04-22 v1
摘要
幽默折射出社会认知:我们所认为好笑的事物往往反映我们是谁以及我们如何判断他人。在语言模型与幽默互动时,他们的反应暴露了从训练数据中内化的社会假设。本文通过观察模型在置换说话者与被讲者身份后(其他因素保持不变)其响应的变化,来探讨通过幽默实现的反事实不公效应。我们的框架涵盖三个任务:幽默生成拒绝、说话者意图推断和关系/社会影响预测,覆盖无身份中立幽默和身份特定贬义幽默。我们引入可解释的偏见指标,捕捉身份置换下的非对称模式。针对最先进的模型进行实验,发现一致的关系差异:由特权说话者讲述的笑话被拒绝率高达 67.5%,被判定为恶意的概率高达 64.7%,在 5 分制评分中社会危害评分高出约 1.5 分。这些模式揭示了敏感性和刻板印象在生成模型中的共存,使公平性和文化对齐的努力变得更加复杂。
引用
@article{arxiv.2604.18729,
title = {Investigating Counterfactual Unfairness in LLMs towards Identities through Humor},
author = {Shubin Kim and Yejin Son and Junyeong Park and Keummin Ka and Seungbeen Lee and Jaeyoung Lee and Hyeju Jang and Alice Oh and Youngjae Yu},
journal= {arXiv preprint arXiv:2604.18729},
year = {2026}
}
备注
Accepted to ACL 2026 Main Conference. The first two authors contributed equally. The last three authors are co-corresponding authors