语言模型是否言行一致?审视LLM中编码的关于性别语言改革的语言意识形态
计算与语言
2024-09-24 v1 人工智能
摘要
我们通过英语性别语言改革(涉及如congressperson/-woman/-man等角色名词和单数they)的案例研究,探讨LLM生成文本中的语言意识形态。首先,我们发现了政治偏见:当被要求使用“正确”或“自然”的语言时,LLM使用的语言与被要求与保守(相对于进步)价值观保持一致时最为相似。这表明了LLM的元语言偏好如何能够隐含地传达特定政治群体的语言意识形态,即使在看似非政治性的语境中也是如此。其次,我们发现LLM表现出内部不一致:当提供更明确的元语言语境时,LLM更频繁地使用性别中立变体。这表明LLM生成文本中表达的语言意识形态可能会有所不同,这对用户而言可能是出乎意料的。我们讨论了这些发现对价值对齐的更广泛影响。
引用
@article{arxiv.2409.13852,
title = {Do language models practice what they preach? Examining language ideologies about gendered language reform encoded in LLMs},
author = {Julia Watson and Sophia Lee and Barend Beekhuizen and Suzanne Stevenson},
journal= {arXiv preprint arXiv:2409.13852},
year = {2024}
}