中文

当 AI 编写文章时,谁的声音被保留了?在大语言模型中衡量世界英语变体的文化标记消失

人机交互 2026-02-26 v1 人工智能 计算与语言

摘要

大语言模型(LLMs)越来越多地用于“专业化”工作场所沟通,往往以牺牲语言身份为代价。我们提出“文化幽灵”(Cultural Ghosting)概念,即在文本处理过程中消除非母语英语变体独特语言标记的系统性现象。通过分析 22,350 个由 1,490 个带文化标记文本(印度英语、新加坡英语和尼日利亚英语)由五个模型在三个提示条件下生成的 LLM 输出,我们使用两种新指标衡量该现象:身份消失率(IER)和语义保存分数(SPS)。在所有提示条件下,我们发现整体 IER 为 10.26%,模型间差异从 3.5% 到 20.5%(5.9 倍范围)。关键的是,我们识别出一种语义保存悖论:模型保持高语义相似度(平均 SPS = 0.748),同时系统性地消除文化标记。礼貌标记(礼貌惯例)比词汇标记(71.5% vs. 37.1% 消失)更易受影响。我们的实验表明,明确的文化保存提示可在不牺牲语义质量的情况下将消失率降低 29%。

关键词

引用

@article{arxiv.2602.22145,
  title  = {When AI Writes, Whose Voice Remains? Quantifying Cultural Marker Erasure Across World English Varieties in Large Language Models},
  author = {Satyam Kumar Navneet and Joydeep Chandra and Yong Zhang},
  journal= {arXiv preprint arXiv:2602.22145},
  year   = {2026}
}