中文

编辑干预对检测本土语言痕迹的影响

计算与语言 2026-05-12 v1

摘要

本土语言识别 (NLI) 是确定作者本土语言 (L1) 从其非母语写作中的任务。随着人类-AI 协作写作的兴起,非母语文本被大型语言模型常规性校正和重写,根本改变了 NLI 模型依赖的语言特征。本文我们调查 L1 痕迹在不同程度编辑干预下的鲁棒性。通过处理来自 Write & Improve 2024 语料库的 450 篇作文,并施加不同程度的语法错误校正 (GEC) 和改写,我们表明 L1 归因并不完全依赖于表层错误。相反,检测模型利用更深层的 L1 特征:不地道的词义-语义选择、语用传递以及作者潜在的文化视角。我们发现,最小编辑保留这些结构性痕迹并维持高的剖析准确性。相比之下,流利度编辑和改写则规范化这些 L1 特征,导致性能显著下降。

关键词

引用

@article{arxiv.2605.10216,
  title  = {The Impact of Editorial Intervention on Detecting Native Language Traces},
  author = {Ahmet Yavuz Uluslu and Mark Gales and Kate Knill and Gerold Schneider},
  journal= {arXiv preprint arXiv:2605.10216},
  year   = {2026}
}