编辑干预对检测本土语言痕迹的影响
计算与语言
2026-05-12 v1
摘要
本土语言识别 (NLI) 是确定作者本土语言 (L1) 从其非母语写作中的任务。随着人类-AI 协作写作的兴起,非母语文本被大型语言模型常规性校正和重写,根本改变了 NLI 模型依赖的语言特征。本文我们调查 L1 痕迹在不同程度编辑干预下的鲁棒性。通过处理来自 Write & Improve 2024 语料库的 450 篇作文,并施加不同程度的语法错误校正 (GEC) 和改写,我们表明 L1 归因并不完全依赖于表层错误。相反,检测模型利用更深层的 L1 特征:不地道的词义-语义选择、语用传递以及作者潜在的文化视角。我们发现,最小编辑保留这些结构性痕迹并维持高的剖析准确性。相比之下,流利度编辑和改写则规范化这些 L1 特征,导致性能显著下降。
引用
@article{arxiv.2605.10216,
title = {The Impact of Editorial Intervention on Detecting Native Language Traces},
author = {Ahmet Yavuz Uluslu and Mark Gales and Kate Knill and Gerold Schneider},
journal= {arXiv preprint arXiv:2605.10216},
year = {2026}
}