数据干扰:表情符号、同形字符及其在语料库及结果中的数据保真性问题
计算与语言
2025-07-03 v1
摘要
分词——即将文本分割为原子单元的过程(Brezina & Timperley, 2017: 1)——是语料库语言学中的关键步骤,它为任何可应用的定量方法(如共指词)提供基础,同时确保定性方法的可靠性。本文考察了分词差异如何影响语言数据的表征以及分析发现的有效性:调查表情符号和同形字符所带来的挑战,研究强调了为维持语料库对源数据的保真性而必须对这些元素进行预处理的必要性。该研究提出了确保数字文本在语料库中准确表现的方法,从而支持可靠的语言分析,保证语言解释的可重复性。研究结果强调,需详细理解数字文本数据所涉及的语言和技术方面,以提高语料库分析的准确性,对语料库研究中的定量和定性方法都有重要影响。
引用
@article{arxiv.2507.01764,
title = {Data interference: emojis, homoglyphs, and issues of data fidelity in corpora and their results},
author = {Matteo Di Cristofaro},
journal= {arXiv preprint arXiv:2507.01764},
year = {2025}
}
备注
Author submitted manuscript