重新审视计算社会科学中自然语言处理的噪声问题
计算与语言
2025-03-11 v1
摘要
计算社会科学(CSS)是一个新兴领域,其驱动力在于研究人员能够前所未有地获取人类生成的内容。然而,由于该领域所探索的理论和数据集的本质,包括高度主观的任务和复杂的非结构化文本语料库,它带来了一系列独特的挑战。在这些挑战中,较少被研究的课题之一是噪声的普遍存在。本论文旨在通过提出一系列相互关联的案例研究来填补文献中的这一空白,这些研究考察了 CSS 中噪声的不同表现形式。这些包括历史记录 OCR 处理后的字符级错误、古旧语言、主观且模棱两可任务的标注不一致性,甚至大型语言模型在内容生成期间引入的噪声和偏差。本论文挑战了 CSS 中的噪声本质上是有害或无用的传统观念。相反,它认为某些形式的噪声可以编码有意义的信息,这对于推进 CSS 研究具有不可估量的价值,例如个体独特的交流风格或数据集和任务的文化依赖性。此外,本论文强调了处理噪声时细微差别的重要性,以及 CSS 研究人员在遇到噪声时必须应对的考量,表明不同类型的噪声需要不同的策略。
引用
@article{arxiv.2503.07395,
title = {Revisiting Noise in Natural Language Processing for Computational Social Science},
author = {Nadav Borenstein},
journal= {arXiv preprint arXiv:2503.07395},
year = {2025}
}
备注
PhD thesis. Under the supervision of Prof. Isabelle Augenstein