理解与应对个体级自然语言理解中的标签错误
计算与语言
2025-02-20 v1 人工智能
摘要
自然语言理解 (NLU) 是一项使机器能够理解人类语言的任务。一些任务,如立场检测和情感分析,与个体主观视角密切相关,因此被称为个体级 NLU。此前,这些任务通常被简化为文本级 NLU 任务,忽略了个体因素。这不仅使推理变得困难且不可解释,而且常常在创建数据集时导致大量标签错误。为了解决上述局限性,我们提出了一种基于个体级因素的全新 NLU 标注指南。具体而言,我们纳入了同一个体的其他帖子,然后在考虑该个体所有帖子后对其主观视角进行标注。我们使用该指南对立场检测和基于主题的情感分析数据集进行了扩展和重新标注。我们发现,样本中的错误率分别高达 31.7% 和 23.3%。我们进一步使用大语言模型在重新标注的数据集上进行实验,并发现在加入个体因素后,大语言模型在两个数据集上均表现良好。GPT-4o 和 Llama3-70B 在重新标注的数据集上均能达到 87% 以上的准确率。我们还通过消融实验验证了个体因素的有效性。我们呼吁未来的研究者在创建此类数据集时加入个体因素。我们的重新标注数据集可在 https://github.com/24yearsoldstudent/Individual-NLU 找到。
引用
@article{arxiv.2502.13297,
title = {Understanding and Tackling Label Errors in Individual-Level Nature Language Understanding},
author = {Yunpeng Xiao and Youpeng Zhao and Kai Shu},
journal= {arXiv preprint arXiv:2502.13297},
year = {2025}
}
备注
12 pages