使用大语言模型对不可靠叙述者进行分类
计算与语言
2025-06-13 v1
摘要
当我们与第一人称事件叙述互动时,常常会考虑叙述者——即文本的主要说话人——是否可靠。本文提出使用计算方法来识别不可靠叙述者,即那些无意误导信息的人。我们借助叙事学中的文学理论,基于各种文本现象定义不同的不可靠叙述者类型,构建TUNa数据集,该数据集包含来自多个领域的叙述文本,包括博客帖子、Reddit帖子、酒店评论和文学作品。我们定义了叙述内部不可靠性、叙述之间不可靠性和文本之间不可靠性的分类任务,对分析流行开源权重和专有LLM在每种任务上的性能。我们提出从文学中学习,在真实世界文本数据上执行不可靠叙述者分类。为此,我们实验了零样本、微调和课程学习设置。我们的结果表明,这一任务非常具有挑战性,存在使用LLM识别不可靠叙述者的潜力。我们公开了我们精选标注的数据集和代码,邀请未来研究在此领域开展工作。
引用
@article{arxiv.2506.10231,
title = {Classifying Unreliable Narrators with Large Language Models},
author = {Anneliese Brei and Katharine Henry and Abhisheik Sharma and Shashank Srivastava and Snigdha Chaturvedi},
journal= {arXiv preprint arXiv:2506.10231},
year = {2025}
}
备注
ACL 2025