中文

叙事人物位置数据集:安德森与《论语》数据集

计算与语言 2025-04-07 v1

摘要

机器掌握叙事情境中空间理解的能力,是阅读理解领域持续研究的有趣方面。为测试 AI 对人物及其在叙事中所处位置关系的理解能力,我们引入两个新数据集:安德森数据集与《论语》数据集。安德森数据集选取《安德森童话》中15个儿童故事,手动标注每个故事中的人物及其相应位置。同样地,《论语》数据集中对詹姆斯·奥斯汀小说中人物及其位置进行了人工标注。我们利用这些数据集激活大语言模型(LLM)。具体方法为:从故事或小说中提取片段,搭配询问该片段中提及人物位置的问题。我们测试了5个LLM,针对安德森数据集表现最好的模型在61.85%的案例中准确识别位置;针对《论语》数据集,表现最好的模型在56.06%的案例中准确识别位置。

关键词

引用

@article{arxiv.2504.03434,
  title  = {Locations of Characters in Narratives: Andersen and Persuasion Datasets},
  author = {Batuhan Ozyurt and Roya Arkhmammadova and Deniz Yuret},
  journal= {arXiv preprint arXiv:2504.03434},
  year   = {2025}
}

备注

14 pages, 3 figures, 10 tables