利用电影剧情中的桥段揭示大型语言模型的叙事推理极限
计算与语言
2024-09-24 v1 人工智能
机器学习
摘要
配备思维链提示的大型语言模型在数学、常识和逻辑等事实性内容中展现出了显著的多步推理能力。然而,它们在需要更强抽象能力的叙事推理中的表现仍未被探索。本研究利用电影剧情中的桥段评估了最先进 LLM 的抽象推理能力,并揭示了其低下的表现。我们引入了一种逐桥段查询的方法来应对这些挑战,使 F1 分数提高了 11.8 个点。此外,尽管先前的研究表明 CoT 增强了多步推理,但本研究表明 CoT 会在叙事内容中引发幻觉,降低 GPT-4 的性能。我们还引入了一种对抗性注入方法,将桥段相关的文本标记嵌入到没有明确桥段的电影剧情中,揭示了 CoT 对此类注入的高度敏感性。我们的综合分析为未来的研究方向提供了见解。
引用
@article{arxiv.2409.14324,
title = {Unveiling Narrative Reasoning Limits of Large Language Models with Trope in Movie Synopses},
author = {Hung-Ting Su and Ya-Ching Hsu and Xudong Lin and Xiang-Qian Shi and Yulei Niu and Han-Yuan Hsu and Hung-yi Lee and Winston H. Hsu},
journal= {arXiv preprint arXiv:2409.14324},
year = {2024}
}
备注
EMNLP 2024 Findings. The first two authors contributed equally. Code: https://github.com/Shelley1214/Trope