DragonVerseQA:面向《龙之家》与《权力的游戏》的开放域长篇上下文感知问答
计算与语言
2024-12-24 v1 信息检索
摘要
本文提出一种新颖的方法,用于开发开放域和长篇上下文感知的问答(QA)数据集,名为 DragonVerseQA,专为《House of the Dragon》和《Game Of Thrones》电视系列的幻想宇宙而设计。大多数现有 QA 数据集专注于来自维基百科文章的简短事实性答案,缺乏深度和上下文丰富性,难以满足复杂叙事理解的需求。我们构建了一个将来自 HBO 和粉丝维基网站的完整剧集摘要、来自 IMDb 和 Rotten Tomatoes 等来源的用户评论,以及来自 WikiData 等高质量、开放域、合法可接受来源的结构化数据整合在一起的数据集。该数据集提供多维度的上下文,反映这些来源中复杂人物关系和情节发展。也就是说,只有在重度数据预处理和过滤之后,才可获得有意义的、非垃圾信息的、无偏见的评论。通过该丰富上下文生成的长篇答案,能够提供全面的洞见。这正是该数据集对于改进对话 AI、叙事分析、情感分析、摘要技术和关系抽取具有价值的原因。与 SQuAD 2.0、TriviaQA 和 Natural Questions 等最新 QA 数据集进行比较分析,凸显了我们数据集在上下文复杂性和答案长度方面的独特优势。详细评论为观众情感和叙事解释添加了层次,为领域特定 QA 提高了新质量基准。我们的工作也有助于更深入地理解娱乐行业内容,为数字媒体环境中的更具知识性和创造性的人工智能交互打开了大门。
引用
@article{arxiv.2412.16694,
title = {DragonVerseQA: Open-Domain Long-Form Context-Aware Question-Answering},
author = {Aritra Kumar Lahiri and Qinmin Vivian Hu},
journal= {arXiv preprint arXiv:2412.16694},
year = {2024}
}