Dialogizer:基于文本源生成上下文感知对话问答数据集
计算与语言
2023-11-15 v1 人工智能
摘要
为解决对话问答(ConvQA)中的数据稀缺问题,已有研究提出对话补全方法,利用文档生成 ConvQA 数据集。然而,原始的对话补全模型仅在对话重构任务上训练,由于对问答对齐的学习不足,导致生成的问题上下文相关性低。为克服该局限,我们提出了一种名为 Dialogizer 的新框架,它能够从文本源自动生成具有高上下文相关性的 ConvQA 数据集。该框架包含两项训练任务:问答匹配(QAM)和主题感知对话生成(TDG)。此外,在推理阶段基于生成问题的上下文相关性进行重排序。利用我们的框架,我们以多领域文档为主要来源生成了四个 ConvQA 数据集。通过多样化的自动评价指标以及人工评估,我们验证了所提框架相比基线对话补全模型具有生成更高质量数据集的能力。
引用
@article{arxiv.2311.07589,
title = {Dialogizer: Context-aware Conversational-QA Dataset Generation from Textual Sources},
author = {Yerin Hwang and Yongil Kim and Hyunkyung Bae and Jeesoo Bang and Hwanhee Lee and Kyomin Jung},
journal= {arXiv preprint arXiv:2311.07589},
year = {2023}
}
备注
Accepted to EMNLP 2023 main conference