基于序列到序列架构和预训练语言模型的对话问题重构
计算与语言
2020-04-07 v1 人工智能
机器学习
摘要
本文对使用序列到序列架构和预训练语言模型(PLM)的对话问题重构(CQR)进行了实证研究。我们利用PLM来解决CQR任务中常见目标(最大似然估计)所做的强标记到标记独立性假设。在面向任务的对话系统的CQR基准测试中,我们在最近引入的CANARD数据集上评估微调后的PLM作为域内任务,并使用TREC 2019 CAsT Track的数据作为域外任务验证模型。通过检查具有不同参数数量的各种架构,我们证明最近的文本到文本迁移变换器(T5)在CANARD和CAsT上都以更少的参数取得了最佳结果,与类似的变换器架构相比。
引用
@article{arxiv.2004.01909,
title = {Conversational Question Reformulation via Sequence-to-Sequence Architectures and Pretrained Language Models},
author = {Sheng-Chieh Lin and Jheng-Hong Yang and Rodrigo Nogueira and Ming-Feng Tsai and Chuan-Ju Wang and Jimmy Lin},
journal= {arXiv preprint arXiv:2004.01909},
year = {2020}
}