中文

对话问答中对话历史表征的鲁棒性:综合研究及一种基于提示的新方法

计算与语言 2023-01-02 v2 人工智能 机器学习

摘要

大多数关于对话问答(CQA)中对话历史建模的工作仅在通用CQA基准上报告单一主要结果。尽管现有模型在CQA排行榜上表现令人瞩目,但它们在设定偏移(有时偏向更现实的设定)、训练数据规模(例如从大到小)和领域上的鲁棒性仍不清楚。在本工作中,我们设计并开展了首个针对CQA历史建模方法的大规模鲁棒性研究。我们发现高基准分数未必等同于强鲁棒性,且不同方法在不同设定下表现可能极为不同。借助研究所得洞见,我们设计了一种新颖的基于提示的历史建模方法,并展示了其在多种设定下的强鲁棒性。我们的方法受现有在段落中高亮历史答案的方法启发,但不同于通过修改段落词元嵌入来高亮,我们直接在段落文本中添加文本提示。我们的方法简单、易于插入几乎任意模型且极为有效,因此我们推荐其作为未来模型开发者的起点。我们也希望我们的研究与洞见能提升对鲁棒性导向评估重要性的认识,而非仅追求高排行榜分数,从而催生更好的CQA系统。

关键词

引用

@article{arxiv.2206.14796,
  title  = {On the Robustness of Dialogue History Representation in Conversational Question Answering: A Comprehensive Study and a New Prompt-based Method},
  author = {Zorik Gekhman and Nadav Oved and Orgad Keller and Idan Szpektor and Roi Reichart},
  journal= {arXiv preprint arXiv:2206.14796},
  year   = {2023}
}

备注

Accepted for publication at TACL in December 2022. First two authors contributed equally to this work. Our code and data will be released at: https://github.com/zorikg/MarCQAp