TREC CAsT 2019:对话式辅助赛道概述
信息检索
2020-03-31 v1 计算与语言
机器学习
摘要
对话式辅助赛道(CAsT)是 TREC 2019 的新赛道,旨在推动对话式信息搜索(CIS)研究,并为对话式搜索系统构建大规模可复用测试集。文档语料来自 TREC 复杂答案检索(CAR)与微软机器阅读理解(MARCO)数据集的 38,426,252 个段落。八十条信息搜索对话(30 条训练、50 条测试)平均长度为 9 至 10 个问题。为 30 个训练主题与 20 个测试主题提供了相关性评判。今年 21 个小组共提交 65 次运行,采用多种方法进行对话式查询理解与排序。方法包括传统基于检索的方法、基于特征的学习排序、神经模型以及知识增强方法。各运行的一个共同主题是使用基于 BERT 的神经重排序方法。领先方法还采用了文档扩展、对话式查询扩展以及用于对话式查询重写的生成式语言模型(GPT-2)。结果显示自动系统与使用人工消解话语的系统之间存在差距,人工重写相较最佳自动系统有 35% 的相对提升。
引用
@article{arxiv.2003.13624,
title = {TREC CAsT 2019: The Conversational Assistance Track Overview},
author = {Jeffrey Dalton and Chenyan Xiong and Jamie Callan},
journal= {arXiv preprint arXiv:2003.13624},
year = {2020}
}