基于自动单跨度或多跨度答案抽取的活动报告分析
计算与语言
2022-09-21 v1 机器学习
摘要
在物联网(loT, Internet of Things)时代,我们被大量支持 AI 的设备所包围,这些设备可将图像、视频、音频和传感器信号转写为文本描述。当此类转写内容被记录在用于监控、生活记录和异常检测应用的活动报告中时,用户通常会请求摘要或就报告中感兴趣的某些部分提出针对性问题。根据上下文和所提问题的类型,问答(QA)系统需要自动判断答案涵盖的是单跨度还是多跨度文本成分。当前可用的 QA 数据集主要仅关注单跨度响应(如 SQuAD[4]),或包含较低比例的多跨度答案示例(如 DROP[3])。为研究所描述用例中单/多跨度答案的自动选择,我们构建了一个新的智能家居环境数据集,其中包含根据所查询的问题和上下文而配对的单跨度或多跨度答案问题。此外,我们提出了一种基于 RoBERTa[6] 的多跨度抽取问答(MSEQA)模型,可为给定问题返回恰当的答案跨度。我们的实验表明,所提模型在我们的数据集上优于 SOTA QA 模型,同时在已发布的独立单/多跨度任务数据集上提供可比性能。
引用
@article{arxiv.2209.09316,
title = {Activity report analysis with automatic single or multispan answer extraction},
author = {Ravi Choudhary and Arvind Krishna Sridhar and Erik Visser},
journal= {arXiv preprint arXiv:2209.09316},
year = {2022}
}