问答系统评估:自然语言判定的复杂性
计算与语言
2022-09-27 v1 人工智能
摘要
问答(QA)系统是自然语言处理(NLP)中最为重要且发展迅速的研究课题之一。其原因之一在于 QA 系统使人机能更自然交互,例如通过虚拟助手或搜索引擎。近几十年来,许多 QA 系统被提出以满足不同问答任务的需求。此外,许多错误分数被引入,例如基于 n-gram 匹配、词嵌入或上下文嵌入来衡量 QA 系统的性能。本综述试图系统概述 QA 的总体框架、QA 范式、基准数据集以及用于 QA 系统定量评估的评估技术。后者尤为重要,因为不仅构建 QA 系统复杂,其评估亦如此。我们假定其原因之一在于人类判断的定量化形式化是一个开放问题。
引用
@article{arxiv.2209.12617,
title = {Evaluation of Question Answering Systems: Complexity of judging a natural language},
author = {Amer Farea and Zhen Yang and Kien Duong and Nadeesha Perera and Frank Emmert-Streib},
journal= {arXiv preprint arXiv:2209.12617},
year = {2022}
}