如何每天评估问答系统而仍能完成实际工作
计算与语言
2007-05-23 v1 信息检索
摘要
本文报告了Qaviar,这是一个用于问答应用的实验性自动化评估系统。我们的研究目标是找到一个自动计算的度量标准,该度量标准在问答任务的上下文中能够与人类评判者对答案正确性的评估保持良好相关性。Qaviar通过计算对人类生成答案密钥中提取内容词的召回率来评判响应。如果其召回率超过给定阈值,则计为正确。我们确定,Qaviar预测的答案正确性与人类评价的一致性在93%至95%之间。41个问答系统被Qaviar和人类评估者分别排名,这些排名之间的Kendall's Tau系数为0.920,而相同数据上人类评估者之间相关系数为0.956。
关键词
引用
@article{arxiv.cs/0004008,
title = {How to Evaluate your Question Answering System Every Day and Still Get Real Work Done},
author = {Eric Breck and John D. Burger and Lisa Ferro and Lynette Hirschman and David House and Marc Light and Inderjeet Mani},
journal= {arXiv preprint arXiv:cs/0004008},
year = {2007}
}
备注
6 pages, 3 figures, to appear in Proceedings of the Second International Conference on Language Resources and Evaluation (LREC 2000)