中文

NLP模型能否“识别”、“区分”并“论证”无确定答案的问题?

计算与语言 2023-09-12 v1

摘要

尽管最先进(SOTA)的NLP系统在各种语言理解任务上取得了卓越性能,但它们主要关注具有正确且确定答案的问题。然而,在真实应用中,用户常提出无确定答案的问题。错误地回答此类问题无疑会损害系统的可靠性与可信度。SOTA模型能否准确识别此类问题并给出合理回应?为探究上述问题,我们引入QnotA,一个由五类无确定答案问题组成的数据集。此外,对于每个QnotA实例,我们还提供一个对应的QA实例,即一个“可以”被回答的替代问题。基于该数据,我们构建了三项评估任务,检验系统“识别”、“区分”和“论证”QnotA问题的能力。通过综合实验,我们表明即便包括GPT-3和Flan T5在内的SOTA模型在这些任务上表现不佳,且大幅落后于人类性能基线。我们进行了深入分析,进一步得出若干有趣发现。总体而言,我们相信本工作与发现将鼓励并促进该重要领域的进一步研究,助力开发更鲁棒的模型。

关键词

引用

@article{arxiv.2309.04635,
  title  = {Can NLP Models 'Identify', 'Distinguish', and 'Justify' Questions that Don't have a Definitive Answer?},
  author = {Ayushi Agarwal and Nisarg Patel and Neeraj Varshney and Mihir Parmar and Pavan Mallina and Aryan Bhavin Shah and Srihari Raju Sangaraju and Tirth Patel and Nihar Thakkar and Chitta Baral},
  journal= {arXiv preprint arXiv:2309.04635},
  year   = {2023}
}

备注

TrustNLP Workshop at ACL 2023