中文

弃答后处理:面向问答中弃答实例的可靠重尝试

计算与语言 2023-05-04 v1

摘要

尽管自然语言处理取得了显著进展,即便最先进的模型也常做出错误预测。此类预测损害了系统的可靠性,并限制了其在现实应用中的广泛采用。“选择性预测”通过使模型在预测可能错误时弃答,部分解决了上述担忧。虽然选择性预测具有优势,但它留给我们一个相关问题:“弃答之后该怎么办”。为此,我们对“弃答后处理”这一任务展开探索性研究,该任务允许对弃答实例重新尝试,旨在提升系统的“覆盖率”而不显著牺牲其“准确率”。我们首先给出该任务的数学形式化,随后探索若干解决方法。在 11 个 QA 数据集上的综合实验表明,这些方法带来了可观的风险改进——即弃答后处理任务的性能指标——无论是在域内还是域外设定下。我们还对这些结果进行了透彻分析,进一步得出若干有趣发现。最后,我们相信我们的工作将鼓励并促进这一关乎 NLP 系统可靠性的重要领域的进一步研究。

关键词

引用

@article{arxiv.2305.01812,
  title  = {Post-Abstention: Towards Reliably Re-Attempting the Abstained Instances in QA},
  author = {Neeraj Varshney and Chitta Baral},
  journal= {arXiv preprint arXiv:2305.01812},
  year   = {2023}
}

备注

ACL 2023