定义与测试自然语言理解中的自由度问题
计算与语言
2023-05-25 v1 人工智能
摘要
自然语言理解(NLU)研究常夸大或低估系统的能力,从而限制了其发现的可复现性。这些错误的评估可归因于充分定义和测试NLU的困难。在本立场论文中,我们通过识别两类研究者自由度重新审视这一挑战。我们重访图灵对图灵测试的原始解释,并指出NLU测试并不提供操作化定义;它仅提供归纳证据,表明受试对象充分理解该语言以达成利益相关者的目标。换言之,利益相关者可借其目标任意定义NLU。要将测试结果用作归纳证据,利益相关者必须仔细评估测试分数的解释是否有效。然而,设计和使用的NLU测试涉及其他自由度,例如指定目标技能与定义评估指标。因此,在利益相关者间达成共识变得困难。为解决此问题,我们提出一种效度论证,这是一个包含跨测试组件一系列验证标准的框架。通过表明NLU研究中的当前实践可关联至这些标准并将其组织为全面检查表,我们证明了效度论证可作为设计可信测试集和促进科学交流的连贯指南。
引用
@article{arxiv.2305.15130,
title = {On Degrees of Freedom in Defining and Testing Natural Language Understanding},
author = {Saku Sugawara and Shun Tsugita},
journal= {arXiv preprint arXiv:2305.15130},
year = {2023}
}
备注
Accepted to Findings of ACL 2023