中文

引导基准构建的实时视觉反馈:人在回路与度量在回路工作流

计算与语言 2023-02-10 v1 人工智能 人机交互 机器学习

摘要

近期研究表明,语言模型利用基准中的“伪迹”来解决任务,而非真正学习,导致模型性能被虚高。为构建更好的基准,我们提出 VAIDA,一种面向 NLP 的新型基准构建范式,聚焦于引导众包工作者这一解决基准特异性的未被充分探索的方面。VAIDA 通过提供实时视觉反馈与建议来改进样本质量,从而便于样本修正。我们的方法独立于领域、模型、任务和度量,并构成了通过人在回路与度量在回路工作流实现稳健、可验证和动态基准构建的范式转变。我们通过专家评审和采用 NASA TLX 的用户研究进行评估。我们发现 VAIDA 降低了众包工作者和分析人员的努力、挫败感、心理和时间需求,同时提升了两类用户组的性能,所创建样本中的伪迹水平降低了 45.8%。作为用户研究的一个副产品,我们观察到所创建的样本在不同模型间具有对抗性,导致性能下降:BERT 降 31.3%、RoBERTa 降 22.5%、GPT-3 fewshot 降 14.98%。

关键词

引用

@article{arxiv.2302.04434,
  title  = {Real-Time Visual Feedback to Guide Benchmark Creation: A Human-and-Metric-in-the-Loop Workflow},
  author = {Anjana Arunkumar and Swaroop Mishra and Bhavdeep Sachdeva and Chitta Baral and Chris Bryan},
  journal= {arXiv preprint arXiv:2302.04434},
  year   = {2023}
}

备注

EACL 2023