行为学习中泛化的跨功能分析
计算与语言
2023-08-28 v1 机器学习
摘要
在行为测试中,通过受控的输入-输出对来验证标准评估设置(含留出测试集)中代表性不足的系统功能。在训练期间优化行为测试上的性能(行为学习)将改善对独立同分布数据中未充分表示现象的覆盖,并可能带来看似更鲁棒的模型。然而,存在模型从行为测试套件中狭隘地捕获虚假关联的风险,导致模型性能的过高估计与错误表征——这正是传统评估原有的缺陷之一。在本工作中,我们提出 BeLUGA,一种在考虑不同粒度层级维度间泛化的前提下评估行为学习的分析方法。我们优化特定行为的损失函数,并在受控以留出特定现象的行为测试套件的若干划分上评估模型。一个聚合分数衡量对未见功能的泛化(或过拟合)。我们使用 BeLUGA 考察三种代表性的 NLP 任务(情感分析、释义识别和阅读理解),并比较一组多样的正则化与域泛化方法对泛化性能的影响。
引用
@article{arxiv.2305.12951,
title = {Cross-functional Analysis of Generalisation in Behavioural Learning},
author = {Pedro Henrique Luz de Araujo and Benjamin Roth},
journal= {arXiv preprint arXiv:2305.12951},
year = {2023}
}
备注
16 pages, 1 figure. To be published in the Transactions of the Association for Computational Linguistics (TACL). This preprint is a pre-MIT Press publication version