用于增强语言理解中神经元效用的跨模型对比损失
计算与语言
2024-03-12 v2 信息检索
机器学习
摘要
当前自然语言理解(NLU)模型在模型规模与输入上下文上持续扩大,引入了更多隐藏与输入神经元。尽管这通常平均上提升性能,额外神经元并未对所有样本带来一致改进。这是因为部分隐藏神经元冗余,且混入输入神经元的噪声易分散模型注意力。先前工作主要通过额外的后处理或预处理(如网络剪枝与上下文选择)外在减少低效用神经元以规避此问题。除此之外,我们能否通过内在增强每个神经元的效用,使模型减少冗余参数并抑制输入噪声?若模型能高效利用神经元,则无论哪些神经元被消融(禁用),消融后的子模型表现都不应优于原始完整模型。基于此种模型间比较原理,我们提出一种适用于广泛任务的跨模型对比损失。对比损失本质上是置于完整模型与消融模型任务特定损失之上的排序损失,期望完整模型的任务特定损失最小。我们基于 5 种广泛使用的预训练语言模型,在来自 3 类不同 NLU 任务的 14 个数据集上开展大量实验,证明了对比损失的通用有效性,并发现其对参数量少或输入长的模型尤为优越。
引用
@article{arxiv.2301.03765,
title = {Cross-Model Comparative Loss for Enhancing Neuronal Utility in Language Understanding},
author = {Yunchang Zhu and Liang Pang and Kangxi Wu and Yanyan Lan and Huawei Shen and Xueqi Cheng},
journal= {arXiv preprint arXiv:2301.03765},
year = {2024}
}