基于文本分类中任务特定信息的量化
计算与语言
2021-10-19 v1
摘要
近来,神经自然语言模型在多种任务上取得了最先进的性能,但这种高性能可能源于表层、表面层面的线索(Bender and Koller, 2020; Niven and Kao, 2020)。这些表面线索作为数据集中固有的“捷径”,并不贡献于分类任务的*任务特定信息*(task-specific information, TSI)。尽管考察模型性能至关重要,理解数据集也同样重要。本文中,我们考虑如下问题:除捷径特征引入的信息外,分类一个数据集需要多少任务特定信息?我们在信息论框架下对该量进行形式化。尽管该量难以计算,我们用一种快速且稳定的方法对其近似。TSI 量化了在一组预定义捷径之外、对从每个数据集中分类样本有贡献的语言学知识量。该框架使我们能够跨数据集比较,即除一组“捷径特征”外,Multi-NLI 任务中分类每个样本比 Quora Question Pair 涉及约 0.4 nats 更多的 TSI。
引用
@article{arxiv.2110.08931,
title = {Quantifying the Task-Specific Information in Text-Based Classifications},
author = {Zining Zhu and Aparna Balagopalan and Marzyeh Ghassemi and Frank Rudzicz},
journal= {arXiv preprint arXiv:2110.08931},
year = {2021}
}