利用多任务预训练之力实现真值级自然语言解释
计算机视觉与模式识别
2023-03-30 v2 计算与语言
摘要
自然语言解释有望为复杂视觉-语言任务中神经网络的决策过程提供直观可理解的解释,正如近期VL-NLE模型所追求的。尽管当前模型在任务准确率和解释可信度上表现令人印象深刻,它们存在一系列问题:某些模型采用模块化设计,其中解释生成模块与单独的任务答案预测模块集成度差,使用在有限任务集上训练的骨干模型,或引入临时方案以提升在单一数据集上的性能。我们提议通过应用生成式Transformer模型大规模多任务预训练的最新进展于VL-NLE任务来规避这些局限。我们的方法大幅优于近期模型,在人类标注者偏好上,三个评估数据集中有两个将其生成的解释优于真值。作为VL-NLE研究中的新挑战,我们提出多任务VL-NLE问题,并展示在多个任务上联合训练可提升解释质量。我们讨论了高质量NLE生成及其他近期VL-NLE研究问题的伦理影响。
引用
@article{arxiv.2212.04231,
title = {Harnessing the Power of Multi-Task Pretraining for Ground-Truth Level Natural Language Explanations},
author = {Björn Plüster and Jakob Ambsdorf and Lukas Braach and Jae Hee Lee and Stefan Wermter},
journal= {arXiv preprint arXiv:2212.04231},
year = {2023}
}
备注
Minor changes