主题感知探测:从句子长度预测到习语识别,神经语言模型有多依赖主题?
计算与语言
2024-03-05 v1
摘要
基于 Transformer 的神经语言模型在各种自然语言处理任务上取得了 SOTA 性能。然而,一个悬而未决的问题是,这些模型在处理自然语言时在多大程度上依赖词序/句法信息或词共现/主题信息。本文通过探讨基于 Transformer 的模型(BERT 和 RoBERTa)在一系列英语探测任务(从简单的词汇任务如句子长度预测,到复杂的语义任务如习语 token 识别)上的表现及其对这些任务中主题信息的敏感度之间的关系,来探讨这些模型是否主要将主题作为信号,从而为这一争论做出贡献。为此,我们提出了一种新的探测方法,称为主题感知探测。初步结果表明,基于 Transformer 的模型在其中间层中同时编码了主题和非主题信息,但这些模型区分习语用法的能力主要基于其识别和编码主题的能力。此外,我们对这些模型在其他标准探测任务上表现的分析表明,对主题信息相对不敏感的任务也是这些模型相对困难的任务。
引用
@article{arxiv.2403.02009,
title = {Topic Aware Probing: From Sentence Length Prediction to Idiom Identification how reliant are Neural Language Models on Topic?},
author = {Vasudevan Nedumpozhimana and John D. Kelleher},
journal= {arXiv preprint arXiv:2403.02009},
year = {2024}
}