预训练语言模型能否在噪声下从受损子词推导出正确语义?
计算与语言
2024-10-15 v1
摘要
对于预训练语言模型(PLMs),其易受噪声影响的特性近来被归因于子词分割。然而,尚不清楚分割的哪些方面会影响其理解。本研究评估了PLMs针对由噪声引起的各种受损分割的鲁棒性。提出了一种名为对比词汇语义(CoLeS)探针的子词分割评估框架。该框架通过对规范-噪声词对生成对比数据集,提供了噪声下分割损坏的系统分类与评估协议。实验结果表明,如果噪声引入了完全不同的子词、小的子词片段或大量额外子词,特别是当它们被插入到其他子词内部时,PLMs无法准确计算词义。
引用
@article{arxiv.2306.15268,
title = {Can Pretrained Language Models Derive Correct Semantics from Corrupt Subwords under Noise?},
author = {Xinzhe Li and Ming Liu and Shang Gao},
journal= {arXiv preprint arXiv:2306.15268},
year = {2024}
}