非正式文本为何破坏NLI:分词失效、分布迁移与针对性缓解措施
计算与语言
2026-04-21 v1 人工智能
摘要
我们研究非正式表面形式如何降低ELECTRA-small(14M)与RoBERTa-large(355M)在SNLI与MultiNLI四种变换下的NLI准确率:俚语替换、emoji替代、Z世代填充词,及其组合。俚语替换(以正式词汇替换为非正式等价形式,如"going to"->"gonna","friend"->"homie")导致最小退化(最多1.1pp):俚语词汇大多落在WordPiece覆盖范围内,分词器能妥善处理,无信号损失。Emoji将内容词替换为Unicode字符,ELECTRA的WordPiece分词器映射至[UNK],在任何已学习参数看到输入之前即破坏输入信号(93.6%的emoji示例至少包含一个[UNK],平均2.91个[UNK])。噪声token(no cap、deadass、tbh)虽完全在词表内,但缺乏来自NLI训练数据的分布,模型赋予其推断权重却不携带实际信息。两种失效模式对应不同的干预措施:预处理通过在分词前规范化文本可恢复emoji准确率;数据增强通过在训练时暴露含噪声样本可处理噪声。二者组合在ELECTRA上SNLI的组合变体准确率达88.93%(较75.88%提升),且对干净文本无显著下降。相较GPT-4o-mini零样本,未缓解的ELECTRA在变体任务上显著更差(p<0.0001);混合ELECTRA在所有SNLI变体中超越GPT-4o-mini,并在MultiNLI上达到统计等价。
引用
@article{arxiv.2604.16787,
title = {When Informal Text Breaks NLI: Tokenization Failure, Distribution Shift, and Targeted Mitigations},
author = {Avinash Goutham Aluguvelly},
journal= {arXiv preprint arXiv:2604.16787},
year = {2026}
}