inversedMixup:通过反转混合嵌入实现数据增强
计算与语言
2026-02-09 v2
摘要
Mixup 通过对输入和标签进行可控比例的线性插值生成增强样本,但由于其在潜在嵌入层面操作,生成的样本难以被人类解读。相比之下,基于 LLM 的增强方法在标记级生成句子,具有可读性,但对生成过程的控制有限。针对近期 LLM 反向工程的进展,即从嵌入重建自然语言以桥接潜在嵌入空间与离散标记空间之间的差距,我们提出 inversedMixup,一个统一框架,整合 Mixup 的可控性与 LLM 生成的可解释性。具体而言,inversedMixup 采用三阶段训练程序,将任务特定模型的输出嵌入空间与 LLM 的输入嵌入空间对齐。成功对齐后,inversedMixup 可将可控混合比例的混合嵌入重建为人类可解读的增强句子,从而提升增强性能。此外,inversedMixup 提供了关于文本 Mixup 中流形入侵现象的首个实证证据,并引入一种简单有效的缓解策略。大量实验表明,我们的方法在零样本和完全监督场景中均表现出色,具备很好的通用性。
引用
@article{arxiv.2601.21543,
title = {inversedMixup: Data Augmentation via Inverting Mixed Embeddings},
author = {Fanshuang Kong and Richong Zhang and Qiyu Sun and Zhijie Nie and Ting Deng and Chunming Hu},
journal= {arXiv preprint arXiv:2601.21543},
year = {2026}
}