用于自监督序列学习的符号自编码
机器学习
2024-02-19 v1 人工智能
摘要
传统的语言模型擅长文本序列中的下一个词预测,但在不同符号系统之间的转导任务中常常遇到困难,特别是当并行数据稀缺时。针对这一问题,我们引入了符号自编码(ΣAE),这是一个自监督框架,利用丰富的非并行数据和有限的并行数据。ΣAE通过离散瓶颈层连接两个生成模型,并通过最小化重构损失(同时针对并行数据使用监督损失)进行端到端优化,使得离散瓶颈生成的序列可以被读出为转导后的输入序列。我们还开发了基于梯度的方法,允许在瓶颈离散的情况下进行高效的自监督序列学习。我们的结果表明,ΣAE在转导任务上显著提升了性能,即使只有极少的并行数据,为弱监督学习场景提供了一个有前景的解决方案。
引用
@article{arxiv.2402.10575,
title = {Symbolic Autoencoding for Self-Supervised Sequence Learning},
author = {Mohammad Hossein Amani and Nicolas Mario Baldwin and Amin Mansouri and Martin Josifoski and Maxime Peyrard and Robert West},
journal= {arXiv preprint arXiv:2402.10575},
year = {2024}
}