论文本向量化器的鲁棒性
计算与语言
2023-06-13 v2 机器学习
机器学习
摘要
机器学习中的一个基本问题是模型相对于输入变化的鲁棒性。在自然语言处理中,模型通常包含一个首先将词元序列转换为向量表示的嵌入层。虽然关于连续输入变化的鲁棒性已得到充分理解,但在考虑离散变化(例如将句子中的某个词替换为另一个词)时,情况则不甚明晰。我们的工作从形式上证明了流行的嵌入方案,如拼接、TF-IDF 与段落向量(亦称 doc2vec),相对于汉明距离在 Hölder 或 Lipschitz 意义上具有鲁棒性。我们给出了这些方案的定量界,并展示了所涉及的常数如何受文档长度影响。这些发现通过一系列数值示例加以阐明。
引用
@article{arxiv.2303.07203,
title = {On the Robustness of Text Vectorizers},
author = {Rémi Catellier and Samuel Vaiter and Damien Garreau},
journal= {arXiv preprint arXiv:2303.07203},
year = {2023}
}
备注
Accepted to ICML 2023. 33 pages, 10 figures