中文

论文本向量化器的鲁棒性

计算与语言 2023-06-13 v2 机器学习 机器学习

摘要

机器学习中的一个基本问题是模型相对于输入变化的鲁棒性。在自然语言处理中,模型通常包含一个首先将词元序列转换为向量表示的嵌入层。虽然关于连续输入变化的鲁棒性已得到充分理解,但在考虑离散变化(例如将句子中的某个词替换为另一个词)时,情况则不甚明晰。我们的工作从形式上证明了流行的嵌入方案,如拼接、TF-IDF 与段落向量(亦称 doc2vec),相对于汉明距离在 Hölder 或 Lipschitz 意义上具有鲁棒性。我们给出了这些方案的定量界,并展示了所涉及的常数如何受文档长度影响。这些发现通过一系列数值示例加以阐明。

关键词

引用

@article{arxiv.2303.07203,
  title  = {On the Robustness of Text Vectorizers},
  author = {Rémi Catellier and Samuel Vaiter and Damien Garreau},
  journal= {arXiv preprint arXiv:2303.07203},
  year   = {2023}
}

备注

Accepted to ICML 2023. 33 pages, 10 figures