中文

意义的边界:神经机器翻译中的一个案例研究

计算与语言 2022-10-04 v1 人工智能

摘要

深度学习在自然语言处理中的成功引发了关于语言意义本质以及自然与人工系统处理意义方式的有趣问题。其中一个问题涉及自 2016 年以来广泛应用于语言建模、机器翻译和其他任务的子词分割算法。这些算法常将词切分为语义不透明的片段,例如 'period|on|t|ist' 中的 'period'、'on'、't' 和 'ist'。系统随后将这些得到的片段表示为稠密向量空间,该空间被期望建模它们之间的语法关系。这一表示又可被用来将 'period|on|t|ist'(英语)映射为 'par|od|ont|iste'(法语)。因此,翻译不再于词汇层面建模,而是被更一般地重新表述为学习两种语言的子词片段序列之间最佳双语映射的任务;有时甚至在纯字符序列之间:'p|e|r|i|o|d|o|n|t|i|s|t' \rightarrow 'p|a|r|o|d|o|n|t|i|s|t|e'。尽管这类子词分割与对齐本质上 allegedly 不透明,它们却运行于高效端到端机器翻译系统中。此类过程的计算价值毋庸置疑。但它们是否具有语言学或哲学上的合理性?我试图通过回顾子词分割算法的相关细节,并将其与重要的哲学和语言学辩论相联系,来阐明这一问题,以使人工智能更透明、可解释。

关键词

引用

@article{arxiv.2210.00613,
  title  = {The boundaries of meaning: a case study in neural machine translation},
  author = {Yuri Balashov},
  journal= {arXiv preprint arXiv:2210.00613},
  year   = {2022}
}

备注

35 pages, 4 figures, 1 table