中文

非形式化文档中符号表达式的消歧

机器学习 2021-01-29 v1

摘要

我们提出将非形式化STEM文档(以LaTeX文件形式)中符号表达式的消歧任务——即确定其精确语义与抽象语法树——作为一种神经机器翻译任务。我们讨论了其中涉及的独特挑战,并提供了一个包含约33,000条条目的数据集。我们在该数据集上评估了若干基线模型,这些模型在过拟合之前甚至无法生成语法有效的LaTeX。因此,我们描述了一种使用在arxiv.org获取的来源上预训练的transformer语言模型的方法,尽管数据集规模较小,仍取得了有前景的结果。我们使用多种专用技术评估我们的模型,同时考虑符号表达式的语法与语义。

关键词

引用

@article{arxiv.2101.11716,
  title  = {Disambiguating Symbolic Expressions in Informal Documents},
  author = {Dennis Müller and Cezary Kaliszyk},
  journal= {arXiv preprint arXiv:2101.11716},
  year   = {2021}
}

备注

ICLR 2021 conference paper