非形式化文档中符号表达式的消歧
机器学习
2021-01-29 v1
摘要
我们提出将非形式化STEM文档(以LaTeX文件形式)中符号表达式的消歧任务——即确定其精确语义与抽象语法树——作为一种神经机器翻译任务。我们讨论了其中涉及的独特挑战,并提供了一个包含约33,000条条目的数据集。我们在该数据集上评估了若干基线模型,这些模型在过拟合之前甚至无法生成语法有效的LaTeX。因此,我们描述了一种使用在arxiv.org获取的来源上预训练的transformer语言模型的方法,尽管数据集规模较小,仍取得了有前景的结果。我们使用多种专用技术评估我们的模型,同时考虑符号表达式的语法与语义。
引用
@article{arxiv.2101.11716,
title = {Disambiguating Symbolic Expressions in Informal Documents},
author = {Dennis Müller and Cezary Kaliszyk},
journal= {arXiv preprint arXiv:2101.11716},
year = {2021}
}
备注
ICLR 2021 conference paper