中文

从数学文本中提取定义的 BERT 微调

计算与语言 2024-07-01 v2

摘要

在本文中,我们对三个预训练的 BERT 模型在从数学英文 LaTeX 文本中进行“定义提取”任务上的微调。这被呈现为一个二元分类问题,即句子是否包含数学术语的定义。我们使用两个原始数据集“芝加哥”和“TAC”进行微调和测试。我们还测试了由 Vanetik 和 Litvak 在 2021 年提出的数据集 WFMALL,并比较了我们模型与他们模型的性能。我们发现,基于整体准确率、召回率和精确率指标,高性能 Sentence-BERT 转换模型表现最佳,与早期模型相当,却需要更少的计算资源。

关键词

引用

@article{arxiv.2406.13827,
  title  = {Fine-Tuning BERTs for Definition Extraction from Mathematical Text},
  author = {Lucy Horowitz and Ryan Hathaway},
  journal= {arXiv preprint arXiv:2406.13827},
  year   = {2024}
}