从数学文本中提取定义的 BERT 微调
计算与语言
2024-07-01 v2
摘要
在本文中,我们对三个预训练的 BERT 模型在从数学英文 LaTeX 文本中进行“定义提取”任务上的微调。这被呈现为一个二元分类问题,即句子是否包含数学术语的定义。我们使用两个原始数据集“芝加哥”和“TAC”进行微调和测试。我们还测试了由 Vanetik 和 Litvak 在 2021 年提出的数据集 WFMALL,并比较了我们模型与他们模型的性能。我们发现,基于整体准确率、召回率和精确率指标,高性能 Sentence-BERT 转换模型表现最佳,与早期模型相当,却需要更少的计算资源。
关键词
引用
@article{arxiv.2406.13827,
title = {Fine-Tuning BERTs for Definition Extraction from Mathematical Text},
author = {Lucy Horowitz and Ryan Hathaway},
journal= {arXiv preprint arXiv:2406.13827},
year = {2024}
}