中文

什么样的数据集适合符号描述阅读?

计算与语言 2023-04-18 v1 人工智能

摘要

将数学公式作为文档关键思想的简洁表示是常见做法。通过识别数学符号并提取其描述来正确解释这些公式,是文档理解中的一项重要任务。本文对数学标识符描述阅读(MIDR)任务作出以下贡献:(i) 引入含有 75087508 个标注标识符出现项的数学公式问答数据集(MFQuAD);(ii) 描述了用于 MIDR 任务的名词短语排序方法的若干新变体;(iii) 报告了 SOTA 名词短语排序方法及其新变体的实验结果,提供问题洞见与性能基线;(iv) 就构成有效 MIDR 任务数据集的特征给出立场。

关键词

引用

@article{arxiv.2304.08352,
  title  = {What Makes a Good Dataset for Symbol Description Reading?},
  author = {Karol Lynch and Joern Ploennigs and Bradley Eck},
  journal= {arXiv preprint arXiv:2304.08352},
  year   = {2023}
}