中文

TASTEset——食谱数据集与食物实体识别基准

计算与语言 2022-04-19 v1 人工智能 机器学习

摘要

食物计算目前是一个快速发展的研究领域。自然语言处理(NLP)在该领域也日益重要,特别是在识别食物实体方面。然而,目前仍只有少数明确定义的任务可作为该领域解决方案的基准。我们引入了一个称为\textit{TASTEset}的新数据集来弥补这一差距。在该数据集中,命名实体识别(NER)模型需要发现或推断有助于处理食谱的各类型实体,例如食品、数量及其单位、烹饪过程名称、食材的物理特性、其用途、味道。该数据集由700个食谱组成,包含超过13,000个待抽取实体。我们提供了一些最先进的命名实体识别模型基线,表明我们的数据集对现有模型构成了坚实挑战。最佳模型平均达到0.95的F1F_1分数,具体取决于实体类型——从0.781到0.982。我们共享该数据集和任务,以鼓励从食谱中进行更深入和复杂的信息抽取研究。

关键词

引用

@article{arxiv.2204.07775,
  title  = {TASTEset -- Recipe Dataset and Food Entities Recognition Benchmark},
  author = {Ania Wróblewska and Agnieszka Kaliska and Maciej Pawłowski and Dawid Wiśniewski and Witold Sosnowski and Agnieszka Ławrynowicz},
  journal= {arXiv preprint arXiv:2204.07775},
  year   = {2022}
}