TASTEset——食谱数据集与食物实体识别基准
计算与语言
2022-04-19 v1 人工智能
机器学习
摘要
食物计算目前是一个快速发展的研究领域。自然语言处理(NLP)在该领域也日益重要,特别是在识别食物实体方面。然而,目前仍只有少数明确定义的任务可作为该领域解决方案的基准。我们引入了一个称为\textit{TASTEset}的新数据集来弥补这一差距。在该数据集中,命名实体识别(NER)模型需要发现或推断有助于处理食谱的各类型实体,例如食品、数量及其单位、烹饪过程名称、食材的物理特性、其用途、味道。该数据集由700个食谱组成,包含超过13,000个待抽取实体。我们提供了一些最先进的命名实体识别模型基线,表明我们的数据集对现有模型构成了坚实挑战。最佳模型平均达到0.95的分数,具体取决于实体类型——从0.781到0.982。我们共享该数据集和任务,以鼓励从食谱中进行更深入和复杂的信息抽取研究。
引用
@article{arxiv.2204.07775,
title = {TASTEset -- Recipe Dataset and Food Entities Recognition Benchmark},
author = {Ania Wróblewska and Agnieszka Kaliska and Maciej Pawłowski and Dawid Wiśniewski and Witold Sosnowski and Agnieszka Ławrynowicz},
journal= {arXiv preprint arXiv:2204.07775},
year = {2022}
}