中文

基于深度学习的食谱命名实体识别模型

计算与语言 2024-06-07 v2 人工智能 信息检索

摘要

食物通过风味、营养、健康和可持续性等各种努力触及我们的生活。食谱是作为文化胶囊通过非结构化文本代代相传的。用于识别食谱文本构建块(命名实体)的自动化协议对于从信息提取到新颖食谱生成等各种应用具有巨大价值。命名实体识别是一种从具有已知标签的非结构化或半结构化数据中提取信息的技术。从 6,611 个手动标注的配料短语开始,我们累计创建了一个包含 26,445 个短语的增强数据集。同时,我们系统地清理和分析了来自黄金标准食谱数据存储库 RecipeDB 的配料短语,并使用 Stanford NER 对其进行标注。基于分析,我们采用基于聚类的方法采样了 88,526 个短语的子集,同时保留多样性以创建机器标注数据集。对这三个数据集上的 NER 方法进行了彻底调查,涉及统计方法、基于深度学习的语言模型的微调以及大型语言模型 (LLMs) 的少样本提示,提供了深刻的见解。我们得出结论,LLMs 上的少样本提示性能极差,而经过微调的 spaCy-transformer 表现最佳,其在手动标注、增强和机器标注数据集上的 macro-F1 分数分别为 95.9%、96.04% 和 95.71%。

关键词

引用

@article{arxiv.2402.17447,
  title  = {Deep Learning Based Named Entity Recognition Models for Recipes},
  author = {Mansi Goel and Ayush Agarwal and Shubham Agrawal and Janak Kapuriya and Akhil Vamshi Konam and Rishabh Gupta and Shrey Rastogi and Niharika and Ganesh Bagler},
  journal= {arXiv preprint arXiv:2402.17447},
  year   = {2024}
}

备注

13 pages, 6 main figures and 2 in appendices, and 3 main tables; Accepted for publication in LREC-COLING 2024