中文

基于主动学习的多样、典型且已标注两百万(3A2M)烹饪食谱数据集

计算与语言 2023-06-14 v1 人工智能 机器学习

摘要

烹饪食谱使个人能够交流烹饪创意并提供食物制备说明。由于缺乏充足的标注数据,将网上发现的原始食谱归类到适当的食品类别是该领域的一项挑战性任务。利用领域专家的知识来分类食谱可能是一种解决方案。在本研究中,我们提出了一个新颖的数据集,包含两百万条烹饪食谱,借助食品专家的知识和主动学习技术标注到相应类别。为构建该数据集,我们从RecipeNLG数据集中收集食谱。然后,我们雇用三位可信度评分高于86.667%的人类专家,通过其命名实体识别(NER)对30万条食谱进行分类,并归入九类之一:烘焙、饮品、非素食、蔬菜、快餐、谷物、正餐、配菜和融合菜。最后,我们使用主动学习方法,结合查询委员会(Query-by-Committee)与人在回路(HITL)策略的混合,对剩余190万条食谱进行分类。我们的数据集包含超过两百万条食谱,每条均经过分类并带有一个相关的置信度分数。对于这9个类别,该大规模数据集的Fleiss Kappa分数约为0.56026。我们相信研究界可使用该数据集执行各种机器学习任务,如食谱类别分类、特定类别食谱生成、新食谱创建等。该数据集也可用于训练和评估各种NLP任务,如命名实体识别、词性标注、语义角色标注等。数据集将在发表后提供:https://tinyurl.com/3zu4778y。

关键词

引用

@article{arxiv.2303.16778,
  title  = {Assorted, Archetypal and Annotated Two Million (3A2M) Cooking Recipes Dataset based on Active Learning},
  author = {Nazmus Sakib and G. M. Shahariar and Md. Mohsinul Kabir and Md. Kamrul Hasan and Hasan Mahmud},
  journal= {arXiv preprint arXiv:2303.16778},
  year   = {2023}
}