中文

利用自然语言处理预测历史文物的服装核心词汇

计算与语言 2022-12-16 v1 数字图书馆 信息检索

摘要

历史服饰文物是人类研究的宝贵资源。特别是,它们能为其相应时代的社会面貌提供重要见解。这些见解通常取自服装图片以及配套描述,并通常存储于准确描述服装与服饰物品的规范化受控词汇中,称为服装核心词汇(Costume Core Vocabulary)。从服饰描述构建准确的服装核心词汇可能具有挑战性,因为历史服饰物品常为捐赠所得,且配套描述可能基于未经训练的个人并使用了物品所处时期的通用语言。本文中,我们提出一种利用自然语言处理(NLP)将历史物品的自由文本描述映射到服装核心所提供的受控词汇的方法。尽管数据集有限,我们仍基于 Universal Sentence Encoder 训练了一个 NLP 模型,对该服装核心词汇子集的映射测试准确率超过 90%。我们描述了方法、设计选择与方法的开发过程,并展示了针对未见描述的服装核心预测的可行性。随着更多服饰描述仍在整理以用于训练,我们期望获得更高准确率以实现更好的泛化能力。

关键词

引用

@article{arxiv.2212.07931,
  title  = {Using Natural Language Processing to Predict Costume Core Vocabulary of Historical Artifacts},
  author = {Madhuvanti Muralikrishnan and Amr Hilal and Chreston Miller and Dina Smith-Glaviana},
  journal= {arXiv preprint arXiv:2212.07931},
  year   = {2022}
}

备注

To be presented at ICMLA 2022