中文

ImplicitAVE:面向隐式属性值提取的开源数据集与多模态大语言模型基准

计算机视觉与模式识别 2024-07-23 v2 人工智能 计算与语言 信息检索 机器学习

摘要

现有属性值提取(AVE)数据集主要关注显式属性值,忽略隐式属性值;且往往缺少产品图像、不公开且缺乏跨领域的人类细致检验。为此,本文提出ImplicitAVE,首个公开的多模态隐式属性值提取数据集。该数据集源自MAVE数据集,经过精细筛选和扩展,加入隐式AVE与多模态特征,形成68k条训练数据和1.6k条测试数据,覆盖五个领域。我们还探索将多模态大语言模型(MLLM)应用于隐式AVE,构建了MLLM在ImplicitAVE上的全面基准测试。评估了六个近期MLLM的十个变体,结果显示隐式值提取仍是MLLM的挑战性任务。本工作贡献包括:开发并发布ImplicitAVE数据集,以及对various MLLMs进行隐式AVE的探索与基准测试,为后续研究提供洞见与潜在方向。数据集与代码已公开于https://github.com/HenryPengZou/ImplicitAVE。

关键词

引用

@article{arxiv.2404.15592,
  title  = {ImplicitAVE: An Open-Source Dataset and Multimodal LLMs Benchmark for Implicit Attribute Value Extraction},
  author = {Henry Peng Zou and Vinay Samuel and Yue Zhou and Weizhi Zhang and Liancheng Fang and Zihe Song and Philip S. Yu and Cornelia Caragea},
  journal= {arXiv preprint arXiv:2404.15592},
  year   = {2024}
}

备注

Accepted by ACL 2024 (Findings) - Scores: Soundness - 4/4/4, Dataset - 4/4/4, Overall Assessment - 4/3.5/3.5, Meta - 4