中文

将命名实体识别提速:Auto-AdvER方法

计算与语言 2024-12-10 v1

摘要

本文介绍了Auto-AdvER的开发案例研究,这是一个专门针对汽车广告文本的命名实体识别模式和数据集。Auto-AdvER以行业需求为导向设计,旨在增强该领域的文本挖掘分析,并贡献了一个具有语言学独特性的NER数据集。我们提出了一种包含三个标签的模式:'Condition'(状态)、'Historic'(历史)和'Sales Options'(销售选项)。我们概述了标注的指导原则,描述了模式开发的方法论,并展示了标注研究的结果,表明标注者间一致性达到92%的F1分数。此外,我们比较了仅编码器模型(BERT、DeBERTaV3)和仅解码器开源及闭源大语言模型(LLM):Llama、Qwen、GPT-4和Gemini的性能。我们的结果表明,LLM类的模型优于较小的仅编码器模型。然而,LLM的成本较高,且对此任务而言远非完美。我们将此项工作作为迈向更精细分析的一步,并讨论了Auto-AdvER对广告分析和客户洞察的潜在影响,包括市场动态分析和数据驱动的预测性维护等应用。我们的模式及相关发现,适用于私人和公共机构考虑在汽车领域或其他专业领域进行命名实体识别。

关键词

引用

@article{arxiv.2412.05655,
  title  = {Shifting NER into High Gear: The Auto-AdvER Approach},
  author = {Filippos Ventirozos and Ioanna Nteka and Tania Nandy and Jozef Baca and Peter Appleby and Matthew Shardlow},
  journal= {arXiv preprint arXiv:2412.05655},
  year   = {2024}
}

备注

11 pages, 1 figure, 3 tables