面向工业产品属性值识别的可扩展高效检索方法 TACLR
计算与语言
2025-06-04 v4 人工智能
信息检索
摘要
产品属性值识别 (PAVI) 涉及从产品轮廓中识别属性值,这是提高电商平台上产品搜索、推荐和业务分析的关键任务。然而,现有的 PAVI 方法面临诸多挑战,如推断隐式值、处理超出分布 (OOD) 值以及生成规范化输出等。为 addressing these 挑战,我们引入了面向 PAVI 的首个检索式方法——受控对比学习检索 (TACLR)。TACLR 将 PAVI 表述为信息检索任务,通过对产品轮廓和候选值进行编码生成嵌入向量,并基于相似度检索值。它利用基于分类学感知的硬负采样进行对比学习训练,并采用自适应推断结合动态阈值。TACLR 提供了三个关键优势:(1) 有效处理隐式和 OOD 值并生成规范化输出;(2) 可扩展至数千类目、数万属性和数百万值;(3) 支持高负载工业部署的高效推断。广泛的实验在专有数据集和公开数据集上验证了 TACLR 的有效性和效率。进一步,该方法已成功部署于真实的电商平台 Xianyu,每日处理数百万产品列表,支持频繁更新的大规模属性分类学。我们发布代码以促进可重复性和未来研究,地址为 https://github.com/SuYindu/TACLR。
引用
@article{arxiv.2501.03835,
title = {TACLR: A Scalable and Efficient Retrieval-based Method for Industrial Product Attribute Value Identification},
author = {Yindu Su and Huike Zou and Lin Sun and Ting Zhang and Haiyang Yang and Liyu Chen and David Lo and Qingheng Zhang and Shuguang Han and Jufeng Chen},
journal= {arXiv preprint arXiv:2501.03835},
year = {2025}
}
备注
Accepted at ACL 2025