EPM-RL:基于强化学习的本地化电商产品映射
计算与语言
2026-04-28 v1 人工智能
数据库
机器学习
多智能体系统
摘要
产品映射是决定两个电商列表是否指指同一产品的任务,这是价格监控和渠道可见性的核心问题。然而,在实际市场场所中,卖家经常会向标题中注入促销关键词、平台特定标签和捆绑描述,导致同一产品以许多不同名称出现。最近的基于大语言模型(LLM)和多智能体框架在此类困难案例中改进了鲁棒性和可解释性,但它们往往依赖昂贵的外部API、重复检索和复杂的推理时序编排,使得大规模部署成本高昂且在隐私敏感的企业环境中难以实现。为此,我们提出EPM-RL,一个基于强化学习的框架,用于构建准确且高效的本地化电商产品映射模型。我们的核心思想是将高成本的智能体推理蒸馏到一个可训练的本地模型中。从一组带有LLM生成的理由和人工验证的精选产品对开始,我们首先对小型学生模型进行参数高效微调(PEFT),使用结构化推理输出。随后,我们使用基于智能体的奖励进一步优化该模型,该奖励联合评估输出格式合规性、标签正确性和推理偏好分数来自专为设计的评判模型。初步结果表明,EPM-RL 在PEFT-only训练之上始终获得改进,并在质量-成本权衡方面优于基于商业API的基线,同时实现私有部署和较低的运营成本。这些发现表明,强化学习可以将产品映射从高延迟的智能体管道转化为可扩展的、可审查的和生产就绪的本地系统。
引用
@article{arxiv.2604.23993,
title = {EPM-RL: Reinforcement Learning for On-Premise Product Mapping in E-Commerce},
author = {Minhyeong Yu and Wonduk Seo},
journal= {arXiv preprint arXiv:2604.23993},
year = {2026}
}
备注
preprint