中文

从合成到真实:物流客户服务中多语言意图分类的基准测试

计算与语言 2026-03-25 v1

摘要

多语言意图分类是全球物流平台客户服务系统的核心,模型必须处理跨语言和层次化标签空间中的噪声用户查询。然而,大多数现有多语言基准数据集依赖机器翻译文本,这些文本通常比来自真实客户请求的文本更干净、更标准化,从而可能高估实际鲁棒性。我们提供了一个来自真实物流客户服务日志构建的公共多语言意图分类基准测试数据集。该数据集包含约 3 万条去标识化的独立用户查询,经过滤选、LLM 辅助质量控制和人工审核,组织为具有 13 个父类和 17 个子类的两级分类体系。包含英语、西班牙语和阿拉伯语作为见证语言,同时支持印尼语、中文以及额外的仅测试语言进行零样本评估。为直接测量合成与真实评估之间的差距,我们提供了配对的原生查询和机器翻译测试集,并在平坦和层次化协议下对多语言编码器、嵌入模型和小型语言模型进行基准测试。结果表明,机器翻译测试集在处理噪声原生查询、尤其是长尾意图和跨语言迁移方面显著高估了性能,凸显了需要更真实的多语言意图基准测试的必要性。

关键词

引用

@article{arxiv.2603.23172,
  title  = {From Synthetic to Native: Benchmarking Multilingual Intent Classification in Logistics Customer Service},
  author = {Haoyu He and Jinyu Zhuang and Haoran Chu and Shuhang Yu and J and T AI Group and Hao Wang and Kunpeng Han},
  journal= {arXiv preprint arXiv:2603.23172},
  year   = {2026}
}