ATLAS:通过协调关税代码分类对 LLMs 进行全球贸易基准测试与适配
人工智能
2025-09-24 v1
摘要
在协调关税制度(HTS)下对产品进行准确分类是全球贸易的关键瓶颈,但机器学习社区对此关注甚少。分类错误可能导致运输完全中断,主要邮政运营商因海关文件不完整而暂停向美国的配送。我们引入了首个 HTS 代码分类基准,该基准源自美国海关裁决在线检索系统(CROSS)。评估主流 LLM 后,我们发现微调的 Atlas 模型(LLaMA-3.3-70B)在 10 位代码分类上达到 40% 的完全正确率,在 6 位代码分类上达到 57.5% 的正确率,相比 GPT-5-Thinking 提升 15 个百分点,相比 Gemini-2.5-Pro-Thinking 提升 27.5 个百分点。除了准确性之外,Atlas 的成本约为 GPT-5-Thinking 的五分之一、Gemini-2.5-Pro-Thinking 的八分之一,并且可以自托管以保证高风险贸易和合规工作流中的数据隐私。虽然 Atlas 建立了强有力的基线,但该基准仍然极具挑战性——10 位准确率仅为 40%。通过发布数据集和模型,我们旨在将 HTS 分类定位为一个新的社区基准任务,并邀请未来在检索、推理和对齐方面的工作。
引用
@article{arxiv.2509.18400,
title = {ATLAS: Benchmarking and Adapting LLMs for Global Trade via Harmonized Tariff Code Classification},
author = {Pritish Yuvraj and Siva Devarakonda},
journal= {arXiv preprint arXiv:2509.18400},
year = {2025}
}