基于领域自适应小语言模型的结构化税法代码预测
机器学习
2025-07-22 v2 计算与语言
摘要
每天,跨国企业要处理成千上万的交易,每笔交易都必须遵守因司辖区不同而变化且常常含糊的税法规定。确定产品和服务的税法代码(如HSN或SAC)是税收合规中的重要用例。准确确定此类代码至关重要,以避免税收惩罚。本文提出一种基于编码器-解码器架构的领域自适应小语言模型(SLM),用于增强产品和服务税法代码的预测。在此方法中,我们解决使用非结构化产品和服务数据预测分层税法代码序列的问题。我们采用基于编码器-解码器架构的SLM,因为这使得能够捕捉税法代码中存在的分层依赖关系。我们的实验表明,编码器-解码器SLM可以成功应用于结构化税法代码的顺序预测,这一领域在当前NLP研究中相对不受关注。在本文中,我们展示了针对HSN(关税协定 nomenclature)的领域自适应编码器-解码器SLM在预测任务方面优于平面分类器,并在结构化序列生成任务中优于解码器专用和编码器专用架构。该方法还可以扩展到其他政府强制的税收商品代码,如联合国标准产品和服务代码(UNSPSC)或巴西的 Mercosul 通用命名(NCM)。
引用
@article{arxiv.2507.10880,
title = {Domain-Adaptive Small Language Models for Structured Tax Code Prediction},
author = {Souvik Nath and Sumit Wadhwa and Luis Perez},
journal= {arXiv preprint arXiv:2507.10880},
year = {2025}
}
备注
10 pages, 3 figures