面向自动合规检测的跨域数据选择与增强
计算与语言
2026-04-24 v1 机器学习
摘要
自动检测监管合规性仍是一个具有挑战性的任务,due to 法律文本的复杂性和多样性。在一个法规上训练的模型往往难以推广到其他法规。这一局限性凸显了改善跨域迁移的必要方法。我们将数据选择作为缓解合规检测(以自然语言推理(NLI)任务形式)中的负迁移的策略。具体而言,我们评估了从更大来源域中选择增强数据的四种方法:随机抽样、Moore-Lewis交叉熵差、重要加权和基于嵌入检索。我们系统性地变更所选数据比例,以分析其对跨域适应的影响。我们的发现表明,针对性的数据选择显著减少了负迁移,为跨不同法规实现可扩展且可靠的合规自动化提供了实用路径。
引用
@article{arxiv.2604.21469,
title = {Cross-Domain Data Selection and Augmentation for Automatic Compliance Detection},
author = {Fariz Ikhwantri and Dusica Marijan},
journal= {arXiv preprint arXiv:2604.21469},
year = {2026}
}
备注
10 pages, 5 figures, 4 tables. 11th Special Session on Intelligent Data Mining, 2025 IEEE International Conference on Big Data