利用自然语言处理预测智利服务条款中的潜在滥用条款
计算与语言
2025-06-09 v2 人工智能
计算机与社会
机器学习
摘要
本研究探讨了消费者合同中日益严重的信息不对称问题,这一问题因在线服务激增而加剧,这些服务附带复杂的服务条款,但很少被阅读。尽管已有关于自动分析方法的研究,但该问题因普遍关注英语机器学习方法以及欧盟等主要司法管辖区而更加严重。我们引入了一种新的方法论和一个庞大的数据集来解决这一差距。我们提出了一种新颖的标注方案,包含四个类别和总共 20 个类,并将其应用于智利使用的 50 份在线服务条款。我们对基于 Transformer 的模型的评估揭示了诸如语言和/或领域特定的预训练、小样本量以及模型架构等因素如何影响潜在滥用条款的检测和分类。结果显示,不同任务和模型的性能差异很大,检测任务的最高宏 F1 分数在 79% 到 89% 之间,微 F1 分数高达 96%,而分类任务的宏 F1 分数在 60% 到 70% 之间,微 F1 分数在 64% 到 80% 之间。值得注意的是,这是第一个西班牙语法律条款多标签分类数据集,应用了智利法律,并对西班牙语模型在法律领域进行了全面评估。我们的工作为未来在较少被考虑的法律分析方法开发方面的研究奠定了基础,并有可能导致实际应用,以支持智利乃至整个拉丁美洲的消费者。
引用
@article{arxiv.2502.00865,
title = {Predicting potentially abusive clauses in Chilean terms of services with natural language processing},
author = {Christoffer Loeffler and Andrea Martínez Freile and Tomás Rey Pizarro},
journal= {arXiv preprint arXiv:2502.00865},
year = {2025}
}
备注
39 pages, 2 figures, 8 tables, accepted for publication