中文

SWIFT 信息对手正规化:特征提取与聚类

机器学习 2025-09-01 v1 计算与语言

摘要

短文本聚类是文本分析社区的一个已知用例。当结构和内容落在自然语言领域时,例如推文或即时消息,只要文本长度足够,即可使用(预训练的)模型提取有意义的信息,如词性标注或主题标注。然而,自然语言模型不适用于聚类交易对手,因为它们在银行支付信息系统中,如 SWIFT。手动输入的标签通常是物理或法律实体细节,这些细节缺乏句子结构,却包含手动输入引入的所有变体和噪声。这留下了一个间隙,使得调查员或反欺诈专业人员在增强其对支付流量来源和受益人实体的了解并追踪资金和资产时,缺乏有效的工具。供应商传统上试图通过模糊匹配工具来弥合这一差距。鉴于这些考虑,我们提出了一个混合字符串相似度、主题建模、层次聚类和基于规则的管道,用于促进交易对手的聚类,同时也适用于预期簇数的未知情况。我们还设计了一套指标来补充该方法的评估,基于众所周知的精确率和召回率度量。在真实标注数据集上的测试结果表明,该方法在基线基于规则(“关键词”)方法之上显著提升了性能。该方法保留了基于规则系统中大部分可解释性,前者在后者的基础上添加了额外的簇细化层次。最终的工作流程减少了人工审查的需求。当只需调查特定子population 时,例如在制裁调查中,该方法有助于控制遗漏实体变体的风险。

关键词

引用

@article{arxiv.2508.21081,
  title  = {Normalisation of SWIFT Message Counterparties with Feature Extraction and Clustering},
  author = {Thanasis Schoinas and Benjamin Guinard and Diba Esbati and Richard Chalk},
  journal= {arXiv preprint arXiv:2508.21081},
  year   = {2025}
}