利用标签语义在企业行业匹配中从噪声标签提取更高性能
信息检索
2022-12-06 v1 人工智能
摘要
在金融机构中,为公司分配恰当的行业标签是一项关键任务,因其影响各类金融机制。然而,这仍是一项复杂任务。通常,此类行业标签须由主题专家(SME)在依据行业定义评估公司业务线后分配。随着公司不断新增业务以及更新行业定义的形成,任务变得更具挑战性。鉴于该任务的周期性,合理假设可开发人工智能(AI)主体以高效执行。尽管前景令人振奋,挑战来自对此类标签分配(或标注)历史模式的需求。标注常因依赖 SME 与人工投入被视为机器学习(ML)中最昂贵的任务。因此,在企业环境中,ML 项目常遭遇噪声且依赖的标签。此类标签给 ML 模型产生稳健标签分配带来技术障碍。我们提出一种 ML 流水线,以语义相似度匹配作为多标签文本分类的替代,同时利用标签相似度矩阵与最小标注策略。我们展示该流水线在噪声上取得显著改进并展现出稳健的预测能力。
引用
@article{arxiv.2212.01685,
title = {Harnessing label semantics to extract higher performance under noisy label for Company to Industry matching},
author = {Apoorva Jaiswal and Abhishek Mitra},
journal= {arXiv preprint arXiv:2212.01685},
year = {2022}
}