利用交替采样的半监督长尾识别
密码学与安全
2021-06-01 v2
摘要
长尾识别的主要挑战来自不平衡的数据分布及其尾部类的样本稀缺。尽管已有技术提出实现更平衡的训练损失,并通过合成样本提升尾部类的数据多样性,我们转而利用现成的无标签数据以提升识别精度。该思路引出一种新的识别设定,即半监督长尾识别。我们认为该设定更贴近真实世界的数据收集与标注过程,从而有助于缩小与真实场景的差距。为解决半监督长尾识别问题,我们提出一种交替采样框架,结合这两个研究领域中成功方法的直觉。分类器与特征嵌入被分别学习并迭代更新。类平衡采样策略用于训练分类器,使其不受无标签数据伪标签质量的影响。引入一致性损失以限制无标签数据的影响,同时利用其更新特征嵌入。我们在两个数据集上展示了相较其他竞争方法的显著精度提升。
引用
@article{arxiv.2105.00132,
title = {Targeting the Weakest Link: Social Engineering Attacks in Ethereum Smart Contracts},
author = {Nikolay Ivanov and Jianzhi Lou and Ting Chen and Jin Li and Qiben Yan},
journal= {arXiv preprint arXiv:2105.00132},
year = {2021}
}
备注
ACM ASIA Conference on Computer and Communications Security 2021, 15 pages