中文

InfoBehavior:基于分层分组的超长行为序列自监督表示学习

计算与语言 2021-06-15 v1

摘要

电子商务公司不得不面对销售潜在危险产品的异常卖家。通常,可通过联合考虑产品内容(如标题和图像)与卖家行为来识别风险。本工作聚焦于行为特征提取,因为行为序列能通过反映卖家的操作习惯为风险发现提供有价值的线索。传统的特征提取技术严重依赖领域专家且对新任务适应性差。本文提出一种自监督方法 InfoBehavior,以自动从超长原始行为序列中提取有意义的表示,取代代价高昂的特征选择过程。InfoBehavior 利用 Bidirectional Transformer 作为特征编码器,因其在建模长期依赖方面具有优异能力。然而,由于 Transformer 所需的时间和内存随序列长度呈二次增长,这对商用 GPU 而言难以处理。因此,我们提出一种分层分组策略,将超长原始行为序列聚合成长度可处理的高层嵌入序列。此外,我们引入两类预文本任务。序列相关预文本任务定义基于对比的训练目标,以从其他“干扰”行为序列中正确选出被掩码的粗粒度/细粒度行为序列;领域相关预文本任务设计分类训练目标,以正确预测异常行为的领域特定统计结果。我们展示了预训练的 InfoBehavior 的行为表示可直接使用或与其他侧信息特征融合,以支持广泛的下游任务。实验结果证明 InfoBehavior 显著提升了产品风险管理与知识产权保护的性能。

关键词

引用

@article{arxiv.2106.06905,
  title  = {InfoBehavior: Self-supervised Representation Learning for Ultra-long Behavior Sequence via Hierarchical Grouping},
  author = {Runshi Liu and Pengda Qin and Yuhong Li and Weigao Wen and Dong Li and Kefeng Deng and Qiang Wu},
  journal= {arXiv preprint arXiv:2106.06905},
  year   = {2021}
}