面向语音商务的一次性标题压缩的无监督元学习
机器学习
2021-02-23 v1 人工智能
计算与语言
摘要
面向语音与移动商务的商品标题压缩是一个被充分研究的问题,迄今已有若干监督模型被提出。然而这些模型有两大局限:它们并非设计用于基于推断时的线索动态生成压缩,且在测试时对不同品类的迁移能力不佳。为克服这些不足,我们将标题压缩建模为元学习问题,并追问:仅给定一个压缩样例,我们能否学到标题压缩模型?我们采用无监督方法进行元训练,提出一种自动任务生成算法,将观测标签生成过程建模为 4 个未观测过程的产物。我们对这 4 个潜过程建立参数化近似,以获得生成随机压缩规则的原则性方式,并将其视为不同任务。对于主元学习器,我们使用两个模型 M1 与 M2。M1 是任务无关的嵌入生成器,其输出送入作为任务相关标签生成器的 M2。我们在一新颖的无监督片段排序预测任务上预训练 M1,使我们能将 M1 视为在元训练过程中也学习片段排序的片段生成器。我们在 16000 个众包生成的元测试样例上的实验表明,我们的无监督元训练机制在每任务仅见一例的情况下,能为不同任务习得学习算法。进一步,我们展示作为黑盒元学习器端到端训练的模型优于非参数方法。我们的最佳模型取得 0.8412 的 F1 分数,以 25 个 F1 点的巨大优势超越基线。
引用
@article{arxiv.2102.10760,
title = {Unsupervised Meta Learning for One Shot Title Compression in Voice Commerce},
author = {Snehasish Mukherjee},
journal= {arXiv preprint arXiv:2102.10760},
year = {2021}
}
备注
Work carried out as part of CS330, Stanford University, Fall 2020