中文

领域特定数据蒸馏与多模态嵌入生成

机器学习 2024-10-29 v1 社会与信息网络

摘要

创建以领域为中心的嵌入所面临的挑战,源于非结构化数据的丰富以及领域特定结构化数据的稀缺。传统的嵌入技术通常依赖于其中一种模态,限制了其适用性和有效性。本文引入了一种新颖的建模方法,该方法利用结构化数据从非结构化数据中过滤噪声,从而在领域特定属性预测中产生具有高精确率和召回率的嵌入。所提出的模型在混合协同过滤(HCF)框架内运行,其中通用实体表示通过相关项目预测任务进行微调。我们的实验以云计算领域为重点,表明基于HCF的嵌入优于基于AutoEncoder的嵌入(使用纯非结构化数据),在领域特定属性预测中精确率提升了28%,召回率提升了11%。

关键词

引用

@article{arxiv.2410.20325,
  title  = {Domain Specific Data Distillation and Multi-modal Embedding Generation},
  author = {Sharadind Peddiraju and Srini Rajagopal},
  journal= {arXiv preprint arXiv:2410.20325},
  year   = {2024}
}

备注

7 pages, 3 figures