中文

基于弱标签的本体学习

声音 2022-03-07 v1 机器学习 多媒体 音频与语音处理

摘要

本体通过对领域中概念或属性及其之间关系的定义,涵盖了对知识的正式表示。在本工作中,我们旨在研究利用此类本体信息是否能改进基于弱标签数据的学习,弱标签数据更易收集,因其仅需知晓事件的存在或缺失。我们使用 AudioSet 本体与数据集,其中包含以本体概念弱标签的音频片段,且本体提供了概念间的“Is A”关系。我们首先重新实现了 soundevent_ontology 提出的模型并做修改以适配多标签场景,随后通过使用图卷积网络(GCN)建模本体信息来学习概念,扩展了该思路。我们发现基线 Siamese 在弱标签多标签场景下通过融入本体信息并未取得更好表现,而 GCN 确实能更好地捕获弱标签多标签数据的本体知识。在实验中,我们还探究了不同模块如何容忍弱标签引入的噪声并更好地融入本体信息。我们最佳的 Siamese-GCN 模型在较低层概念上取得 mAP=0.45 与 AUC=0.87,在较高层概念上取得 mAP=0.72 与 AUC=0.86,较基线 Siamese 有所提升,但约与未使用本体信息的模型持平。

关键词

引用

@article{arxiv.2203.02483,
  title  = {Ontological Learning from Weak Labels},
  author = {Larry Tang and Po Hao Chou and Yi Yu Zheng and Ziqian Ge and Ankit Shah and Bhiksha Raj},
  journal= {arXiv preprint arXiv:2203.02483},
  year   = {2022}
}