MSMT-FN:面向营销音频分类的多段多任务融合网络
声音
2025-11-17 v1 人工智能
摘要
音频分类在情感分析和情感识别中发挥着 essential 作用,尤其是用于分析客户在营销电话中的态度。从大规模音频数据中高效地对客户的购买倾向进行分类仍然具有挑战性。为此,本文提出一种新颖的多段多任务融合网络 (MSMT-FN),其设计独特地针对上述商业需求。我们在专有 MarketCalls 数据集以及既定基准(CMU-MOSI、CMU-MOSEI 和 MELD)上进行的评估显示,MSMT-FN 在各项指标上一致优于或相当于最先进的方法。此外,我们新整理的 MarketCalls 数据集将在请求后公开,代码基座已在 GitHub 仓库中公开,以便进一步的研究和在音频分类领域的进一步发展。
引用
@article{arxiv.2511.11006,
title = {MSMT-FN: Multi-segment Multi-task Fusion Network for Marketing Audio Classification},
author = {HongYu Liu and Ruijie Wan and Yueju Han and Junxin Li and Liuxing Lu and Chao He and Lihua Cai},
journal= {arXiv preprint arXiv:2511.11006},
year = {2025}
}
备注
Accepted at The 21st International Conference on Advanced Data Mining and Applications (ADMA 2025). In book: Advanced Data Mining and Applications (pp.306-320)