中文

DeepSafety:用于对话中暴力检测的多级音频-文本特征提取与融合方法

计算机与社会 2022-06-24 v1

摘要

自然语言处理近来使理解人类交互更为容易,从而改进了情感分析与行为预测。然而,对话中的措辞与声音线索呈现了用于人身安全与犯罪预防的、尚未充分挖掘的丰富自然语言数据源。辅以音频分析,可理解对话语境,包括人际间的紧张或裂痕程度。基于已有工作,我们引入一种新颖的信息融合方法,提取并融合包括言语、声音与文本在内的多级特征作为异质信息源,以检测对话中暴力行为的程度。我们的多级多模型融合框架整合了来自原始音频信号的四类信息:由 BERT 与双向长短期记忆(LSTM)模型生成的嵌入、应用于梅尔频率倒谱(MFCC)的 2D CNN 输出,以及音频时域稠密层输出。这些嵌入随后传入三层全连接(FC)网络,作为拼接步骤。我们的实验设置显示,来自不同模态的多级特征组合比单一特征取得更优性能,F1 分数=0.85。我们期望本方法所得发现为对话中暴力检测提供新途径。

关键词

引用

@article{arxiv.2206.11822,
  title  = {DeepSafety:Multi-level Audio-Text Feature Extraction and Fusion Approach for Violence Detection in Conversations},
  author = {Amna Anwar and Eiman Kanjo and Dario Ortega Anderez},
  journal= {arXiv preprint arXiv:2206.11822},
  year   = {2022}
}

备注

34 pages, 6 figures