基于带实时安全验证的多智能体AI系统的动作到响应内容生成
人工智能
2026-01-21 v1 声音
摘要
本文提出了一种多智能体人工智能系统,能够基于音频导出的情感信号实时生成面向响应的媒体内容。不同于主要关注分类准确率的传统语音情感识别研究,我们的方法强调通过由专用AI智能体组成的结构化流水线,将推断的情感状态转化为安全的、适龄的且可控的响应内容。所提出的系统包含四个协作智能体:(1) 基于CNN的声学特征提取情感识别智能体,(2) 将情感映射到响应模式的响应策略决策智能体,(3) 生成媒体控制参数的内容参数生成智能体,以及(4) 强制执行适龄性和刺激约束的安全验证智能体。我们引入了显式的安全验证循环,在输出前过滤生成的内容,确保符合预定义规则。在公开数据集上的实验结果表明,该系统实现了73.2%的情感识别准确率、89.4%的响应模式一致性和100%的安全合规性,同时保持了低于100ms的推理延迟,适用于设备端部署。模块化架构实现了可解释性和可扩展性,使其可应用于儿童相关媒体、治疗应用以及情感响应智能设备。
引用
@article{arxiv.2601.13589,
title = {Motion-to-Response Content Generation via Multi-Agent AI System with Real-Time Safety Verification},
author = {HyeYoung Lee},
journal= {arXiv preprint arXiv:2601.13589},
year = {2026}
}