Computer Vision and Pattern Recognition · Computer Science
Audio-Visual Scene-Aware Dialog
Huda Alamri, Vincent Cartillier, Abhishek Das, Jue Wang +8
2019-05-10
Computation and Language · Computer Science
Bridging Text and Video: A Universal Multimodal Transformer for Video-Audio Scene-Aware Dialog
Zekang Li, Zongjia Li, Jinchao Zhang, Yang Feng +2
2020-02-04
Computation and Language · Computer Science
Audio-Visual Scene-Aware Dialog and Reasoning using Audio-Visual Transformers with Joint Student-Teacher Learning
Ankit P. Shah, Shijie Geng, Peng Gao, Anoop Cherian +4
2021-10-14
Computation and Language · Computer Science
End-to-End Audio Visual Scene-Aware Dialog using Multimodal Attention-Based Video Features
Chiori Hori, Huda Alamri, Jue Wang, Gordon Wichern +9
2018-07-03
Computation and Language · Computer Science
DSTC8-AVSD: Multimodal Semantic Transformer Network with Retrieval Style Word Generator
Hwanhee Lee, Seunghyun Yoon, Franck Dernoncourt, Doo Soon Kim +2
2020-04-20
Computation and Language · Computer Science
Exploring Context, Attention and Audio Features for Audio Visual Scene-Aware Dialog
Shachi H Kumar, Eda Okur, Saurav Sahay, Jonathan Huang +1
2019-12-27
Computation and Language · Computer Science
Context, Attention and Audio Feature Explorations for Audio Visual Scene-Aware Dialog
Shachi H Kumar, Eda Okur, Saurav Sahay, Juan Jose Alvarado Leanos +2
2018-12-21
Computation and Language · Computer Science
Reactive Multi-Stage Feature Fusion for Multimodal Dialogue Modeling
Yi-Ting Yeh, Tzu-Chuan Lin, Hsiao-Hua Cheng, Yu-Hsuan Deng +2
2019-08-15
Computation and Language · Computer Science
Audio Visual Scene-Aware Dialog Generation with Transformer-based Video Representations
Yoshihiro Yamazaki, Shota Orihashi, Ryo Masumura, Mihiro Uchida +1
2022-02-22
Multimedia · Computer Science
Leveraging Topics and Audio Features with Multimodal Attention for Audio Visual Scene-Aware Dialog
Shachi H Kumar, Eda Okur, Saurav Sahay, Jonathan Huang +1
2019-12-27
Computer Vision and Pattern Recognition · Computer Science
Dynamic Graph Representation Learning for Video Dialog via Multi-Modal Shuffled Transformers
Shijie Geng, Peng Gao, Moitreya Chatterjee, Chiori Hori +4
2021-03-04
Computation and Language · Computer Science
Dialog System Technology Challenge 7
Koichiro Yoshino, Chiori Hori, Julien Perez, Luis Fernando D'Haro +13
2019-01-14
Computation and Language · Computer Science
Multimodal Dialogue State Tracking By QA Approach with Data Augmentation
Xiangyang Mou, Brandyn Sigouin, Ian Steenstra, Hui Su
2020-07-21
Computation and Language · Computer Science
From FiLM to Video: Multi-turn Question Answering with Multi-modal Context
Dat Tien Nguyen, Shikhar Sharma, Hannes Schulz, Layla El Asri
2018-12-19
Computation and Language · Computer Science
Multi-step Joint-Modality Attention Network for Scene-Aware Dialogue System
Yun-Wei Chu, Kuan-Yen Lin, Chao-Chun Hsu, Lun-Wei Ku
2020-01-20
Robotics · Computer Science
Scene-Aware Conversational ADAS with Generative AI for Real-Time Driver Assistance
Kyungtae Han, Yitao Chen, Rohit Gupta, Onur Altintas
2025-07-15
Computation and Language · Computer Science
Entropy-Enhanced Multimodal Attention Model for Scene-Aware Dialogue Generation
Kuan-Yen Lin, Chao-Chun Hsu, Yun-Nung Chen, Lun-Wei Ku
2019-08-23
Artificial Intelligence · Computer Science
Enabling Harmonious Human-Machine Interaction with Visual-Context Augmented Dialogue System: A Review
Hao Wang, Bin Guo, Yating Zeng, Yasan Ding +4
2022-07-05
Computer Vision and Pattern Recognition · Computer Science
Learning to Answer Questions in Dynamic Audio-Visual Scenarios
Guangyao Li, Yake Wei, Yapeng Tian, Chenliang Xu +2
2022-04-06
Computer Vision and Pattern Recognition · Computer Science
End-to-End Multimodal Representation Learning for Video Dialog
Huda Alamri, Anthony Bilic, Michael Hu, Apoorva Beedu +1
2022-10-27
Computer Vision and Pattern Recognition · Computer Science
DualVD: An Adaptive Dual Encoding Model for Deep Visual Understanding in Visual Dialogue
Xiaoze Jiang, Jing Yu, Zengchang Qin, Yingying Zhuang +3
2019-11-19
Artificial Intelligence · Computer Science
Deep Learning Based Multi-modal Addressee Recognition in Visual Scenes with Utterances
Thao Minh Le, Nobuyuki Shimizu, Takashi Miyazaki, Koichi Shinoda
2018-09-13