Machine Learning · Computer Science
Centroid-based deep metric learning for speaker recognition
Jixuan Wang, Kuan-Chieh Wang, Marc Law, Frank Rudzicz +1
2019-02-08
Audio and Speech Processing · Electrical Eng. & Systems
Triplet Network with Attention for Speaker Diarization
Huan Song, Megan Willi, Jayaraman J. Thiagarajan, Visar Berisha +1
2018-08-07
Computer Vision and Pattern Recognition · Computer Science
TCDesc: Learning Topology Consistent Descriptors
Honghu Pan, Fanyang Meng, Zhenyu He, Yongsheng Liang +1
2020-06-08
Audio and Speech Processing · Electrical Eng. & Systems
Learning acoustic word embeddings with phonetically associated triplet network
Hyungjun Lim, Younggwan Kim, Youngmoon Jung, Myunghun Jung +1
2018-11-29
Audio and Speech Processing · Electrical Eng. & Systems
Multiscale CNN based Deep Metric Learning for Bioacoustic Classification: Overcoming Training Data Scarcity Using Dynamic Triplet Loss
Anshul Thakur, Daksh Thapar, Padmanabhan Rajan, Aditya Nigam
2019-09-04
Machine Learning · Computer Science
Sample Efficient Adaptive Text-to-Speech
Yutian Chen, Yannis Assael, Brendan Shillingford, David Budden +10
2019-01-18
Audio and Speech Processing · Electrical Eng. & Systems
Towards Learning a Universal Non-Semantic Representation of Speech
Joel Shor, Aren Jansen, Ronnie Maor, Oran Lang +6
2021-05-11
Audio and Speech Processing · Electrical Eng. & Systems
In defence of metric learning for speaker recognition
Joon Son Chung, Jaesung Huh, Seongkyu Mun, Minjae Lee +6
2020-11-05
Computation and Language · Computer Science
Alignment Restricted Streaming Recurrent Neural Network Transducer
Jay Mahadeokar, Yuan Shangguan, Duc Le, Gil Keren +5
2020-11-20
Audio and Speech Processing · Electrical Eng. & Systems
Multi-turn RNN-T for streaming recognition of multi-party speech
Ilya Sklyar, Anna Piunova, Xianrui Zheng, Yulan Liu
2022-02-11
Computer Vision and Pattern Recognition · Computer Science
A Theoretically Sound Upper Bound on the Triplet Loss for Improving the Efficiency of Deep Distance Metric Learning
Thanh-Toan Do, Toan Tran, Ian Reid, Vijay Kumar +2
2019-04-19
Computation and Language · Computer Science
Triple M: A Practical Text-to-speech Synthesis System With Multi-guidance Attention And Multi-band Multi-time LPCNet
Shilun Lin, Fenglong Xie, Li Meng, Xinhui Li +1
2021-04-08
Audio and Speech Processing · Electrical Eng. & Systems
EfficientTDNN: Efficient Architecture Search for Speaker Recognition
Rui Wang, Zhihua Wei, Haoran Duan, Shouling Ji +2
2022-06-22
Audio and Speech Processing · Electrical Eng. & Systems
Neural Directed Speech Enhancement with Dual Microphone Array in High Noise Scenario
Wen Wen, Qiang Zhou, Yu Xi, Haoyu Li +2
2024-12-31