Latest Research in Audio and Speech Processing
24 research papers · 2026 median publication year
Top Research Topics in Audio and Speech Processing
- Emotion and Mood Recognition — 8 papers
- Computation and Language — 6 papers
- Audio and Speech Processing — 5 papers
- Sound — 2 papers
- Artificial Intelligence — 1 papers
- Subtitles and Audiovisual Media — 1 papers
- Machine Learning — 1 papers
Highest-Cited Papers
- A dual-domain guided emotion-specialized swin transformer for enhancing speech emotion recognition
- Consensus-Guided Shared-Specific Tri-View Learning for Speech Emotion Recognition
- DCapsNet: a robust multi-feature deep capsule network for speech emotion recognition
- TurnBench: A Multi-Domain Benchmark for Turn-Taking Dynamics in Spoken Dialogue
- Exploring Multimodal Turn-Taking Cues in Face-to-Face Conversation using Voice Activity Projection
- DuplexDrama: A Synthesized Dialogue Dataset with Scenarios, Full-Duplex Behaviors, Expressive Speech, and Sound Events
- Post-Training Zero-Shot TTS for Fine-Grained Emotion and Duration Control via Natural Language
- Shifting Relational Paradigms for Affective Computing: Affective Resonance, Vitality Affects, and Vocal Interaction Fields
- ExHCLA-SER: An Explainable Hybrid CNN–LSTM–Attention Network for Speech-Driven Emotion Recognition in Mental Health Assessment
- SETEAB: Multiscale approach with Squeeze-and-Excitation Temporal Enhanced Aware Block for Speech Emotion Recognition
- The accuracy of automatic subtitles in Basque: a comparison between four speech-to-text programs
- Cross-modal audio-text attention for multimodal multitask speech emotion recognition in low-resource Urdu
- Dual-Scale State-Space Modeling with Speaker-Wise Dynamic CRF for Speech Emotion Recognition in Conversation
- VocalAffectBench: Evaluating Vocal Emotion Recognition in AI Audio Models
- SpokenUS: A Spoken User Simulator for Task-Oriented Dialogue
- Evaluating Multilingual Self-Supervised Learning Models for Multilingual Speech Emotion Recognition
- Sensory Modality Shapes the Representational Structure of Emotion Recognition
- Semantic Flow Regularization: Teaching LLMs to Generate Diverse Yet Coherent Responses
- SISER: Speaker-Invariant Speech Emotion Recognition with Entropy-Based Adversarial Training
- A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification