Latest Research in Audio and Speech Processing

24 research papers · 2026 median publication year

Top Research Topics in Audio and Speech Processing

Highest-Cited Papers

  1. A dual-domain guided emotion-specialized swin transformer for enhancing speech emotion recognition
  2. Consensus-Guided Shared-Specific Tri-View Learning for Speech Emotion Recognition
  3. DCapsNet: a robust multi-feature deep capsule network for speech emotion recognition
  4. TurnBench: A Multi-Domain Benchmark for Turn-Taking Dynamics in Spoken Dialogue
  5. Exploring Multimodal Turn-Taking Cues in Face-to-Face Conversation using Voice Activity Projection
  6. DuplexDrama: A Synthesized Dialogue Dataset with Scenarios, Full-Duplex Behaviors, Expressive Speech, and Sound Events
  7. Post-Training Zero-Shot TTS for Fine-Grained Emotion and Duration Control via Natural Language
  8. Shifting Relational Paradigms for Affective Computing: Affective Resonance, Vitality Affects, and Vocal Interaction Fields
  9. ExHCLA-SER: An Explainable Hybrid CNN–LSTM–Attention Network for Speech-Driven Emotion Recognition in Mental Health Assessment
  10. SETEAB: Multiscale approach with Squeeze-and-Excitation Temporal Enhanced Aware Block for Speech Emotion Recognition
  11. The accuracy of automatic subtitles in Basque: a comparison between four speech-to-text programs
  12. Cross-modal audio-text attention for multimodal multitask speech emotion recognition in low-resource Urdu
  13. Dual-Scale State-Space Modeling with Speaker-Wise Dynamic CRF for Speech Emotion Recognition in Conversation
  14. VocalAffectBench: Evaluating Vocal Emotion Recognition in AI Audio Models
  15. SpokenUS: A Spoken User Simulator for Task-Oriented Dialogue
  16. Evaluating Multilingual Self-Supervised Learning Models for Multilingual Speech Emotion Recognition
  17. Sensory Modality Shapes the Representational Structure of Emotion Recognition
  18. Semantic Flow Regularization: Teaching LLMs to Generate Diverse Yet Coherent Responses
  19. SISER: Speaker-Invariant Speech Emotion Recognition with Entropy-Based Adversarial Training
  20. A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification
Controls
|||
ALL TIME
JAN
FEB
MAR
APR
MAY
JUN
JUL
AUG
SEP
L3 Region - - 2026 Sep Q3

Audio and Speech Processing

24 papers

Top Topics (7)

Emotion and Mood Recognition8
Computation and Language6
Audio and Speech Processing5
Sound2
Artificial Intelligence1
Subtitles and Audiovisual Media1
Machine Learning1

Top Publications (20)

1.A dual-domain guided emotion-specialized swin transformer for enhancing speech emotion recognition2.Consensus-Guided Shared-Specific Tri-View Learning for Speech Emotion Recognition3.DCapsNet: a robust multi-feature deep capsule network for speech emotion recognition4.TurnBench: A Multi-Domain Benchmark for Turn-Taking Dynamics in Spoken Dialogue5.Exploring Multimodal Turn-Taking Cues in Face-to-Face Conversation using Voice Activity Projection6.DuplexDrama: A Synthesized Dialogue Dataset with Scenarios, Full-Duplex Behaviors, Expressive Speech, and Sound Events7.Post-Training Zero-Shot TTS for Fine-Grained Emotion and Duration Control via Natural Language8.Shifting Relational Paradigms for Affective Computing: Affective Resonance, Vitality Affects, and Vocal Interaction Fields9.ExHCLA-SER: An Explainable Hybrid CNN–LSTM–Attention Network for Speech-Driven Emotion Recognition in Mental Health Assessment10.SETEAB: Multiscale approach with Squeeze-and-Excitation Temporal Enhanced Aware Block for Speech Emotion Recognition11.The accuracy of automatic subtitles in Basque: a comparison between four speech-to-text programs12.Cross-modal audio-text attention for multimodal multitask speech emotion recognition in low-resource Urdu13.Dual-Scale State-Space Modeling with Speaker-Wise Dynamic CRF for Speech Emotion Recognition in Conversation14.VocalAffectBench: Evaluating Vocal Emotion Recognition in AI Audio Models15.SpokenUS: A Spoken User Simulator for Task-Oriented Dialogue16.Evaluating Multilingual Self-Supervised Learning Models for Multilingual Speech Emotion Recognition17.Sensory Modality Shapes the Representational Structure of Emotion Recognition18.Semantic Flow Regularization: Teaching LLMs to Generate Diverse Yet Coherent Responses19.SISER: Speaker-Invariant Speech Emotion Recognition with Entropy-Based Adversarial Training20.A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification
AI Navigator

Ask Laika to Summarize, Analyze, and Connect papers live on the map.

Summarize Papers & Methodologies

Extract key findings, datasets, and comparative methods across publications.

Benchmark Rankings & Visual Analytics

Rank top research institutions, authors, funders, topics, and journals by Field-Weighted Citation Impact (FWCI) and paper volume with instant charts.

Connect Distant Disciplines

Bridge topological clusters on the map to find hidden collaborative intersections.