Machine Learning for Non‐invasive Differentiation of Glottic Carcinoma Versus Laryngeal Immobility
OBJECTIVE: Voice analysis for medical diagnostics is advancing rapidly with artificial intelligence and machine learning. Non-invasive voice analysis could optimize diagnostic procedures in ear, nose, and throat (ENT), supplementing endoscopic evaluations and guiding treatment strategies. This study aims to distinguish early glottic carcinomas (EGCs) from unilateral laryngeal immobility (ULI) in dysphonic patients using machine learning. STUDY DESIGN: A machine learning model was developed in Python, incorporating data segmentation, normalization, hyperparameter tuning, and data augmentation via parameter transformation and using Synthetic Minority Over-sampling Technique (SMOTE) to balance class distributions. A metamodel combining multiple algorithms (Random Forest Classifier, Support Vector Machines, and Extreme Gradient Boosting) enhanced predictive accuracy. SETTING: Tertiary Medical Center (laryngology unit, ENT Department). METHODS: Population is dysphonic patients diagnosed with ULI or EGC, and asymptomatic controls. Patients with other voice-affecting conditions were excluded. Sixty-three pathologic cases (ULI: 38, EGC: 25) and 40 controls. Data augmentation and rebalance expanded the data set to 650 samples. Voice recordings of sustained vowels were analyzed for vocal parameters (fundamental frequency, jitter, and shimmer) using machine learning. High-quality audio equipment was used. Model performance was evaluated by precision, recall, and area under receiver operating characteristic curve (AUC) in differentiating EGC from ULI. RESULTS: The model achieved 72% accuracy in distinguishing ULI from EGC, validated through tests. CONCLUSION: Machine learning shows strong potential for distinguishing EGC from ULI. This non-invasive method could improve diagnostic accuracy and enable earlier intervention, especially in regions with limited specialist access. Further refinement could enhance its role in public health.
Authors
- Robin Baudouin (ORCID: https://orcid.org/0000-0002-4039-4310)
- Tiffany Rigal
- Aude Julien‐Laferriere (ORCID: https://orcid.org/0000-0003-4387-7454)
- Grégoire Vialatte de Pémille
- Marta P. Circiu
- Jerome Rene Lechien (ORCID: https://orcid.org/0000-0002-0845-0845)
- Clémence Forges (ORCID: https://orcid.org/0009-0004-3382-0088)
- Stéphane Hans (ORCID: https://orcid.org/0000-0002-1060-1964)
- Lise Crevier‐Buchman (ORCID: https://orcid.org/0000-0002-2900-0528)
- Stanislas Nicolleau
Institutions
- Centre National de la Recherche Scientifique (FR)
- Université Sorbonne Nouvelle (FR)
- Université de Versailles Saint-Quentin-en-Yvelines (FR)
- Université Paris-Saclay (FR)
- Sorbonne Université (FR)
- ESME - École d’ingénieurs pluridisciplinaires (FR)
- Laboratoire de Phonétique et Phonologie (FR)
- Hôpital Foch (FR)
Publication Details
- Journal
- Otolaryngology
- Published
- 2026-09-29
- DOI
- https://doi.org/10.1002/ohn.70465
- Primary Topic
- Voice and Speech Disorders
- Type
- article
- Field-Weighted Citation Impact
- 0.00