AI-driven adaptive learning system with gesture recognition interaction model for personalized education
Artificial intelligence (AI)-driven adaptive learning systems require intuitive and efficient interactive methods to enhance learner engagement and personalization. Traditional input devices, such as keyboards and mouse, provide limited interactivity, while existing gesture recognition models struggle with temporal dependencies, partial occlusion, and high computational demands. This study proposes a Multi-Point Seagull Optimization-based Gesture Recognition (MPSO-GR) framework that leverages bi-directional temporal processing and multi-point optimization for accurate, real-time gesture recognition in adaptive educational environments. The framework tracks 21 hand key points across 40–60 gesture frames using a hybrid Convolutional Neural Network–Long Short-Term Memory (CNN-LSTM) classifier, improving recognition accuracy and reducing inference latency. A weighted fitness function with coefficients α = 0.7 and β = 0.3 selects the most discriminative feature subsets, balancing classification accuracy against feature compactness. System performance was evaluated across forward-only, backward-only, and bi-directional recognition configurations using accuracy, precision, recall, F1-score, latency, and resource utilization metrics. The bi-directional MPSO-GR configuration achieved 94.6% accuracy, 93.1% precision, 94.0% recall, 93.5% F1-score, and 47 ms latency, outperforming all evaluated baseline methods including PSO-GR, CNN-LSTM, SOA-LSTM, and Transformer-based gesture recognition approaches. Ablation studies confirm that bi-directional temporal integration (+ 6.4%), multi-point optimization (+ 4.5%), and MPSO-guided feature selection (+ 10.3%) each contribute independently and measurable to overall performance. Educational evaluation demonstrated improved task completion efficiency, learner engagement, knowledge retention, and adaptability across diverse learning styles. Technical limitations, real-world deployment considerations, privacy and ethical data governance requirements, and directions toward multimodal large language model (LLM) integration are discussed.
Authors
- Khalida Parveen (ORCID: https://orcid.org/0000-0003-2674-6866)
- Muhammad Shafiq (ORCID: https://orcid.org/0000-0002-3724-6528)
- Abdulelah A. Alghamdi
- Muhammad Ahmad
- Umar
- Zhenwen Sheng
Institutions
- Umm al-Qura University (SA)
- Istanbul Medipol University (TR)
- Shandong Xiehe University (CN)
Publication Details
- Journal
- Scientific Reports
- Published
- 2026-09-18
- DOI
- https://doi.org/10.1038/s41598-026-69971-9
- Primary Topic
- Hand Gesture Recognition Systems
- Type
- article
- Field-Weighted Citation Impact
- 0.00
Funders
- Umm Al-Qura University