Transformer-based text summarization with dynamic hybrid meta-heuristic learning rate optimization (ICA, GWO, and PSO)

Transformer-based abstractive text summarization models are highly sensitive to hyper-parameter configurations, particularly the learning rate, which critically influences convergence dynamics and summary quality. Conventional tuning strategies—such as grid search, random search, and deterministic schedulers—often fail to adapt effectively to the highly non-convex optimization landscape of transformer training. This paper proposes a dynamic hybrid meta-heuristic optimization framework that integrates the Imperialist Competitive Algorithm (ICA), Grey Wolf Optimizer (GWO), and Particle Swarm Optimization (PSO) to adaptively tune the learning rate of a T5-base model. We introduce a phased hybrid strategy (ICA-GWO) that allocates 30% of iterations to global exploration and 70% to local exploitation. Unlike existing hybrid meta-heuristics, our approach uses temporally segregated, role-specialized hybridization where ICA operates exclusively during exploration and GWO exclusively during exploitation, with a theoretically motivated fixed-phase transition. To our knowledge, this is the first such application to transformer learning rate optimization for abstractive summarization. We evaluate our approach on CNN/DailyMail and XSum datasets. The optimized models achieve significant ROUGE-L improvements over baseline methods and demonstrate improved generalization under domain shift. Human evaluation and BERTScore validation confirm reduced factual errors. Our T5-base model achieves competitive performance compared to larger models such as T5-large, while maintaining lower computational cost. These results demonstrate that adaptive meta-heuristic optimization can rival model scaling, providing a practical pathway for high-quality summarization in resource-constrained environments.

Authors

Institutions

Publication Details

Journal
Information Processing & Management
Published
2026-09-21
DOI
https://doi.org/10.1016/j.ipm.2026.105152
Primary Topic
Topic Modeling
Type
article
Field-Weighted Citation Impact
0.00
Controls
|||
ALL TIME
JAN
FEB
MAR
APR
MAY
JUN
JUL
AUG
SEP
article

Transformer-based text summarization with dynamic hybrid meta-heuristic learning rate optimization (ICA, GWO, and PSO)

Amir Shahab Shahabi, Amir Masoud Rahmani, Mohammad Reza Kangavari
Information Processing & Management
Topic Modeling
article

Transformer-based text summarization with dynamic hybrid meta-heuristic learning rate optimization (ICA, GWO, and PSO)

Amir Shahab Shahabi, Amir Masoud Rahmani, Mohammad Reza Kangavari
article en

Abstract

Transformer-based abstractive text summarization models are highly sensitive to hyper-parameter configurations, particularly the learning rate, which critically influences convergence dynamics and summary quality. Conventional tuning strategies—such as grid search, random search, and deterministic schedulers—often fail to adapt effectively to the highly non-convex optimization landscape of transformer training. This paper proposes a dynamic hybrid meta-heuristic optimization framework that integrates the Imperialist Competitive Algorithm (ICA), Grey Wolf Optimizer (GWO), and Particle Swarm Optimization (PSO) to adaptively tune the learning rate of a T5-base model. We introduce a phased hybrid strategy (ICA-GWO) that allocates 30% of iterations to global exploration and 70% to local exploitation. Unlike existing hybrid meta-heuristics, our approach uses temporally segregated, role-specialized hybridization where ICA operates exclusively during exploration and GWO exclusively during exploitation, with a theoretically motivated fixed-phase transition. To our knowledge, this is the first such application to transformer learning rate optimization for abstractive summarization. We evaluate our approach on CNN/DailyMail and XSum datasets. The optimized models achieve significant ROUGE-L improvements over baseline methods and demonstrate improved generalization under domain shift. Human evaluation and BERTScore validation confirm reduced factual errors. Our T5-base model achieves competitive performance compared to larger models such as T5-large, while maintaining lower computational cost. These results demonstrate that adaptive meta-heuristic optimization can rival model scaling, providing a practical pathway for high-quality summarization in resource-constrained environments.

Information Processing & ManagementVol. 64(2)
Islamic Azad University South Tehran Branch (IR), University of Tehran (IR)
Openalex Percentile: Top 8%
Topic Modeling
AI Navigator

Ask Laika to Summarize, Analyze, and Connect papers live on the map.

Summarize Papers & Methodologies

Extract key findings, datasets, and comparative methods across publications.

Benchmark Rankings & Visual Analytics

Rank top research institutions, authors, funders, topics, and journals by Field-Weighted Citation Impact (FWCI) and paper volume with instant charts.

Connect Distant Disciplines

Bridge topological clusters on the map to find hidden collaborative intersections.