Multi-Agent collaboration as a complementary architecture for AI-generated medical examination items
Qian et al. showed single LLMs can generate acceptable knowledge-based questions but struggle with higher-order reasoning. We argue this is architectural: decomposing item development into specialized agents for drafting, critique, and iterative adversarial refinement improves quality. In blinded evaluation for China’s National Medical Licensing Examination, multi-agent outputs received 57.7% of expert preferences, compared with 42.3% for the single-model baseline, indicating a viable path to surpass current limits in AI-assisted item generation.
Authors
- Zhehan Jiang (ORCID: https://orcid.org/0000-0002-1376-9439)
Institutions
- Peking University (CN)
Publication Details
- Journal
- npj Digital Medicine
- Published
- 2026-09-14
- DOI
- https://doi.org/10.1038/s41746-026-03187-z
- Primary Topic
- Explainable Artificial Intelligence (XAI)
- Type
- article
- Field-Weighted Citation Impact
- 0.00