State-based Selection of Expert Policies in Disaster Environments and Reinforcement Learning of a Unified Student Policy via Distillation
본 논문은 재난 환경에서 4족 보행 로봇의 보행, 전도복귀 및 낙하착지를 단일 정책으로 통합하기 위한 제어 프레임워크를 제안한다. 기존의 단일 정책 공동 학습 방식은 상이한 목표를 동시에 다루는 과정에서 학습 시간과 난이도가 증가할 수 있으며, finite state machine(FSM) 기반 다중 정책 전환 방식은 모드 선택 및 전환 규칙에 의존한다. 이를 해결하기 위해 보행, 전도복귀, 낙하착지에 특화된 세 교사 정책을 학습하고, 로봇 상태에 따라 적절한 교사 행동을 선택하여 단일 학생 정책으로 증류하는 방법을 연구하였다. Isaac Sim 및 Isaac Lab 환경에서 학습한 정책을 MuJoCo 기반 복합 시나리오에서 sim-to-sim 방식으로 평가한 결과, 제안 방법은 단일 정책 공동 학습 및 FSM 기반 방법과 비교하여 더 높은 평균 성공률을 보였으며, 시나리오 수행 시 명시적 정책 스위칭 없이 세 기술을 단일 정책으로 통합할 수 있음을 검증하였다.
Authors
- Sung Jae Han
- Jung-Yup Kim
Publication Details
- Journal
- Transactions of the Korean Society of Mechanical Engineers A
- Published
- 2026-09-17
- DOI
- https://doi.org/10.3795/ksme-a.2026.50.9.709
- Primary Topic
- Reinforcement Learning in Robotics
- Type
- article
- Field-Weighted Citation Impact
- 0.00