HoverPilot - Gymnasium 인터페이스로 환경을 재구성하다
state, action, reward를 하나의 RL environment로 묶는 과정
By 전경원
이전 글에서는 hover를 위한 reward와 termination 조건을 정리했습니다. 이제 이 조각들을 하나의 강화학습 환경(environment)으로 묶습니다. 그래야 PPO나 SAC 같은 알고리즘이 HoverPilot을 일반적인 Gymnasium 환경처럼 다룰 수 있습니다.
[Read More]