HoverPilot — 강화학습을 위한 Reward 설계
RealFlight Link 상태 데이터를 기반으로 hover reward를 구성해보자
By 전경원
이전 단계까지 진행하면서 state와 action은 이미 연결해 두었다. 이제 남은 것은 강화학습에서 가장 중요한 요소 중 하나인 보상 함수(reward)를 설계하는 일이다. reward는 에이전트의 행동이 목표하는 상태에 얼마나 가까운지를 알려주는 기준이며, 학습이 어떤 방향으로 진행될지를 결정한다. 결국 reward를 어떻게 설계하느냐에 따라 최종 학습 결과도 크게 달라진다.
[Read More]