강화 학습을 사용하여 카트 위에 있는 봉의 균형을 잡는 모델을 훈련합니다.
Description
이 예제는 TensorFlow.js를 사용하여 간단한 작업을 수행하는 방법을 보여줍니다. reinforcement learning (RL). 특히 TensorFlow.js에서 policy-gradient 방법의 구현을 보여줍니다. 이 구현은 고전적인 카트폴 제어 문제를 해결합니다.
혼자 활동을 통해 에이전트는 가능한 많은 스텝 동안 봉의 균형을 잡는 방법을 배웁니다.
사용 방법
상태
모델 초기화
훈련 매개변수
훈련 과정
시뮬레이션