주요 강화학습 알고리즘의 핵심 개념과 특징을 한눈에 살펴보세요.
다음 상태의 최대 가치를 이용해 현재 행동의 가치를 학습하는 대표적인 오프-정책 알고리즘.
실제로 다음 행동을 선택한 후, 그 행동의 가치를 이용해 학습하는 대표적인 온-정책 알고리즘.
Q-러닝에 심층 신경망을 결합. 경험 리플레이와 타겟 네트워크로 학습 안정성을 확보한 DRL의 시초.
Q-러닝의 가치 과대평가 문제를 완화하기 위해 행동 선택과 가치 평가에 다른 네트워크를 사용.
Q-값을 상태 가치(V)와 행동 이점(A)으로 분리하여 학습 효율을 높인 신경망 구조.
TD 에러가 큰 '중요한' 경험을 우선적으로 샘플링하여 학습 효율을 극대화하는 기법.
정책 경사 정리(Policy Gradient Theorem)에 기반한 가장 기초적인 정책 기반 알고리즘.
정책(액터)과 가치(크리틱)를 동시에 학습. A3C는 병렬 비동기 방식으로 학습 속도를 크게 향상.
정책 업데이트가 이전 정책에서 크게 벗어나지 않도록 클리핑하여 학습 안정성을 확보. 현재도 널리 쓰임.
연속적인 행동 공간을 다루기 위한 결정론적 정책 기반의 오프-정책 액터-크리틱 알고리즘.
DDPG의 가치 과대평가 문제를 쌍둥이 Q-네트워크, 타겟 정책 평활화 등으로 개선하여 안정성을 높임.
보상과 함께 정책의 엔트로피를 최대화하여 탐색을 장려하고, 높은 샘플 효율성과 성능을 달성.
환경의 모델(전이 확률 등)을 알 때, 정책 평가와 개선을 반복하거나 가치 함수를 직접 계산하여 최적해를 찾음.
실제 경험으로 모델을 학습하고, 학습된 모델이 생성한 가상 경험을 이용해 학습을 가속하는 하이브리드 방식.
몬테카를로 트리 탐색(MCTS)과 딥러닝을 결합. MuZero는 규칙 없이 스스로 모델을 학습하여 계획함.
전문가의 (상태, 행동) 데이터를 지도학습처럼 모방하여 정책을 학습하는 가장 간단한 모방 학습.
GAN을 이용, 판별자가 전문가와 에이전트를 구분하며 생성하는 보상 신호로 정책을 학습하는 모방 학습.
인간의 선호도 피드백으로 보상 모델을 학습시킨 후, 이 모델을 이용해 정책을 강화. ChatGPT의 핵심 기술.
검증 가능한 보상(RLVR)을 직접 사용하거나 PPO를 극도로 최적화(GRPO)하여 효율적으로 정책을 미세 조정.