강화학습 알고리즘 라이브러리

주요 강화학습 알고리즘의 핵심 개념과 특징을 한눈에 살펴보세요.

I. 가치 기반 방법 (Value-Based)

Q-Learning

다음 상태의 최대 가치를 이용해 현재 행동의 가치를 학습하는 대표적인 오프-정책 알고리즘.

Off-Policy Model-Free

SARSA

실제로 다음 행동을 선택한 후, 그 행동의 가치를 이용해 학습하는 대표적인 온-정책 알고리즘.

On-Policy Model-Free

DQN

Q-러닝에 심층 신경망을 결합. 경험 리플레이와 타겟 네트워크로 학습 안정성을 확보한 DRL의 시초.

Off-Policy Model-Free

Double DQN (DDQN)

Q-러닝의 가치 과대평가 문제를 완화하기 위해 행동 선택과 가치 평가에 다른 네트워크를 사용.

Off-Policy Model-Free

Dueling DQN

Q-값을 상태 가치(V)와 행동 이점(A)으로 분리하여 학습 효율을 높인 신경망 구조.

Off-Policy Model-Free

PER

TD 에러가 큰 '중요한' 경험을 우선적으로 샘플링하여 학습 효율을 극대화하는 기법.

기법 Model-Free

II. 정책 기반 방법 (Policy-Based)

REINFORCE (VPG)

정책 경사 정리(Policy Gradient Theorem)에 기반한 가장 기초적인 정책 기반 알고리즘.

On-Policy Model-Free

III. 액터-크리틱 (Actor-Critic)

A2C / A3C

정책(액터)과 가치(크리틱)를 동시에 학습. A3C는 병렬 비동기 방식으로 학습 속도를 크게 향상.

On-Policy Model-Free

PPO

정책 업데이트가 이전 정책에서 크게 벗어나지 않도록 클리핑하여 학습 안정성을 확보. 현재도 널리 쓰임.

On-Policy Model-Free

DDPG

연속적인 행동 공간을 다루기 위한 결정론적 정책 기반의 오프-정책 액터-크리틱 알고리즘.

Off-Policy Model-Free

TD3

DDPG의 가치 과대평가 문제를 쌍둥이 Q-네트워크, 타겟 정책 평활화 등으로 개선하여 안정성을 높임.

Off-Policy Model-Free

SAC

보상과 함께 정책의 엔트로피를 최대화하여 탐색을 장려하고, 높은 샘플 효율성과 성능을 달성.

Off-Policy Model-Free

IV. 모델 기반 방법 (Model-Based)

Policy / Value Iteration

환경의 모델(전이 확률 등)을 알 때, 정책 평가와 개선을 반복하거나 가치 함수를 직접 계산하여 최적해를 찾음.

Planning Model-Based

Dyna-Q

실제 경험으로 모델을 학습하고, 학습된 모델이 생성한 가상 경험을 이용해 학습을 가속하는 하이브리드 방식.

Model-Based

AlphaZero / MuZero

몬테카를로 트리 탐색(MCTS)과 딥러닝을 결합. MuZero는 규칙 없이 스스로 모델을 학습하여 계획함.

Model-Based

V. 모방 학습 및 인간 피드백 (Imitation & Feedback)

Behavior Cloning (BC)

전문가의 (상태, 행동) 데이터를 지도학습처럼 모방하여 정책을 학습하는 가장 간단한 모방 학습.

Imitation

GAIL

GAN을 이용, 판별자가 전문가와 에이전트를 구분하며 생성하는 보상 신호로 정책을 학습하는 모방 학습.

Imitation

RLHF

인간의 선호도 피드백으로 보상 모델을 학습시킨 후, 이 모델을 이용해 정책을 강화. ChatGPT의 핵심 기술.

Human Feedback

RLVR / GRPO

검증 가능한 보상(RLVR)을 직접 사용하거나 PPO를 극도로 최적화(GRPO)하여 효율적으로 정책을 미세 조정.

Human Feedback