강화학습 알고리즘 비교 분석

어떤 알고리즘을 선택해야 할까? 표와 그래프로 한눈에 비교해 보세요.

주요 알고리즘 비교표

알고리즘 분류 정책 유형 행동 공간 핵심 아이디어
DQN 가치 기반 Off-Policy 이산(Discrete) Q-러닝 + 딥러닝, 경험 리플레이, 타겟 네트워크
PPO 액터-크리틱 On-Policy 이산/연속 정책 업데이트 비율을 클리핑하여 학습 안정성 확보
SAC 액터-크리틱 Off-Policy 연속(Continuous) 최대 엔트로피 원리, 탐색과 안정성 동시 강화
RLHF 인간 피드백 Off-Policy 주로 텍스트(이산) 인간 선호도로 보상 모델을 학습 후 정책 강화
GRPO 정책 기반 On-Policy 주로 텍스트(이산) PPO에서 가치/보상 모델 제거, RLVR 활용으로 극대화된 효율

성능 특성 비교 (레이더 차트)

주요 알고리즘들의 상대적인 특성을 시각적으로 비교합니다. (5점 만점, 높을수록 좋음)

방법론별 장단점 요약

가치 기반 (DQN 계열)

장점

  • 샘플 효율성이 높음 (Off-Policy)
  • 개념적으로 비교적 단순함
  • 이산 행동 공간 문제에서 강력한 성능

단점

  • 연속 행동 공간에 직접 적용 불가
  • 결정론적 정책만 학습 가능
  • Q-값 과대평가 문제 발생 가능

액터-크리틱 (PPO, SAC 등)

장점

  • 연속 행동 공간에 효과적
  • 확률적 정책을 직접 학습하여 수렴성이 좋음
  • On-Policy, Off-Policy 모두 존재

단점

  • On-Policy 계열(PPO)은 샘플 효율성이 낮음
  • 두 개의 네트워크를 학습시켜야 하므로 복잡함
  • 하이퍼파라미터에 민감할 수 있음

모방 및 피드백 (RLHF 등)

장점

  • 보상 함수 설계가 어려운 문제에 적용 가능
  • 인간의 의도나 가치를 반영하기 용이함
  • 초기 학습을 빠르게 유도할 수 있음

단점

  • 전문가 데이터나 인간 피드백 비용이 높음
  • 전문가보다 뛰어난 성능을 내기 어려움 (모방)
  • 복합 오류(Compounding Error) 문제 발생 가능

효율 최적화 (GRPO)

장점

  • 극도로 높은 메모리 효율성 (가치/보상 모델 제거)
  • 빠른 훈련 속도 및 높은 확장성
  • 검증 가능한 보상(RLVR)으로 정확도 향상 가능

단점

  • 범용적이지 않고 추론 모델 훈련에 특화
  • 효과적인 보상 함수/검증자 설계가 필수적
  • Unsloth 등 특정 환경/라이브러리 의존성