어떤 알고리즘을 선택해야 할까? 표와 그래프로 한눈에 비교해 보세요.
| 알고리즘 | 분류 | 정책 유형 | 행동 공간 | 핵심 아이디어 |
|---|---|---|---|---|
| DQN | 가치 기반 | Off-Policy | 이산(Discrete) | Q-러닝 + 딥러닝, 경험 리플레이, 타겟 네트워크 |
| PPO | 액터-크리틱 | On-Policy | 이산/연속 | 정책 업데이트 비율을 클리핑하여 학습 안정성 확보 |
| SAC | 액터-크리틱 | Off-Policy | 연속(Continuous) | 최대 엔트로피 원리, 탐색과 안정성 동시 강화 |
| RLHF | 인간 피드백 | Off-Policy | 주로 텍스트(이산) | 인간 선호도로 보상 모델을 학습 후 정책 강화 |
| GRPO | 정책 기반 | On-Policy | 주로 텍스트(이산) | PPO에서 가치/보상 모델 제거, RLVR 활용으로 극대화된 효율 |
주요 알고리즘들의 상대적인 특성을 시각적으로 비교합니다. (5점 만점, 높을수록 좋음)