강화 학습 알고리즘 --- ### 강화 학습 알고리즘 비교 표 | **Algorithm (알고리즘)** | **Description (설명)** | **P / A / S / O** | |--------------------------------------------|----------------------------------------------------------------------------------------------------------|-----------------------------------------------------------------------------------| | **Monte Carlo** | 에피소드 경험으로 가치 함수 추정, 모델 필요 없음, 에피소드 종료 후 업데이트 | Either / D / D / SM | | **TD Learning** | 현재와 다음 상태 가치 차이로 학습, 모델 필요 없음, 에피소드 중 학습 가능 | Off / D / D / SV | | **Q-learning** | 행동 가치 학습, 오프-정책, ε-탐욕적 정책 사용 | Off / D / D / AV | | **SARSA** | 온-정책, 현재 정책 기반 행동 선택 및 가치 업데이트 | On / D / D / AV | | **DQN** | Q-학습 + 딥러닝, 신경망으로 Q-가치 근사, 연속 상태 공간 효과적 | Off / D / C / AV | | **DDPG** | 연속 행동 공간, 오프-정책 배우-비평가, 결정론적 정책 학습 | Off / C / C / AV | | **A3C** | 비동기 배우-비평가, 이점 사용, 연속 상태 공간 적용 | On / D / C / Adv | | **TRPO** | 신뢰 영역 내 정책 업데이트, 안정적 학습 보장, 연속/이산 행동 공간 가능 | On / C or D / C / Adv | | **PPO** | TRPO 개선, 간단하고 효율적인 정책 업데이트, 연속/이산 행동 공간 가능 | On / C or D / C / Adv | | **TD3** | DDPG 개선, 과대평가 해결(두 Q-함수, 지연 업데이트), 연속 행동 공간 | Off / C / C / AV | | **SAC** | 엔트로피 최대화로 탐험 장려, 오프-정책 배우-비평가, 연속 행동 공간 | Off / C / C / Adv | | **DSAC** | SAC 개선, 행동 가치 분포 학습, 연속 행동 공간 | Off / C / C / AVD | | **Associative Reinforcement Learning** | 자극과 반응 연관 학습, 행동-보상 연결에 초점 | - / - / - / - | - **P (정책)**: On (온-정책), Off (오프-정책), Either (둘 다) - **A (행동 공간)**: D (Discrete, 이산), C (Continuous, 연속), C or D (연속 또는 이산) - **S (상태 공간)**: D (Discrete, 이산), C (Continuous, 연속) - **O (연산자)**: - SM (Sample-means, 표본 평균) - SV (State-value, 상태 가치) - AV (Action-value, 행동 가치) - Adv (Advantage, 이점) - AVD (Action-value distribution, 행동 가치 분포) --- ### 용어 설명 - **Policy (정책)**: - **On-policy (온-정책)**: 현재 따르는 정책을 개선하며 학습합니다. - **Off-policy (오프-정책)**: 다른 정책을 사용해 데이터를 수집하고 학습합니다. - **Either (둘 다)**: 온-정책과 오프-정책 모두 가능합니다. - **Action space (행동 공간)**: 에이전트가 선택할 수 있는 행동의 유형입니다. - **Discrete (이산)**: 고정된 개수의 행동 (예: 위, 아래, 좌, 우). - **Continuous (연속)**: 연속적인 값의 행동 (예: 속도, 각도). - **State space (상태 공간)**: 에이전트가 관찰하는 환경 상태의 유형입니다. - **Discrete (이산)**: 고정된 개수의 상태 (예: 그리드 셀). - **Continuous (연속)**: 연속적인 값의 상태 (예: 좌표). - **Operator (연산자)**: 알고리즘이 사용하는 주요 평가 기준입니다. - **State-value (상태 가치)**: 특정 상태의 가치를 계산. - **Action-value (행동 가치)**: 특정 상태에서 특정 행동의 가치를 계산. - **Advantage (이점)**: 행동 가치와 상태 가치의 차이로, 행동의 상대적 우수성을 나타냄. - **Action-value distribution (행동 가치 분포)**: 행동 가치의 분포를 학습.