RL (Reinforcement Learning) 보상을 통해 최적의 행동을 학습하는 강화 학습 용례 "새로운 수준의 역량에 맞는 적절한 정렬, 보안 및 모니터링 표준을 충족하기 위해 일부 최첨단 RL 학습을 중단함." - OpenAI의 위기와 Anthropic의 급성장: AI 시장 주도권의 전환