OpenAI's Day 12 of 12 days: o3 and o3-mini
OpenAI가 새 모델 "o3"와 "o3-mini" 발표.
o1 및 o1-mini의 후속 모델.
고급 추론 기능 제공.
"O2"와의 상표권 문제를 피하기 위해 "o3"로 명명됨.
o3-mini는 2025년 1월 말, o3는 그 이후 출시 예정.
초기에는 일부 연구자에게만 테스트용으로 제공.
o3 및 o3-mini 테스트를 위한 사전 신청 접수 중.
신청 마감: 2025년 1월 10일.
지원서에 연구 경력, 논문 링크, GitHub 코드 저장소 정보 기재.
모델 활용 계획 명시 필요.
고위험 능력 통제 시연, 안전 평가 강화.
기존 도구로 불가능한 시나리오 테스트 권장.
주요 성능
코딩: SWE-Bench Verified에서 o1 대비 22.8% 향상된 점수 기록. Codeforces 2727점 기록.
수학·과학: AIME 2024에서 96.7% 점수. GPQA Diamond에서 87.7% 기록.
최첨단 벤치마크: EpochAI의 Frontier Math에서 25.2% 문제 해결. ARC-AGI 테스트에서 o1 대비 3배 성능 향상.
모델 정렬 기술
Deliberative Alignment 도입.
인간 작성 안전 정책을 모델에 내재화함.
체인 오브 사고(CoT)를 통해 정책을 동적으로 적용.
기존 RLHF 및 Constitutional AI보다 개선된 방법 제공.
안전성 벤치마크에서 뛰어난 성능, 해로운 출력 감소, 멀티링구얼 환경에서도 안정적.