오픈AI, 차기 모델 ‘아스트라’ 사이버 능력 Critical 수준 가능성...보안 조치 강화
OpenAI 공식 발표 요약
https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/
핵심 요약
OpenAI는 차세대 모델 Astra에 대한 최근 내부 평가 결과, 에이전틱 코딩(agentic coding)과 사이버 보안 능력이 크게 향상되었음을 확인.
전문가 평가와 함께 분석한 결과, Preparedness Framework상 ‘Critical(중대)’ 수준의 사이버 역량을 배제할 수 없다고 판단.
Astra는 아직 출시되지 않은 모델이며, Hugging Face 관련 보안 사고와는 무관하다고 명시.
Critical 사이버 역량의 정의 (Preparedness Framework 기준)
다음 중 하나라도 해당되면 Critical 수준으로 평가됨.
인간 개입 없이 여러 강화된 실제 중요 시스템에서 모든 심각도의 기능적 제로데이(zero-day) 익스플로잇을 식별하고 개발할 수 있는 경우
높은 수준의 목표만 주어졌을 때, 강화된 대상에 대한 새로운 종단간(end-to-end) 사이버 공격 전략을 고안하고 실행할 수 있는 경우
이전 모델들(GPT-5.6-Sol 포함)은 High 수준으로 평가되었으나, Astra는 예비 평가에서 Critical 가능성을 배제하기 어려운 성능을 보여줌.
OpenAI가 취하고 있는 조치
Critical 수준의 역량이 나올 가능성에 대비해 다음과 같은 보안 강화 조치를 시행·계획 중.
보안 통제 강화: 고성능 모델용으로 격리된 테스트 환경, 네트워크·도구 접근 제한, 모델 가중치 보호·암호화 강화, 추가 모니터링·탐지 기능, 샌드박스 실행 환경 도입
Astra 관련 내부 활동 중 강화된 보안 요건을 아직 충족하지 못한 작업은 일시 중단
모든 에이전틱 애플리케이션(학습·평가 포함)에 대해 위험 행동 및 정렬 불일치(misalignment) 모니터링을 전면 적용. 모델의 Chain of Thought를 평가해 고위험 활동 시 보안 대응·개입 실행
관련 정부 기관 및 선별된 AI 안전 기관과 협력해 모델 역량 테스트 진행
고위험 평가를 수행하는 제3자 테스트 파트너에게 권장 보안 통제 지침 제공
이 프레임워크는 이전에 생물학 관련 고위험 역량이 접근했을 때(2025년 6월)도 유사하게 적용된 바 있슴.
OpenAI의 입장
고도의 사이버 역량을 가진 모델은 방어 측이 공격자보다 먼저 취약점을 찾아 대응할 수 있도록 도움을 줘야 한다고 강조. 정부, 안전 연구소, 시민사회와 협력하여 Astra 및 후속 모델의 최전선 역량이 책임감 있게, 인류 전체에 이익이 되도록 배포하겠다는 방침을 밝힘.