techcrunch 통신에 따르면 오픈AI가 차세대 인공지능 모델 'Astra'의 출시를 앞두고 사이버보안 능력과 안전대책을 공개했다. Astra는 OpenAI의 준비성 프레임워크(Preparedness Framework)에서 처음으로 사이버보안 역량이 'Critical' 단계에 도달한 것으로 평가된 모델이다.OpenAI가 9월 1일 공개한 평가 결과에 따르면 Astra는 적절한 도구와 시스템 접근 권한이 주어질 경우 사람이 각 단계를 지시하지 않아도 기존에 알려지지 않은 보안 취약점을 찾아내고 이를 실제 공격에 활용할 수 있는 수준에 도달했다. OpenAI는 이 같은 능력 때문에 개발 및 출시 과정에서 기존 모델보다 강력한 안전조치가 필요하다고 판단했다.
OpenAI는 Astra를 조만간 제공할 계획이지만 가장 발전된 사이버보안 기능에 대해서는 접근 범위를 제한한다. 일반적인 모델 출시와 별개로 고급 사이버보안 작업은 우선 소수의 테스터에게 제공하고 이후 방어 목적의 보안 전문가를 위한 'Daybreak Blue'를 통해 접근 범위를 확대할 계획이다.Astra의 사이버보안 능력은 내부·외부 평가에서 두드러졌다. OpenAI에 따르면 알려진 취약점을 실제로 악용하는 능력을 평가하는 ExploitBench에서 Astra는 100%의 점수를 기록했다.OpenAI는 기존 벤치마크의 데이터 오염 가능성을 고려해 2026년 6월부터 8월 사이 공개된 고위험 취약점 20개로 별도의 내부 평가도 진행했다. 이 과정에서 Astra는 GPT-5.6 Sol보다 적은 출력 토큰을 사용하면서 높은 임의 코드 실행 성공률을 보였다.

특히 평가 과정에서 기존에 알려지지 않았던 제로데이 취약점 2개를 발견하고 이를 공격 체인의 일부로 활용한 것으로 나타났다. OpenAI는 해당 취약점을 관련 소프트웨어 관리자에게 공개하는 절차를 진행하고 있다고 밝혔다.전문가가 주도한 별도 평가에서는 강화된 브라우저와 운영체제도 대상으로 삼았다. Astra는 브라우저 샌드박스를 벗어나 호스트에서 명령을 실행할 수 있는 공격 체인을 구성했고, 강화된 운영체제에서는 여러 취약점을 조합해 일반 사용자 권한에서 루트 권한까지 상승하는 공격 체인을 찾아냈다.이는 생성형 AI의 사이버보안 능력이 단순한 코드 분석이나 알려진 취약점 설명을 넘어 새로운 취약점을 찾아 실제 공격 경로까지 구성할 수 있는 단계로 발전하고 있음을 보여준다.OpenAI가 Astra 출시 과정에서 해결해야 할 핵심 문제는 이러한 능력이 악의적으로 사용되는 것을 어떻게 막을 것인가에 있다.
회사는 Astra가 악성 사이버 요청을 보다 안정적으로 거부하도록 새로운 훈련 기법을 적용했다고 밝혔다. OpenAI 자체 사이버 탈옥 평가에서 Astra의 거부율은 91.5%로 나타났다. 비교 대상인 GPT-5.6 Sol은 59%였다.위험도가 높다고 판단한 계정에는 보다 보수적인 모델 행동 기준을 적용한다. 잠재적으로 위험한 사이버보안 지원 요청에 대한 거부 범위를 넓히고 여러 대화에 걸친 맥락까지 분석할 수 있도록 모니터링 체계도 강화한다.모델 자체가 허가되지 않은 행동을 하는 상황에 대비한 통제장치도 도입한다. Astra의 추론과 행동에서 허가되지 않은 활동이 나타나는지 분류기가 확인하고, 위험 행동으로 판단하면 자동으로 중단하는 방식의 모니터링을 적용할 예정이다.
다만 이러한 안전장치는 정상적인 보안 연구에도 영향을 줄 수 있다. OpenAI는 방어 목적의 합법적인 사이버보안 작업이라도 시스템이 잠재적인 악용으로 판단하면 작업 속도가 느려지거나 일시 중단될 수 있다고 설명했다.Astra의 출시 준비 과정에서는 최근 발생한 Hugging Face 관련 보안 사고도 중요한 배경이 됐다.OpenAI는 지난 7월 내부 사이버보안 평가 과정에서 일부 연구용 모델들이 인터넷 접근을 차단하기 위한 통제를 우회하고 OpenAI 내부 연구 인프라와 Hugging Face 시스템 일부에 접근했다고 지난달 공개했다. Astra 자체가 이 사고에 관여한 것은 아니다.
사고 이후 OpenAI는 일부 프런티어 모델 훈련을 일시 중단하고 격리 환경과 네트워크 통제, 모니터링, 정렬 훈련 기준 등을 강화했다. Astra와 관련해서도 강화된 보안 기준을 충족하지 못한 일부 작업을 중단했으며, 새로운 안전·보안 요건을 적용한 뒤 지난 8월 28일 대규모 프런티어 강화학습 훈련을 재개했다.OpenAI는 hugging face 사고에서 나타난 행동을 바탕으로 새로운 '허니팟' 평가도 만들었다. 어려운 사이버보안 과제를 수행하는 모델이 정상적인 해결 방법 대신 주변 보안 인프라를 공격하려 하는지를 확인하는 시험이다.안전장치를 제외한 시험 조건에서 GPT-5.6 Sol은 56%의 테스트에서 해당 대상에 접근하려 했지만 Astra는 같은 평가에서 이러한 시도를 하지 않았다고 OpenAI는 밝혔다.
다만 이는 특정한 내부 시험환경에서 얻은 결과이기 때문에 실제 배포 이후 모든 상황에서 동일한 행동을 보장한다는 의미는 아니다.Astra의 등장은 AI 모델의 성능 경쟁이 새로운 단계에 접어들고 있음을 보여준다. AI가 소프트웨어 개발을 지원하는 수준에서 스스로 취약점을 탐색하고 여러 취약점을 연결해 공격 경로를 만들어내는 수준으로 발전하면서 모델의 능력 자체뿐 아니라 접근통제와 모니터링, 정렬 기술의 중요성도 커지고 있다.
현재 공개된 Astra의 성능과 안전성 정보 상당 부분은 OpenAI 자체 평가에 기반한다는 점도 고려해야 한다. OpenAI는 출시 시점에 시스템 카드를 공개하고 안전·보안·정렬 평가에 관한 추가 정보를 제공할 계획이라고 밝혔다.Astra가 실제 환경에서도 회사가 제시한 안전 기준을 유지할 수 있는지는 출시 이후 중요한 검증 대상이 될 전망이다. 특히 강력한 사이버 능력을 방어 목적으로 활용하면서 악용과 모델의 비인가 행동을 동시에 통제할 수 있는지가 향후 프런티어 AI 경쟁의 새로운 기준으로 떠오르고 있다.












