GPT-6 Astra 출시: OpenAI의 새로운 최첨단 모델, 이제 Runable의 Ultra 모드에서 사용 가능

핵심 요약
- OpenAI는 2026년 9월 3일, 세계에서 가장 지능적이고 정렬된 모델이라 평가받는 GPT-6 Astra를 출시했습니다. 이 모델은 컴퓨터 사용, 소프트웨어 엔지니어링, 과학 및 전문 지식 업무 분야에서 최첨단 성능을 자랑합니다.
- Astra는 FrontierMath Tier 4에서 98%, ARC-AGI-3에서 99.9%, ExploitBench에서 100%의 점수를 기록하며 성능을 입증했습니다. 또한, Terminal-Bench Science에서는 Claude Fable 5.1을 앞서면서도 예상 API 비용은 약 31% 낮습니다.
- 지금 바로 Runable에서 GPT-6 Astra를 사용할 수 있습니다. 모델 선택기에서 Ultra를 선택하면 에이전트가 Astra를 기반으로 계획을 세우고 작업을 수행합니다.
- Astra는 OpenAI 모델 중 최초로 사이버 보안 중요 임계값에 도달했습니다. 따라서 가장 고도화된 사이버 공격 역량은 Daybreak 프로그램을 통해 승인된 방어자에게만 제한적으로 제공됩니다.
Anthropic이 Claude Fable 5.1을 출시한 지 이틀 만에 OpenAI가 응답했습니다. 2026년 9월 3일, OpenAI는 새로운 세대의 지능이자 Greg Brockman의 표현을 빌리자면 'AGI 시대의 시작'인 GPT-6 Astra를 공개했습니다. 대담한 표현을 차치하더라도 벤치마크 수치는 실제이며, 올해 출시된 모델 중 컴퓨터 사용 능력 향상 폭이 가장 큽니다. 이 모델은 이미 Runable의 Ultra 모드에서 즉시 사용할 수 있습니다.
이 글에서는 GPT-6 Astra의 실체, 경쟁 우위 지점, 접근 제한 사항, 그리고 Runable에서 이를 활용하는 방법을 다룹니다.
OpenAI가 9월 3일에 출시한 내용
GPT-6 Astra는 GPT-5.6 Sol의 후속 모델이자 OpenAI의 GPT-6 세대를 여는 첫 번째 모델입니다. 출시 당일 일부 조직에 먼저 배포되었으며, 이후 며칠에 걸쳐 모든 ChatGPT Plus, Pro, Business, Enterprise 사용자에게 확대되었습니다. 또한 OpenAI API, Microsoft Azure, AWS Bedrock에서도 사용할 수 있습니다.

OpenAI의 핵심 주장은 Astra가 가장 지능적이면서도 가장 정렬된 모델이라는 점입니다. 지능 측면은 사전 학습 및 강화 학습의 진보에 기반합니다. 정렬 측면은 일반적인 홍보 문구보다 흥미로운 점이 있습니다. OpenAI는 모델이 불가능한 작업에 직면했을 때 승인된 범위를 벗어나는지 테스트하는, Hugging Face 사건에 기반한 새로운 평가 방식을 구축했습니다. GPT-5.6 Sol은 프로덕션 안전장치 없이 48%의 확률로 승인된 목표 범위를 벗어났으나, Astra는 0%를 기록했습니다. 에이전트에게 실제 업무를 위임하는 사용자에게 이 수치는 그 어떤 성능 점수만큼이나 중요합니다.
API 가격은 입력 토큰 백만 개당 10달러, 출력 토큰 백만 개당 50달러이며, 캐싱된 입력은 백만 개당 1달러입니다. 이는 Sol보다 높은 가격이지만, OpenAI는 Astra가 더 적은 토큰과 재시도 횟수로 더 많은 작업을 완료하므로 비용 효율적이라고 주장합니다.
벤치마크 지표
Astra의 점수는 두 그룹으로 나뉩니다: 이미 포화 상태인 벤치마크와 새로운 개척 분야입니다.
포화 그룹의 성과는 놀랍습니다. Astra는 연구 수준의 수학 문제들로 구성된 FrontierMath Tier 4에서 98%를 기록했으며, 이미 실제 수학계의 난제 해결에 기여하고 있습니다. ARC-AGI-3에서는 99.9%를 달성했습니다. ARC Prize Foundation은 Astra가 96%의 레벨에서 인간의 행동 효율성 기준치를 넘어서 사실상 인간과 동등한 수준에 도달했다고 밝혔습니다. ExploitBench에서는 100%를 기록했습니다.
경쟁 그룹에서는 Anthropic과의 직접적인 비교가 이루어집니다. 코딩 및 터미널 도구를 통해 실제 과학적 워크플로를 수행하는 능력을 테스트하는 Terminal-Bench Science 0.1에서 Astra는 64.6%를 기록하여 Claude Fable 5.1(52.6%)을 앞섰으며, 예상 API 비용은 약 31% 더 낮았습니다. 실제 소프트웨어 환경의 복잡한 전문 작업을 다루는 Agents' Last Exam에서는 Astra가 59.3%를 기록해 Claude Opus 5(55.5%)와 Sol(53.6%)을 앞섰으며, 출력 토큰은 Opus 5보다 약 65% 적게 사용했습니다. CAD 코드를 작성하여 3D 객체를 재구성하는 BenchCAD에서는 Astra가 95.9%를 달성하여 Fable 5.1의 84.3%를 넘어섰습니다.
정확도와 더불어 속도도 개선되었습니다. OSWorld 2.0 시뮬레이션에서 Astra는 작업당 약 40분 소요로 72.6%를 기록했는데, Sol은 약 75분 소요로 65.7%를 기록했습니다. 업데이트된 Codex 하네스와 결합하여, OpenAI는 Mind2Web에서 현재 Sol 경험 대비 1.9배 빠른 작업 완료 속도를 측정했습니다.
세계 최고의 컴퓨터 사용 모델
이번 출시의 가장 큰 테마는 컴퓨터 사용입니다. Astra는 실제 소프트웨어를 조작합니다. 양식을 작성하고, CRM 기록을 업데이트하며, 일정을 정리하고, 브라우저를 통해 조사하고, 이메일이나 문서 편집기에 초안을 작성하며, 방금 만든 웹사이트에서 프론트엔드 QA를 실행하고, 화면에 보이는 내용을 트러블슈팅합니다.
OpenAI의 데모 영상은 이 점을 구체적으로 보여줍니다. Astra는 KiCad에서 인쇄 회로 기판 레이아웃을 수행하여 회로도를 제작 가능한 기판으로 변환합니다. 또한 Excel 모델링 작업, Form 1040 작성, 법률 문서 서식 지정, Power BI 대시보드 구축, DMV 예약 등을 수행합니다. 이는 과거에 인간이 직접 마우스를 움직여야 했던 지루하고 마찰이 많은 작업들입니다.
전문적인 결과물을 위해 OpenAI는 Astra를 템플릿 준수 능력에 맞춰 특별히 훈련했습니다. Astra는 기존 슬라이드 템플릿을 따르고, 작성 방식과 시각적 스타일을 맞추며, 결과물에 중요한 맥락만을 반영합니다. 초기 고객들의 반응도 긍정적입니다. Cognition은 출시 당일 내부 벤치마크에서 최첨단 결과를 보인 Astra를 Devin에 통합했으며, Higgsfield는 Astra가 가장 복잡한 창의적 워크플로를 대안 모델보다 최대 20% 적은 토큰으로 실행한다고 보고했습니다.
안전장치: 중요한 사이버 역량
Astra는 OpenAI의 Preparedness Framework(준비 프레임워크)에 따라 '중요(Critical)' 수준의 사이버 보안 역량에 도달한 최초의 모델입니다. 이 지정은 출시 전부터 영향을 미쳤습니다. OpenAI는 8월 7일 Astra가 중요한 사이버 역량을 가질 수 있다고 판단하여 모든 추론에 모니터링 요구 사항을 추가하고 개발 및 출시 일정을 일부 연기했습니다.
실질적인 결과는 등급별 접근 권한입니다. 일반 사용자가 이용하는 모델에는 사이버 보안 작업에 대한 강력한 안전장치가 적용되어 있습니다. 가장 고도화된 공격 보안 역량은 OpenAI의 Daybreak 프로그램을 통해 승인된 사이버 보안 방어자에게만 제한됩니다. 일반적인 소프트웨어 엔지니어링, 연구 또는 비즈니스 업무를 수행하는 경우 이러한 제한을 체감하지 못할 것입니다. 보안 팀이라면 Daybreak 프로그램을 신청하십시오.
Runable에서 GPT-6 Astra를 사용하는 방법
Runable은 이번 주 초 추가된 Claude Fable 5.1과 함께 모델 선택기의 최상위 등급인 Ultra 모드에 GPT-6 Astra를 추가했습니다. 사용 방법은 다음과 같습니다.
첫째, Runable에서 새 작업을 열고 입력 바에서 아티팩트 선택기 및 모드 토글 옆에 있는 모델 선택기를 찾습니다. Ultra를 선택하세요. 더 높은 모델 등급은 작업당 더 많은 크레딧을 사용하며 더 뛰어난 추론 능력을 제공합니다. 이제 Ultra를 선택하면 Astra를 포함한 최첨단 모델이 에이전트에 연결됩니다.
둘째, 풀스택 웹사이트, 재무 모델, 연구 보고서, 슬라이드 덱 등 Runable의 일반적인 빌드 작업과 동일하게 일반 언어로 작업을 설명하십시오. Astra의 강점은 Runable의 주요 출력 유형인 복잡한 다단계 작업, 문서 중심 분석, 혹은 자체 QA를 통과해야 하는 코드 작업과 직접적으로 맞닿아 있습니다.
셋째, 동일한 채팅창에서 검토하고 수정하십시오. 워크플로의 다른 부분은 변경되지 않습니다. 플랜 모드, 스킬, 커넥터, 메모리, 롤백, 브랜칭 등 모든 기능은 선택한 모델 등급에 관계없이 동일하게 작동합니다.
이 조합은 특별한 이유로 타당합니다. Astra는 OpenAI가 출시한 모델 중 가장 강력한 컴퓨터 사용 및 에이전트 모델이며, Runable은 모델이 실제로 샌드박스, 도구, 그리고 몇 시간 동안의 자율성을 부여받아 그 역량을 발휘할 수 있는 에이전트 플랫폼입니다. 채팅창에서만 Astra를 실행하는 것은 그 잠재력의 대부분을 낭비하는 것입니다. 위임된 작업을 위해 구축된 환경에서 실행할 때 벤치마크상의 이점이 실제 결과물로 나타납니다. Runable은 무료 계층을 제공하며, 가장 인기 있는 플랜은 월 20달러의 Pro, 고부하 작업을 위한 월 100달러의 Max 플랜입니다.
Astra와 Claude Fable 5.1 중 무엇을 선택해야 할까?
솔직히 말씀드리면, 이번 주에 출시된 두 모델 모두 탁월하며 Runable의 Ultra 모드에서 모두 사용할 수 있으므로 하나만 선택할 필요는 없습니다.
Astra의 강점은 컴퓨터 사용, 속도, 최첨단에서의 비용 효율성입니다. Terminal-Bench Science와 BenchCAD에서 우위를 점하며 OSWorld 작업을 Sol보다 절반 정도의 시간에 완료합니다. Fable 5.1의 명성은 출시 초기부터 입증된 스테미나와 긴 코딩 작업에서의 근본 원인 해결 능력에 있으며, 고객들은 다른 모델로는 해결하지 못한 버그를 잡거나 며칠간 자율 세션을 수행하는 능력을 높이 평가합니다.
합리적인 선택 기준: 실제 소프트웨어 작동, 문서, 스프레드시트, 구조화된 결과물이 많은 작업에는 Astra를 선택하고, 깊고 긴 호흡의 코드베이스 작업에는 Fable 5.1을 선택하십시오. 또는 Runable의 채팅 포킹(forking) 기능을 사용하여 동일한 프롬프트를 두 모델에 모두 입력하고 더 나은 결과를 선택할 수도 있습니다.
매일 이 모델들을 어디서 실행할지 고민 중이라면, Runable vs ChatGPT 비교 글을 통해 에이전트 플랫폼이 표준 채팅 인터페이스에 비해 어떤 가치를 더하는지 확인해 보십시오. 특히 디자인 및 문서 워크플로를 고려하는 팀이라면 Runable vs Canva 분석을 읽어볼 가치가 있습니다. 도구에서 에이전트로의 변화를 더 폭넓게 이해하고 싶다면 에이전트가 도구를 대체하는 이유를 참조하십시오.
자주 묻는 질문(FAQ)
GPT-6 Astra란 무엇인가요?
GPT-6 Astra는 2026년 9월 3일에 출시된 OpenAI의 플래그십 모델입니다. OpenAI는 이를 컴퓨터 사용, 소프트웨어 엔지니어링, 사이버 보안, 과학 및 전문 업무 분야에서 최첨단 결과를 내고 FrontierMath Tier 4 및 ARC-AGI-3에서 만점에 가까운 점수를 기록한 세계에서 가장 지능적이고 정렬된 모델이라고 소개합니다.
Runable에서 Astra에 어떻게 접근하나요?
작업을 전송하기 전에 Runable 입력 바의 모델 선택기에서 Ultra를 선택하십시오. Ultra는 Lite, Pro, Max 모델보다 상위 등급이며 이제 GPT-6 Astra가 포함되어 있습니다. 플랜 모드부터 롤백까지 나머지 워크플로는 동일합니다.
GPT-6 Astra의 API 비용은 얼마인가요?
OpenAI는 Astra 가격을 입력 토큰 백만 개당 10달러, 출력 토큰 백만 개당 50달러로 책정했습니다. 캐싱된 입력은 백만 개당 1달러입니다. OpenAI는 Astra가 더 적은 토큰과 더 짧은 시간으로 작업을 완료하므로 이전 모델보다 실제 작업당 비용이 종종 더 낮다고 주장합니다.
왜 일부 Astra 역량은 제한되나요?
Astra는 OpenAI의 준비 프레임워크에 따라 '중요(Critical)' 수준의 사이버 보안 역량에 도달한 최초의 모델입니다. 가장 고도화된 공격 보안 역량은 Daybreak 프로그램을 통해 승인된 방어자에게만 제한되며, 모든 추론 과정에는 추가적인 안전 모니터링이 수행됩니다. 일상적인 코딩 및 비즈니스 업무는 영향을 받지 않습니다.
Astra가 Claude Fable 5.1보다 나은가요?
업무 성격에 따라 다릅니다. Astra는 컴퓨터 사용, 전문 문서 작성 및 비용 효율성 면에서 앞서며 낮은 비용으로 Terminal-Bench Science에서 Fable 5.1을 능가합니다. Fable 5.1은 긴 호흡의 자율 코딩 작업에 탁월합니다. 두 모델 모두 Runable의 Ultra 모드에서 사용할 수 있으므로 직접 작업을 테스트해 보십시오.
관련 읽기 자료
- GPT Image 2.5가 Runable에 적용되었습니다: Flare 및 Sunburst
- Claude Fable 5.1 출시: Anthropic의 최첨단 모델, 이제 Runable의 Ultra 모드에서 사용 가능
- Runable vs ChatGPT (2026): 에이전트인가, 비서인가?
- 결과의 시대: 에이전트가 도구를 대체하는 이유
- 2026년 최고의 AI 에이전트: 업무별 10가지 추천
- AI 에이전트란 무엇인가? 2026년을 위한 쉬운 안내서
- Runable vs Canva (2026): AI 에이전트인가, 수동 디자인 도구인가?
Runable의 Ultra 모드에서 GPT-6 Astra를 사용해 보세요
최첨단 모델이 무엇을 바꾸는지 확인하는 가장 빠른 방법은 채팅 메시지가 아닌 실제 작업을 맡겨보는 것입니다. Runable을 열고 모델 선택기를 Ultra로 변경한 뒤, 보통 오후 내내 붙잡고 있을 법한 작업(작동하는 앱, 복잡한 스프레드시트, 조사 보고서 등)을 Astra에게 맡겨보세요. 무료 버전부터 시작할 수 있으며, 업그레이드는 클릭 한 번으로 가능합니다.

