새로운 GPT 모델이 출시될 때마다 관심은 늘 비슷했습니다.
“얼마나 더 똑똑해졌을까?”
하지만 2026년 9월 공개된 GPT-6 Astra는 조금 다른 지점에서 주목받고 있습니다.
OpenAI가 Astra를 설명하면서 반복적으로 강조하는 것은 단순한 답변 정확도가 아닙니다. 컴퓨터 사용, 브라우징, 소프트웨어 엔지니어링, 과학, 전문 업무처럼 실제 업무를 처음부터 끝까지 수행하는 능력입니다.
AI 모델의 경쟁 기준이 ‘더 좋은 답변’에서 ‘얼마나 복잡한 일을 끝까지 처리할 수 있는가’로 이동하고 있다는 의미입니다.
GPT-6 Astra는 무엇이 달라졌을까
OpenAI는 GPT-6 Astra를 자사의 가장 지능적이고 정렬 수준이 높은 모델로 소개했습니다.
Astra는 2026년 9월 3일 일부 조직을 대상으로 우선 공개됐으며, ChatGPT Plus, Pro, Business, Enterprise와 OpenAI API, Microsoft Azure, AWS Bedrock 등으로 단계적으로 확대한다고 발표했습니다.
이번 모델에서 특히 강조된 것은 ‘전문 업무’입니다.
Astra는 하나의 질문에 답하는 것에서 끝나지 않고 여러 단계의 작업을 이어서 수행할 수 있도록 설계됐습니다.
예를 들어 자료를 조사한 뒤 내용을 분석하고, 분석 결과를 문서로 정리하고, 이를 다시 프레젠테이션이나 스프레드시트 형태로 만드는 과정까지 하나의 흐름으로 처리하는 방식입니다.
OpenAI는 Astra가 사용자의 기존 템플릿과 문체, 시각적 스타일을 반영해 문서, 프레젠테이션, 스프레드시트, 분석 자료를 만드는 능력을 강화했다고 설명합니다.
'생각하는 AI'에서 '직접 움직이는 AI'로
Astra에서 가장 눈에 띄는 변화 중 하나는 컴퓨터 사용 능력입니다.
OpenAI가 공개한 자체 평가에서 GPT-6 Astra는 실제 소프트웨어를 활용하는 전문 업무 평가인 Agents' Last Exam에서 59.3%를 기록했습니다. 이전 주력 모델 GPT-5.6 Sol은 53.6%였습니다.
전문 업무 자동화를 평가하는 AutomationBench에서는 Astra가 41.4%, GPT-5.6 Sol이 18.1%를 기록했고, 컴퓨터 환경에서 작업 수행 능력을 평가하는 OSWorld 2.0에서도 Astra가 72.6%, Sol이 65.7%를 기록했습니다.
코딩과 터미널 기반 업무에서도 격차가 나타났습니다.
Terminal-Bench 4.0에서 Astra는 57.9%를 기록해 GPT-5.6 Sol의 37.3%를 크게 웃돌았습니다.
다만 이러한 수치는 OpenAI가 자체 연구 환경 또는 API를 통해 진행한 평가 결과입니다. 실제 ChatGPT 환경에서는 시스템 프롬프트와 사용할 수 있는 도구 등이 다르기 때문에 동일한 결과를 보장하는 것은 아닙니다. OpenAI 역시 공식 발표에서 이러한 차이를 명시하고 있습니다.
중요한 것은 숫자 하나보다 방향입니다.
AI가 문장을 잘 생성하는 수준에서 벗어나 실제 프로그램과 브라우저를 이용하면서 여러 단계의 업무를 이어가는 능력이 크게 강화됐다는 점입니다.
긴 자료를 다루는 능력도 크게 확대됐다
GPT-6 Astra의 API 사양을 보면 이러한 방향성이 더 명확하게 나타납니다.
Astra는 최대 105만 토큰의 컨텍스트 윈도와 12만8천 토큰의 최대 출력 길이를 지원합니다.
긴 컨텍스트에서 필요한 정보를 찾아내는 OpenAI MRCR 평가에서도 51만2천~100만 토큰 구간에서 Astra는 96.3%를 기록했고 GPT-5.6 Sol은 73.8%를 기록했습니다.
실무에서는 이 차이가 단순히 “더 긴 글을 읽는다”는 의미에 그치지 않을 수 있습니다.
수십 개의 파일, 긴 보고서, 브랜드 가이드, 과거 캠페인 자료처럼 서로 다른 맥락을 함께 제공한 뒤 하나의 결과물을 만드는 업무에 AI를 활용할 여지가 커지고 있기 때문입니다.
기업용 AI 경쟁도 더 빨라지고 있다
Astra 공개 직후 OpenAI가 보여준 움직임도 흥미롭습니다.
법률 AI 기업 Legora는 Astra를 활용한 재무제표 검토 작업에서 41개 문서를 한 번의 에이전트 실행으로 검토했고, 자사 평가 기준에서 기존 대비 40% 개선된 결과를 기록했다고 밝혔습니다.
게임 개발사 Playco 역시 Astra를 이용한 프로토타이핑 과정에서 이전 모델 대비 수동 수정 작업을 50% 줄였다고 OpenAI가 공개했습니다.
아직 OpenAI가 공개한 고객 사례라는 점은 감안해야 하지만, Astra가 지향하는 시장이 일반적인 질의응답보다 법률, 금융, 개발, 데이터 분석 같은 전문 업무에 가깝다는 점은 분명합니다.
강력해진 만큼 안전 문제도 함께 커졌다
GPT-6 Astra를 이야기할 때 성능만 볼 수 없는 이유도 있습니다.
OpenAI는 Astra가 자사의 Preparedness Framework에서 사이버 보안 능력 ‘Critical’ 수준에 도달한 첫 모델이라고 밝혔습니다.
적절한 도구와 권한이 주어질 경우 사람이 각 단계를 지시하지 않아도 보안이 강화된 시스템에서 알려지지 않은 취약점을 찾아내거나 새로운 공격 방법을 개발할 정도의 역량을 갖췄다는 의미입니다.
이에 따라 OpenAI는 Astra 출시와 함께 사이버 오용 방지와 에이전트 행동 모니터링을 강화했다고 설명합니다.
정렬 관련 평가에서도 개선이 나타났습니다.
OpenAI 내부 환각 벤치마크에서는 낮을수록 좋은 오류율이 GPT-5.6 Sol 12.2%에서 Astra 4.2%로 낮아졌습니다. 하지만 시스템 카드에서도 특정 평가에서 문제가 관찰되지 않았다는 사실이 모든 환경에서의 신뢰성을 증명하는 것은 아니라고 한계를 명시하고 있습니다.
성능이 강력해질수록 AI에게 더 많은 권한을 줄 수 있게 되고, 그만큼 AI가 어디까지 행동하도록 허용할지에 대한 관리도 중요해지는 셈입니다.
마케터가 GPT-6 Astra를 봐야 하는 이유
마케팅 관점에서는 벤치마크 숫자보다 한 가지 변화가 더 중요해 보입니다.
지금까지 마케터가 AI를 사용하는 방식은 대부분 ‘작업 단위’였습니다.
광고 카피를 작성해줘, 경쟁사를 분석해줘, 보고서를 요약해줘처럼 하나의 작업을 요청하고 결과물을 다시 사람이 연결하는 방식이었습니다.
Astra가 지향하는 방향은 그보다 한 단계 더 나아갑니다.
OpenAI는 마케팅 활용 사례로 하나의 브리프를 기반으로 메시지를 개발하고 여러 채널에 사용할 일관된 브랜드 자산까지 제작하는 업무를 직접 예시로 들고 있습니다.
즉 앞으로는 “이 광고 카피를 써줘”보다 “이번 캠페인의 자료를 분석하고 핵심 타깃을 정리한 뒤 메시지 전략을 만들고, 채널별 콘텐츠와 보고 자료까지 완성해줘”처럼 업무 전체를 AI에게 맡기는 방식이 더 자연스러워질 수 있습니다.
태그바이가 보는 인사이트
GPT-6 Astra의 가장 큰 변화는 AI가 더 똑똑해졌다는 사실 자체가 아닐지도 모릅니다.
AI를 사용하는 단위가 바뀌고 있다는 점이 더 중요합니다.
과거에는 사람이 업무 프로세스를 만들고 그 안의 일부 작업을 AI에게 맡겼다면, 앞으로는 사람이 목표와 기준을 정의하고 AI가 업무 프로세스 자체를 수행하는 비중이 커질 수 있습니다.
그렇게 되면 마케터에게 중요한 능력 역시 달라집니다.
좋은 프롬프트를 쓰는 능력보다 무엇을 맡길 것인가, 어떤 기준으로 결과를 판단할 것인가, 어디에서 사람이 개입해야 하는가를 설계하는 능력이 더 중요해질 수 있습니다.
GPT-6 Astra는 AI가 답변을 만드는 도구에서 실제 업무를 수행하는 동료에 가까워지고 있다는 흐름을 보여주는 모델입니다. AI 경쟁의 다음 단계는 결국 ‘누가 가장 똑똑한가’보다 누가 실제 일을 가장 잘 끝내는가의 경쟁이 될 가능성이 높아 보입니다.
