본문 바로가기
정보글/AI 동향

[AI] GPT-6 Astra 실사용 사례 - Perplexity·Cognition이 테스트 자동화에 쓰는 법 by 스둥

by 스페둥 2026. 9. 14.

 

OpenAI가 GPT-6 Astra 도입 사례를 연달아 공개했다. Perplexity와 Cognition(Devin 개발사) 두 곳인데, 공통점이 하나 있다. 둘 다 "코드를 짜는 일"보다 "짠 코드가 제대로 도는지 검증하는 일" 에 Astra를 쓰고 있다는 점이다.

 

GPT-6 Astra는 기존 코딩 AI와 뭐가 다를까?

GPT-6 Astra의 차이는 코드를 짜는 능력보다 자기가 짠 코드가 실제로 동작하는지 스스로 테스트하고 그 증거를 내놓는 능력에 있다. OpenAI가 공개한 두 사례 모두 생성이 아니라 검증 쪽에 무게가 실려 있다.

여기서 코딩 에이전트란 사람이 지시한 작업을 스스로 코드로 옮기고 실행까지 해보는 AI 프로그램을 말한다. 기존 세대는 코드를 뱉어내는 데까지는 잘했지만, 그게 진짜 도는지는 사람이 확인해야 했다.

Perplexity의 Astra 활용 방법 - mock 응답 자동 생성

Perplexity는 Astra에게 엔드투엔드 테스트를 통째로 맡기고 확인 빈도를 줄였다.

Perplexity가 Astra를 쓰는 용도는 세 가지다.

  • 커뮤니케이션 문서 작성
  • 소프트웨어 변경
  • 프로덕션 시스템 모니터링

이 중 공동창업자 Johnny Ho가 특히 값어치 있다고 꼽은 건 코드 테스트다. 외부 서비스(예: LLM API)를 흉내 내는 그럴듯한 mock 응답을 Astra가 직접 만들어낸다. mock 응답이란 실제 외부 서비스를 호출하지 않고 그 대신 돌려주는 가짜 응답 데이터다. 이게 자동으로 만들어지니 사람이 손대지 않고도 워크플로 전체를 검증할 수 있다.

"이전 세대 모델들과 달리 전체 엔드투엔드 시스템을 맡기고 신뢰할 수 있게 됐고, 훨씬 덜 자주 들여다봐도 된다." — Johnny Ho, Perplexity 공동창업자

모델이 코드를 잘 짤수록 웹 검색이나 내부 데이터 조회 프로그램이 좋아지고, 그게 곧 검색 결과 요약 품질로 이어진다. 제품 개선이 모델 성능에 직결되는 구조다.

Cognition Devin의 테스트 증명 방식

Cognition은 Devin이 작업 결과를 스크린샷과 녹화 영상으로 증명하게 만들었다. 클라우드 에이전트, CLI, 데스크톱 제품 전반에 Astra를 적용했다.

사례 하나. Devin에게 Otter Run이라는 아이폰 게임을 테스트시켰더니, 시뮬레이터 녹화 영상과 함께 어떤 항목이 통과했고 어떤 부분은 테스트되지 않았는지까지 정리한 리포트를 돌려줬다. 엔지니어가 코드를 직접 뜯어보지 않고도 동작을 확인할 수 있는 형태다.

고객 지원 쪽도 비슷하다. 고객이 스크린샷으로 버그를 제보하면 그 요청을 Devin에게 넘기고, Devin이 수정한 뒤 고쳐진 화면 스크린샷을 첨부해서 돌려준다.

"Astra는 자기 작업을 테스트하고, 그게 기대한 대로 동작한다는 걸 증명하는 능력이 나아졌다." — Walden Yan, Cognition 공동창업자

목표는 코드 리뷰 부담을 줄이는 것. 시간이 갈수록 리뷰는 덜 하고 배포는 더 많이 하게 될 거라는 게 Yan의 예상이다.

개발자가 지금 바로 써먹는 법

1. mock 자동 생성 외부 API를 붙인 기능을 테스트할 때 mock 응답 만드는 게 제일 귀찮은데, 이걸 통째로 맡기는 것. 실제 호출 비용 없이 엔드투엔드 흐름을 돌릴 수 있다.

2. 결과를 증거로 받기 "수정했습니다" 대신 스크린샷이나 실행 녹화를 같이 요구하는 방식. 에이전트가 고쳤다고 주장만 하고 실제로는 안 고쳐놓은 상황을 걸러낼 수 있다.

3. 테스트 커버리지 리포트 Devin 사례처럼 "무엇이 테스트되지 않았는지"를 같이 받는 것. 통과 목록보다 이쪽이 더 쓸모 있을 때가 많다.

한계와 주의점

두 글 모두 OpenAI가 자사 모델 도입 사례로 직접 낸 케이스 스터디다. 회사 측 인용과 정성적 평가 위주고, 벤치마크 점수나 리뷰 시간 절감률 같은 정량 지표는 공개되지 않았다. "얼마나 좋아졌나"를 숫자로 확인할 수는 없다는 뜻이다.

그래도 방향성은 참고할 만하다. 코드를 짜주는 AI는 이미 흔해졌고, 경쟁은 자기가 짠 걸 스스로 검증해서 보여줄 수 있느냐로 넘어가는 중이다. 

한 줄 요약: OpenAI가 공개한 GPT-6 Astra 도입 사례에서 Perplexity는 mock 응답 자동 생성으로 엔드투엔드 테스트를 맡겼고, Cognition의 Devin은 수정 결과를 녹화와 스크린샷으로 증명한다.


출처 - Perplexity trusts GPT-6 Astra with end-to-end systems — OpenAI, 2026년 9월 14일 - Cognition helps Devin test its own work with GPT-6 Astra — OpenAI, 2026년 9월 11일

댓글