
GPT-6.1 Sol, 일주일 만에 또 출시? GPT-6 Sol과 성능·가격·실사용 반응 비교
GPT-6 Sol이 나온 지 얼마 되지 않았는데 벌써 GPT-6.1 Sol이 등장했습니다.
GPT-6 Sol은 9월 22일, GPT-6.1 Sol은 9월 29일 출시됐습니다. 일주일 간격입니다. 모델 이름을 겨우 익혔는데 다시 비교해야 하는 상황이 됐습니다.
개발하는 입장에서 궁금한 건 비슷합니다.
“코드를 더 잘 짜는 걸까?”
“토큰을 덜 쓰는 걸까?”
“지금 쓰는 6 Sol에서 바꿀 이유가 있을까?”
이번에는 공식 문서와 출시 직후 올라온 사용자 반응을 함께 살펴봤습니다. 직접 장기간 사용한 비교 후기는 아니며, 2026년 9월 30일까지 확인한 자료를 기준으로 정리했습니다.
가격표보다 먼저 볼 것은 작업을 끝내는 능력입니다.
OpenAI는 GPT-6.1 Sol을 복잡한 코딩과 업무에서 Astra에 가까운 성능을 제공하는 모델로 소개합니다. 기본 입력·출력 가격은 기존 6 Sol과 같습니다.
제 관심은 단순히 코드가 얼마나 빨리 나오는지보다는, 수정 요청을 얼마나 덜 하게 되는지에 있습니다.
예를 들어 서비스 로직 하나를 바꾸더라도 DTO, 조회 쿼리, 예외 처리, 테스트까지 함께 확인해야 하는 경우가 많습니다. 처음 나온 코드가 그럴듯해도 기존 조건을 빠뜨리면 결국 사람이 다시 설명해야 합니다.
그래서 이번 모델도 긴 답변을 잘 만드는지보다, 여러 단계를 거쳐 실제로 쓸 수 있는 결과를 만드는지에 초점을 맞춰 보는 편이 좋겠습니다.
기본 사양은 생각보다 많이 바뀌지 않았습니다.
| 항목 | GPT-6 Sol | GPT-6.1 Sol |
| 일반 입력 가격 | $2 | $2 |
| 캐시 입력 가격 | $0.20 | $0.10 |
| 출력 가격 | $10 | $10 |
| 컨텍스트 크기 | 105만 토큰 | 105만 토큰 |
| 최대 출력 | 12만 8천 토큰 | 12만 8천 토큰 |
| 지식 기준일 | 2026년 4월 20일 | 2026년 4월 30일 |
| API 기본 추론 수준 | Medium | Medium |
가격은 100만 토큰당 금액이며, Standard 처리와 입력 272K 이하 구간 기준입니다. 긴 입력이나 다른 속도 모드에는 별도 요율이 적용됩니다.
컨텍스트가 더 커졌거나 최대 출력량이 늘어난 업데이트는 아닙니다. 같은 처리 용량과 기본 단가에서 결과의 품질과 효율을 개선한 쪽에 가깝습니다.
공식 평가에서는 어느 정도 차이가 났을까?
OpenAI가 공개한 비교에서 눈에 들어오는 결과만 추렸습니다.
| 평가 | GPT-6 Sol 대비 변화 | 비교 조건 |
| DeepSWE v1.1 · 소프트웨어 개발 | 최고 점수보다 6.4%p 높음 | 6.1 Sol이 더 낮은 추론 수준·비용에서 달성 |
| AutomationBench · 업무 자동화 | 4.8%p 높음 | 두 모델 모두 Medium |
| OSWorld 2.0 · 컴퓨터 사용 | 7%p 높음 | 두 모델 모두 최대 추론 수준, offline 평가 |
| Terminal-Bench Science · 과학 작업 | 점수가 2배 이상 | 두 모델 모두 최대 추론 수준 |
| 어려운 질문의 사실 오류 | 11.4% → 7.7% | Low 추론, 오류를 유발하기 쉬운 질문 모음 |
모두 OpenAI가 발표한 평가 결과입니다. 마지막 수치는 일반 질문 전체의 오류율이 아니며, 과학 평가 점수가 2배라고 해서 모든 작업의 성능이 2배라는 뜻도 아닙니다.
여기서 주목한 부분은 코딩 평가입니다. 기존 모델의 최고 점수를 더 낮은 추론 수준에서 넘어섰다는 설명은, 매번 Max까지 올리지 않고도 좋은 결과를 얻을 가능성을 보여줍니다.
물론 벤치마크에 쓰인 프로젝트와 내 프로젝트는 다릅니다. 기존 코드의 복잡도, 지침, 테스트 환경에 따라 체감 차이가 달라질 수 있습니다.
GitHub의 초기 테스트에서도 토큰 효율에 대한 설명이 나왔습니다.
GitHub는 Copilot에 GPT-6.1 Sol을 도입하면서, 초기 테스트에서 이전 GPT-6·GPT-5.6 계열보다 눈에 띄게 적은 토큰과 단계로 작업을 안정적으로 완료했다고 밝혔습니다.
다만 정확히 몇 % 절약됐는지, 어떤 작업을 얼마나 비교했는지까지 공개한 설명은 아닙니다. 이를 모든 개발 작업에 적용되는 절감률로 받아들이기는 어렵습니다.
그래도 개발자에게는 관심을 가질 만한 내용입니다. 불필요하게 파일을 다시 읽거나 같은 시도를 반복하는 일이 줄어든다면, 사용량과 기다리는 시간을 함께 줄일 수 있기 때문입니다.
캐시 가격이 절반이면 전체 비용도 절반일까?
이 부분은 구분해야 합니다.
6.1 Sol에서 절반으로 내려간 것은 캐시된 입력을 읽는 단가입니다. 일반 입력과 출력 가격은 그대로입니다.
같은 내용을 다시 보낸다고 모두 캐시 할인을 받는 것은 아니고, 실제로 캐시 입력으로 처리된 토큰에 해당 가격이 적용됩니다.
간단한 계산으로 보면 이해하기 쉽습니다. 짧은 컨텍스트의 Standard 요청 여러 건을 합쳐 다음과 같이 사용했다고 가정해보겠습니다.
| 사용량 | GPT-6 Sol | GPT-6.1 Sol |
| 일반 입력 100만 토큰 | $2 | $2 |
| 캐시 입력 1,000만 토큰 | $2 | $1 |
| 출력 100만 토큰 | $10 | $10 |
| 합계 | $14 | $13 |
캐시 쓰기와 도구 비용을 제외한 계산 예시입니다.
이 경우 전체 비용은 약 7.1% 줄어듭니다. 캐시 단가가 50% 내려가도 총비용이 50% 줄어드는 것은 아닙니다.
실제 비용은 여기에 모델이 사용한 토큰 수까지 영향을 받습니다. 같은 일을 더 적은 단계로 끝내면 추가로 줄어들 수 있고, 더 오래 추론하거나 재시도가 늘면 반대가 될 수도 있습니다.

실제로 써본 사람들의 반응은 어땠을까?
출시 직후라 충분히 검증된 장기 후기는 아직 찾기 어려웠습니다. 확인한 글에는 직접 사용한 경험, 발표 자료를 보고 남긴 기대, 기존 모델에 대한 불만이 섞여 있었습니다.
그래서 이 셋을 같은 무게로 보지는 않았습니다.
사용량이 여유로웠다는 경험담은 있었습니다.
Reddit의 Munkie50이라는 사용자는 월 100달러 Pro 요금제에서 Ultra로 거의 한 시간짜리 작업을 실행했는데, 주간 사용량이 약 2% 줄었다고 적었습니다. 작성자도 추가 테스트가 필요하다고 덧붙였습니다.
긍정적인 사례이지만, 이 수치로 “한 시간 작업에 항상 2%만 쓴다”고 계산할 수는 없습니다. 작업 내용과 읽은 코드의 양이 공개된 통제 실험이 아니기 때문입니다.
저는 이런 후기를 볼 때 사용량 숫자 하나보다, 실제로 어떤 작업을 끝냈는지까지 함께 보고 싶습니다. 같은 한 시간이라도 단순 정리와 여러 모듈을 수정하는 작업은 다를 테니까요.
성능에 대한 반응은 한쪽으로 모이지 않았습니다.
출시 토론에서는 Bettet이라는 사용자가 가격을 고려하면 좋은 모델이라고 평가하면서도 Opus 5.5를 더 높게 봤습니다. Tiny-Design4701은 자신의 실무 작업에서는 Sonnet 5.5 Medium이 6.1 Sol Max보다 낫다는 의견을 남겼습니다. 다만 구체적인 코드와 재현 조건은 제시하지 않았습니다.
기존 6 Sol에 대한 평가도 갈렸습니다. 같은 토론에 실망했다는 반응이 있는 반면, SupperSoupYT는 6 Sol의 xhigh 설정을 만족스럽게 사용했다고 적었습니다.
이 정도의 초기 댓글만으로 사용자 전체의 평가를 단정하기는 어렵습니다. 특히 다른 모델과 비교한 감상이 많아, 6 Sol과 6.1 Sol을 동일한 조건에서 비교한 결과와는 구분해서 읽어야 합니다.
현재 확인한 반응에서는 가격과 사용량에 대한 기대가 보이고, 결과물의 품질은 작업에 따라 평가가 갈린다는 정도로 받아들이는 것이 맞겠습니다.
Codex 사용량도 API 가격표와 따로 봐야 합니다.
Codex의 Standard 크레딧 요율은 다음과 같습니다.
| 1 00만 토큰당 크레딧 | GPT-6 Sol | GPT-6.1 Sol |
| 일반 입력 | 50 | 50 |
| 캐시 입력 | 5 | 2.5 |
| 출력 | 250 | 250 |
크레딧 요율에서도 캐시 입력 부분이 절반으로 낮아졌습니다. 하지만 이 표만 보고 Plus나 Pro의 포함 사용량이 정확히 두 배 늘어난다고 판단하면 안 됩니다. 공식 안내도 API 가격, 크레딧 요율, 구독에 포함된 사용 한도를 구분합니다.
모델을 바꿔 비교할 때는 추론 수준과 속도 모드도 함께 확인하는 편이 좋습니다. 한쪽은 Standard Medium, 다른 쪽은 Fast Max로 실행했다면 모델 차이와 설정 차이가 섞이게 됩니다.
공식 모델 안내에서도 추론 수준이 세대마다 정확히 대응하지 않는다고 설명합니다. 이름이 같은 High라고 해서 생각하는 양까지 같다는 뜻은 아닙니다.
API를 직접 사용한다면 두 가지는 확인해야 합니다.
첫째, 6.1 Sol은 none 추론 설정을 지원하지 않습니다.
기존 6 Sol은 none을 지원했지만, 6.1 Sol은 Low부터 시작합니다. 기존에 추론을 끈 설정으로 호출하고 있었다면 요청을 수정해야 합니다.
둘째, 6.1 Sol에서 도구 호출은 Responses API를 사용해야 합니다.
6 Sol은 Chat Completions에서도 none 설정에 한해 함수 호출을 지원했습니다. 6.1 Sol은 Chat Completions에서 도구 호출을 지원하지 않습니다. 기존 연동 방식에 따라 모델 이름 외의 코드도 바꿔야 할 수 있습니다.
Codex 화면에서 모델만 선택하는 사용자보다, API를 서비스에 직접 붙인 개발자에게 더 중요한 변화입니다.
그렇다면 6 Sol에서 바꿀 만할까?
새로 시작하는 개발 작업이라면 저는 6.1 Sol을 먼저 비교해볼 것 같습니다.
기본 입력·출력 단가가 같고, 공식 평가에서는 여러 작업의 개선이 확인됐습니다. 캐시 입력 가격도 낮아졌습니다. 기존 6 Sol을 유지해야 할 특별한 이유가 없다면 시험해볼 근거는 충분합니다.
다만 비교 기준은 모델 이름이나 답변 길이보다 다음 세 가지로 잡고 싶습니다.
- 요구사항을 빠뜨리지 않고 구현했는가?
- 사람이 다시 설명하거나 수정해야 하는 횟수가 줄었는가?
- 쓸 수 있는 결과를 얻기까지 시간과 사용량이 얼마나 들었는가?
Spring 기반 프로젝트라면 서비스 로직 수정, 조회 쿼리 개선, 실패한 테스트 분석처럼 평소 자주 맡기는 작업이 좋은 비교 대상입니다. 같은 코드 상태에서 같은 요청을 주고 결과를 보면 됩니다.
작업을 더 오래 시켰다는 사실보다, 그 시간 동안 제대로 끝낸 일이 무엇인지가 중요하다고 생각합니다.
6.1 Sol은 공식 수치상으로는 관심을 가질 만한 업데이트입니다. 이제 확인할 것은 그 차이가 각자의 코드와 업무에서도 나타나는지입니다. 저도 모델을 고를 때는 벤치마크와 함께, 결국 제가 다시 손봐야 하는 일이 얼마나 남는지를 기준으로 보려고 합니다.
자료 확인일: 2026년 9월 30일. 가격과 제공 범위는 이후 변경될 수 있습니다.
참고 자료
'AI엔지니어링' 카테고리의 다른 글
| GPT-6 Sol, 바꿀 만할까? 가격과 Codex 사용량 비교 (0) | 2026.09.29 |
|---|---|
| GPT-5.6 출시 총정리|Sol·Terra·Luna 모델 차이와 GPT-5.5 대비 토큰 사용량 (0) | 2026.07.16 |