새 모델 발표는 늘 ‘더 똑똑해졌다’로 요약되지만, 정작 개발자는 컨텍스트 한도와 출력 한도, 실제 응답 지연, 그리고 백만 토큰을 넣었을 때 청구서가 얼마인지 먼저 확인해야
OrcaRouter, 9월 21일과 22일 프론티어 모델 4종을 카탈로그에 올리고 컨텍스트·가격·지연·측정 공백을 같은 화면에 공개
네 모델 가운데 하나는 아직 측정값이 한 줄도 없고, 하나는 7일 오류율이 5.63%로 기록
네 모델은 서로 다른 회사에서 나왔지만 이틀 안에 같은 카탈로그에 등재됐다. 하나의 API 키와 하나의 엔드포인트 규약으로 접근할 수 있다는 것이 게이트웨이를 쓰는 이유이고, 동시에 네 모델을 같은 화면에서 비교할 수 있게 됐다는 것이 이번 등재의 실질적인 변화다.
컨텍스트 한도는 모델마다 두 배 이상 차이 난다. GPT-6 Luna와 GPT-6 Sol은 각각 105만 토큰, Claude Opus 5.5는 100만 토큰, Grok 4.7은 50만 토큰이다. 출력 한도는 순서가 뒤집힌다. Grok 4.7이 45만 토큰으로 가장 크고, Luna·Sol·Opus 5.5는 12만8000토큰이다.
컨텍스트와 출력은 같은 숫자가 아니다. 긴 문서를 넣는 작업과 긴 문서를 뽑아내는 작업은 서로 다른 한도에 걸리며, 두 값을 함께 보지 않으면 어느 쪽에서 막히는지 알 수 없다.
지연은 측정된 것과 측정되지 않은 것으로 나뉜다
카탈로그의 지연 통계는 7일 창 기준이다. GPT-6 Luna는 p50 644밀리초·p95 7806밀리초·초당 113.7토큰, GPT-6 Sol은 p50 1307밀리초·p95 6684밀리초·초당 76.9토큰, Claude Opus 5.5는 p50 4666밀리초·p95 1만 밀리초·초당 97.1토큰으로 기록돼 있다.
Grok 4.7의 지연 항목은 대부분 0으로 채워져 있다. 7일 트래픽 0, p50 0으로 표시되고 초당 토큰 수 항목에는 값이 없으며, 오류율만 100%로 잡혀 있다. 남아 있는 p95 1000밀리초도 호출 기록에서 나온 값이 아니다. 이는 모델이 느리다는 측정 결과가 아니라 아직 이 게이트웨이를 통해 호출된 기록이 없다는 뜻이다. 그래서 Grok 4.7은 ‘측정됐다’가 아니라 ‘등재됐다’로 적는 것이 맞다. 카탈로그는 측정값이 없는 항목을 0으로 채워 넣고, 그 0을 성능으로 읽으면 안 된다. 같은 화면에서 네 모델을 나란히 놓으면 세 모델에는 일별 값이 쌓여 있고 Grok 4.7에는 그 일별 기록 자체가 없다는 차이도 함께 보인다.
Claude Opus 5.5의 오류율 5.63%는 눈에 띄는 값이다. 같은 주 같은 화면에서 Luna는 0.021%, Sol은 0.096%를 기록했다. 이 수치는 게이트웨이를 통과한 요청의 실패율이며 모델의 능력치가 아니지만, 재시도·폴백·타임아웃 설계를 하는 사람에게는 능력치보다 먼저 필요한 정보다.
가격은 계단식이다
가격표는 네 모델 가운데 셋에만 구간이 있다. 입력 100만 토큰당 4달러·출력 20달러인 Claude Opus 5.5는 구간 없이 한 가지 단가만 쓴다. GPT-6 Luna는 27만2000토큰까지 0.1달러·0.5달러가 적용되고 그 위 구간은 0.2달러·0.75달러로 올라간다. GPT-6 Sol은 같은 27만2000토큰을 경계로 2달러·10달러에서 4달러·15달러로, Grok 4.7은 20만 토큰을 경계로 2달러·6달러에서 4달러·12달러로 올라간다.
구간 경계가 모델마다 다르다는 점이 실무에서 걸리는 지점이다. 27만2000토큰을 넘겨 호출하면 Luna·Sol·Grok 4.7 세 모델 모두 단가가 뛰지만, Grok 4.7은 그보다 이른 20만 토큰에서 이미 다음 구간에 들어간다. 같은 게이트웨이 안에서도 청구 규칙이 모델별로 다르므로 단가를 비교할 때 첫 구간 숫자만 보면 안 된다.
엔드포인트도 모델마다 다르다
Claude Opus 5.5와 Grok 4.7은 OpenAI 호환 채팅 완성 엔드포인트 외에 각자 다른 두 번째 경로를 함께 제공한다. Opus 5.5는 Anthropic의 메시지 형식 엔드포인트를, Grok 4.7은 응답 형식 엔드포인트를 지원한다. 기존 코드를 그대로 옮길 수 있는 범위가 모델마다 다르다는 뜻이며, 이 정보도 모델 페이지에 함께 표기된다.
이 숫자들은 어디서 왔나
컨텍스트·출력 한도·가격·엔드포인트·7일 지연 통계는 모두 OrcaRouter 모델 페이지가 자체 수집한 값이다. 지연 통계의 출처는 OrcaRouter 플레이그라운드며 2026년 9월 23일부터의 일별 값이 쌓여 있다.
벤치마크 항목은 별도 출처를 표기한다. 네 모델의 추론·장문 회상·과학 코딩 점수는 외부 평가기관 집계를 인용한 값이며, 모델 페이지는 그 출처를 함께 적는다. 자체 측정값과 외부 인용값을 한 화면에 섞어 놓고 구분하지 않으면 어느 쪽을 근거로 결정을 내렸는지 나중에 확인할 수 없게 된다.
주요 모델
OrcaRouter는 단일 API 키와 엔드포인트로 다음을 포함한 200개 이상의 모델을 제공한다.
· OpenAI GPT-5.5
· Anthropic Claude Fable 5.1
· Google Gemini 3.8 Flash
· DeepSeek V4.1 Flash
· xAI Grok 4.6
· Qwen 3.7 Max
· Z.ai GLM-5.3
참고
· GPT-6 Luna 모델 페이지
· GPT-6 Sol 모델 페이지
· Claude Opus 5.5 모델 페이지
· Grok 4.7 모델 페이지
· OrcaRouter 웹사이트
OrcaRouter 소개
OrcaRouter는 OpenAI 호환 LLM 게이트웨이로, 200개가 넘는 모델에 걸쳐 라우팅하며 약 40%의 비용 절감, 1밀리초 미만의 라우팅 오버헤드, 0%의 토큰 마크업을 제공한다. 자체 호스팅 에디션인 OrcaRouter-Lite는 MIT 라이선스로 제공된다.
CONTINUUM AI PTE. LTD. 소개
Continuum AI Pte. Ltd.는 최첨단 AI를 개발자와 팀이 접근 가능하고 합리적인 비용으로 사용할 수 있도록 하기 위해 설립된 싱가포르 기반 기업이다. 단일 API 키와 엔드포인트를 통해 200개 이상의 선도적인 AI 모델에 대한 액세스를 제공하는 OpenAI 호환 AI Gateway인 OrcaRouter를 개발한 회사다. OrcaRouter는 약 40%의 비용 절감, 1ms 미만의 라우팅 오버헤드, 토큰 마크업 없음을 제공하며, MIT 라이선스로 출시된 자체 호스팅 버전(OrcaRouter-Lite)도 함께 제공한다.
웹사이트: https://www.orcarouter.ai
연락처
컨티뉴엄 AI(CONTINUUM AI)
OrcaRouter
Koki Kobayashi
이메일 보내기