AI 모델 값이 싸지고 있다는 말은 이제 흔하다. 실제로 그런지 세어 봤다. 2026년 8월 18일부터 9월 17일까지 우리가 잡아낸 가격 변경은 127건이고, 그중 인하가 96건으로 인상 31건의 3배였다.
여기까지는 통념과 같다. 그런데 누가 그 값을 바꿨는지 보면 이야기가 달라진다.
값을 움직이는 쪽은 정해져 있다
| 벤더 | 가격 변경 |
|---|---|
| DeepSeek | 87 |
| Moonshot AI | 16 |
| Zhipu AI | 11 |
| Alibaba | 7 |
| Meta | 3 |
| 1 | |
| Mistral AI | 1 |
| NVIDIA | 1 |
상위 네 곳(DeepSeek, Moonshot AI, Zhipu AI, Alibaba)이 121건으로 전체 127건의 95%를 차지한다. DeepSeek 한 곳만 87건, 68%다. 반대편에는 아예 없는 이름들이 있다. 같은 기간 OpenAI 와 Anthropic 의 가격 변경은 0건이었다.
즉 "AI 가격이 내려간다" 는 문장은 절반만 맞다. 공개 가중치를 내놓는 쪽은 값을 자주, 큰 폭으로 움직인다. 상용 API 쪽은 값을 그대로 두고 새 모델을 얹는 방식으로 대응한다. 쓰는 사람 입장에서 이 차이는 작지 않다. 전자를 쓰면 이번 달 청구서가 지난달과 다를 수 있고, 후자를 쓰면 모델을 갈아타지 않는 한 그대로다.
큰 폭으로 움직인 것은 대개 인상이었다
변동률이 큰 열 건을 뽑아 보면 성격이 또 갈린다. gemma-4-26b 가 $0.04 에서 $0.09 로 125% 올랐고, deepseek-v4-pro 는 $0.73 에서 $1.60 으로 119% 올랐다. glm-5.3-flash 114%, glm-5.2 106%, deepseek-v4.1-flash 100%. 상위 열 건이 전부 인상이다.
인하 건수는 훨씬 많지만 폭은 작았다는 뜻이다. 값싼 모델이 조금씩 더 싸지는 동안, 한 번씩 두 배로 뛰는 일이 같은 진영에서 벌어지고 있다. 싼 값을 보고 골랐다면 그 값이 유지된다는 보장은 없다.
성능 1점을 사는 데 드는 돈
값만 보면 판단이 어렵다. 성능 점수가 있는 모델을 놓고 입력 100만 토큰당 단가를 나란히 두면 이렇게 된다.
| 모델 | 성능 | 입력 단가 | 1점당 |
|---|---|---|---|
| claude-fable-5.1 | 53.4 | $10.00 | $0.187 |
| gpt-6-astra | 52.8 | $10.00 | $0.189 |
| claude-opus-5 | 50.7 | $5.00 | $0.099 |
| gpt-5.6-sol | 47.1 | $2.00 | $0.042 |
| qwen3.8-max-0902 | 45.4 | $2.00 | $0.044 |
| glm-5.3 | 44.9 | $1.40 | $0.031 |
| grok-4.6 | 44.4 | $2.00 | $0.045 |
1등 claude-fable-5.1 은 53.4점에 $10, 성능 1점당 $0.187 이다. glm-5.3 은 44.9점에 $1.40, 1점당 $0.031 로 6배 싸다. 점수 차이는 8.5점, 16% 다. 그 16% 를 위해 6배를 낼 값어치가 있는지는 하는 일에 달렸다 — 코드 생성처럼 마지막 몇 점이 결과를 가르는 일이 있고, 분류나 요약처럼 그렇지 않은 일이 있다.
이 수치를 어떻게 읽어야 하나
짚어 둘 것이 있다. 성능 점수는 Artificial Analysis 가 열 개 평가를 묶어 낸 지수이고 백분율이 아니다. 그리고 점수가 아직 없는 모델이 많다 — gpt-5.4-pro, gpt-5.5-pro 처럼 단가가 $30 인 상위 모델도 이 표에 들어오지 못했다. 위 표는 "점수가 매겨진 것들 사이의 비교" 이지 전체 순위가 아니다.
값은 계속 움직인다. 이 글의 수치는 아래 화면에서 지금 값으로 다시 볼 수 있다.