순위표는 잘하는 순으로 세운다. 값은 거기 없다. 두 값을 나눠 "성능 1점을 사는 데 얼마가 드는가" 로 다시 세우면 순서가 뒤집힌다.
1점당 가장 싼 쪽
성능 30점 이상인 모델만 추렸다. 그 아래는 하는 일이 달라져 견주는 의미가 옅어진다.
| 모델 | 성능 | 입력 단가 | 1점당 |
|---|---|---|---|
| deepseek-v4-flash-0731 | 34.5 | $0.060 | $0.0017 |
| glm-5.3-flash | 41.9 | $0.090 | $0.0021 |
| deepseek-v4.1-flash | 39.5 | $0.150 | $0.0038 |
| gpt-5.6-luna | 37.5 | $0.200 | $0.0053 |
| qwen3.8-27b | 33.9 | $0.214 | $0.0063 |
| gemini-3.8-flash | 41.2 | $0.750 | $0.0182 |
| glm-5.3 | 44.9 | $1.400 | $0.0312 |
순위 위쪽과 견주면
| 모델 | 성능 | 입력 단가 | 1점당 |
|---|---|---|---|
| claude-fable-5.1 | 53.4 | $10.00 | $0.1873 |
| gpt-6-astra | 52.8 | $10.00 | $0.1894 |
| claude-opus-5 | 50.7 | $5.00 | $0.0986 |
1위 claude-fable-5.1 은 1점당 $0.187, deepseek-v4-flash-0731 은 $0.0017 이다. 110배 차이다. 대신 점수는 53.4 대 34.5, 19점이 벌어진다.
이 숫자로 답할 수 있는 것과 없는 것
1점당 단가는 "같은 일을 맡길 수 있다면 어느 쪽이 싼가" 에만 답한다. 같은 일을 맡길 수 있는지는 답하지 못한다. 성능 지수는 열 개 평가를 묶은 값이라, 34점과 53점 사이의 19점이 어느 과목에서 벌어진 차이인지 이 숫자만으로는 알 수 없다. 코드 생성에서 벌어진 차이라면 코드 일에는 싼 쪽을 쓸 수 없고, 지식 문제에서 벌어진 차이라면 요약 일에는 아무 상관이 없다.
그래서 이 표는 후보를 좁히는 데 쓰는 것이 맞다. 1점당 단가가 100배 차이 나는 두 모델이 눈에 들어왔다면, 그다음은 과목별 점수를 보고 내 일에 걸리는 과목에서 얼마나 벌어지는지 확인할 차례다. 개별 모델 화면에 과목별 성적표를 두었다.