순위표는 잘하는 순으로 세운다. 값은 거기 없다. 두 값을 나눠 "성능 1점을 사는 데 얼마가 드는가" 로 다시 세우면 순서가 뒤집힌다.

1점당 가장 싼 쪽

성능 30점 이상인 모델만 추렸다. 그 아래는 하는 일이 달라져 견주는 의미가 옅어진다.

모델성능입력 단가1점당
deepseek-v4-flash-073134.5$0.060$0.0017
glm-5.3-flash41.9$0.090$0.0021
deepseek-v4.1-flash39.5$0.150$0.0038
gpt-5.6-luna37.5$0.200$0.0053
qwen3.8-27b33.9$0.214$0.0063
gemini-3.8-flash41.2$0.750$0.0182
glm-5.344.9$1.400$0.0312

순위 위쪽과 견주면

모델성능입력 단가1점당
claude-fable-5.153.4$10.00$0.1873
gpt-6-astra52.8$10.00$0.1894
claude-opus-550.7$5.00$0.0986

1위 claude-fable-5.1 은 1점당 $0.187, deepseek-v4-flash-0731 은 $0.0017 이다. 110배 차이다. 대신 점수는 53.4 대 34.5, 19점이 벌어진다.

이 숫자로 답할 수 있는 것과 없는 것

1점당 단가는 "같은 일을 맡길 수 있다면 어느 쪽이 싼가" 에만 답한다. 같은 일을 맡길 수 있는지는 답하지 못한다. 성능 지수는 열 개 평가를 묶은 값이라, 34점과 53점 사이의 19점이 어느 과목에서 벌어진 차이인지 이 숫자만으로는 알 수 없다. 코드 생성에서 벌어진 차이라면 코드 일에는 싼 쪽을 쓸 수 없고, 지식 문제에서 벌어진 차이라면 요약 일에는 아무 상관이 없다.

그래서 이 표는 후보를 좁히는 데 쓰는 것이 맞다. 1점당 단가가 100배 차이 나는 두 모델이 눈에 들어왔다면, 그다음은 과목별 점수를 보고 내 일에 걸리는 과목에서 얼마나 벌어지는지 확인할 차례다. 개별 모델 화면에 과목별 성적표를 두었다.

모델 순위 보기가격 비교표 보기