Bảng Xếp Hạng AI Models

Đánh giá hiệu năng thực tế, điểm benchmark (MMLU-Pro, HumanEval), độ trễ phản hồi (TTFT) và chi phí thực tế trên ModelMart Gateway.

Cập nhật: 11/08/2026·42 models·8 providers·3 benchmarks
BEST OVERALLDeepSeek AI

DeepSeek-V3

Score: 94.2·MMLU: 92.4%·Code: 89.2%
3.500 ₫ / 1MChi tiết
BEST VALUEAlibaba Cloud

Qwen 2.5 72B Instruct

Score: 89.8·MMLU: 88.6%·Code: 86.1%
8.000 ₫ / 1MChi tiết
BEST CODINGAnthropic

Claude 3.5 Sonnet

Score: 93.7·MMLU: 93.8%·Code: 93.7%
75.000 ₫ / 1MChi tiết

Performance vs. Cost

Tìm kiếm mô hình có hiệu năng xuất sắc nhất trong tầm ngân sách của bạn (Trục X: Giá 1M tokens, Trục Y: Score).

Score (Hiệu năng) ↑Giá 1M Tokens (₫) →
DeepSeek-V3
Claude 3.5 Sonnet
DeepSeek-R1
GPT-4o
Qwen 2.5 72B Instruct
Gemini 1.5 Pro
Llama 3.3 70B Instruct
GPT-4o Mini
Provider:
Giá 1M:
Sắp xếp:
So sánh#Model & Nhà Cung CấpScore TổngMMLU-ProHumanEval (Code)TTFTTốc ĐộGiá Đầu Vào (1M)Hành Động
🥇 1
DeepSeek-V3BEST OVERALL
DeepSeek AI
94.2
92.4%
89.2%
380 ms68.5 tok/s3.500 ₫Gọi API
🥈 2
Claude 3.5 SonnetBEST CODING
Anthropic
93.7
93.8%
93.7%
420 ms54.2 tok/s75.000 ₫Gọi API
🥉 3
DeepSeek-R1BEST REASONING
DeepSeek AI
93.1
94.1%
91%
850 ms36.8 tok/s14.000 ₫Gọi API
#4
GPT-4oMULTIMODAL
OpenAI
92.8
91.5%
88.4%
350 ms72.1 tok/s62.500 ₫Gọi API
#5
Qwen 2.5 72B InstructBEST VALUE
Alibaba Cloud
89.8
88.6%
86.1%
310 ms84 tok/s8.000 ₫Gọi API
#6
Gemini 1.5 Pro
Google AI
89.5
90.1%
84.8%
490 ms48.6 tok/s31.250 ₫Gọi API
#7
Llama 3.3 70B InstructOPEN WEIGHT
Meta AI
88.4
87.2%
83.5%
290 ms92.4 tok/s6.500 ₫Gọi API
#8
GPT-4o MiniFASTEST
OpenAI
84.5
82%
78.9%
240 ms110.5 tok/s3.750 ₫Gọi API
METHODOLOGY & BENCHMARK SOURCES

Cách ModelMart Tính Điểm Rankings

3 benchmarks · 42 models · 8 providers

1. Benchmark Quốc Tế

Tổng hợp từ MMLU-Pro, HumanEval (Coding) và LMSYS Chatbot Arena với bộ trọng số chuẩn hóa.

2. Đo Trễ Phản Hồi Thực

Độ trễ TTFT (Time-to-first-token) và tốc độ sinh token được đo đạc liên tục 24/7 từ các gateway node.

3. Trọng Số Chi Phí

Overall Score tính toán dựa trên thuật toán kết hợp giữa chất lượng đầu ra, độ trễ và giá API thực tế.