Bảng Xếp Hạng AI Models
Đánh giá hiệu năng thực tế, điểm benchmark (MMLU-Pro, HumanEval), độ trễ phản hồi (TTFT) và chi phí thực tế trên ModelMart Gateway.
Cập nhật: 11/08/2026·42 models·8 providers·3 benchmarks
Performance vs. Cost
Tìm kiếm mô hình có hiệu năng xuất sắc nhất trong tầm ngân sách của bạn (Trục X: Giá 1M tokens, Trục Y: Score).
Score (Hiệu năng) ↑Giá 1M Tokens (₫) →
DeepSeek-V3
Claude 3.5 Sonnet
DeepSeek-R1
GPT-4o
Qwen 2.5 72B Instruct
Gemini 1.5 Pro
Llama 3.3 70B Instruct
GPT-4o Mini
Provider:
Giá 1M:
Sắp xếp:
| So sánh | # | Model & Nhà Cung Cấp | Score Tổng | MMLU-Pro | HumanEval (Code) | TTFT | Tốc Độ | Giá Đầu Vào (1M) | Hành Động |
|---|---|---|---|---|---|---|---|---|---|
| 🥇 1 | DeepSeek-V3BEST OVERALL DeepSeek AI | 94.2 | 92.4% | 89.2% | 380 ms | 68.5 tok/s | 3.500 ₫ | Gọi API | |
| 🥈 2 | Claude 3.5 SonnetBEST CODING Anthropic | 93.7 | 93.8% | 93.7% | 420 ms | 54.2 tok/s | 75.000 ₫ | Gọi API | |
| 🥉 3 | DeepSeek-R1BEST REASONING DeepSeek AI | 93.1 | 94.1% | 91% | 850 ms | 36.8 tok/s | 14.000 ₫ | Gọi API | |
| #4 | GPT-4oMULTIMODAL OpenAI | 92.8 | 91.5% | 88.4% | 350 ms | 72.1 tok/s | 62.500 ₫ | Gọi API | |
| #5 | Qwen 2.5 72B InstructBEST VALUE Alibaba Cloud | 89.8 | 88.6% | 86.1% | 310 ms | 84 tok/s | 8.000 ₫ | Gọi API | |
| #6 | Gemini 1.5 Pro Google AI | 89.5 | 90.1% | 84.8% | 490 ms | 48.6 tok/s | 31.250 ₫ | Gọi API | |
| #7 | Llama 3.3 70B InstructOPEN WEIGHT Meta AI | 88.4 | 87.2% | 83.5% | 290 ms | 92.4 tok/s | 6.500 ₫ | Gọi API | |
| #8 | GPT-4o MiniFASTEST OpenAI | 84.5 | 82% | 78.9% | 240 ms | 110.5 tok/s | 3.750 ₫ | Gọi API |
METHODOLOGY & BENCHMARK SOURCES
Cách ModelMart Tính Điểm Rankings
1. Benchmark Quốc Tế
Tổng hợp từ MMLU-Pro, HumanEval (Coding) và LMSYS Chatbot Arena với bộ trọng số chuẩn hóa.
2. Đo Trễ Phản Hồi Thực
Độ trễ TTFT (Time-to-first-token) và tốc độ sinh token được đo đạc liên tục 24/7 từ các gateway node.
3. Trọng Số Chi Phí
Overall Score tính toán dựa trên thuật toán kết hợp giữa chất lượng đầu ra, độ trễ và giá API thực tế.