מדד ה-AI העולמי • LLM STATS
מעודכן: 2026-09-18 15:43:53
לוח בנצ'מרקים של מודלי AI
דירוג TrueSkill אמין על אלפי הרצות במבחני ביצועים. נתונים חיים לסוכני AI, פיתוח קוד, מתמטיקה וויזיה מכונה.
390+
מודלים
701+
בנצ'מרקים
TrueSkill
מתודולוגיה
Live
סנכרון
שלישייה מובילה — דירוג כללי
🥇 #1
קנייני
21
GPT-6 Astra
OpenAI
$ / 1M
$10.00/M
TrueSkill
59.6
🥈 #2
קנייני
5
Claude Fable 5.1
Anthropic
$ / 1M
$10.00/M
TrueSkill
55.7
🥉 #3
קנייני
45
GPT-5.6 Sol
OpenAI
$ / 1M
$5.00/M
TrueSkill
54.9
| # | מודל | חברה | TrueSkill | $ / 1M | בנצ׳מרקים |
|---|---|---|---|---|---|
| 1 | GPT-6 Astra | OpenAI | $10.00 | 21 מבחנים | |
| 2 | Claude Fable 5.1 | Anthropic | $10.00 | 5 מבחנים | |
| 3 | GPT-5.6 Sol | OpenAI | $5.00 | 45 מבחנים | |
| 4 | Claude Mythos Preview | Anthropic | — | 15 מבחנים | |
| 5 | Claude Opus 5 | Anthropic | $5.00 | 12 מבחנים | |
| 6 | Muse Spark 1.3 | Meta AI | $0.10 | 10 מבחנים | |
| 7 | Claude Fable 5 | Anthropic | $10.00 | 18 מבחנים | |
| 8 | Kimi K3 | Moonshot AI | $2.85 | 26 מבחנים | |
| 9 | GLM-5.3 | Zhipu AI (GLM) | $1.20 | 17 מבחנים | |
| 10 | Atria Dawn Preview | Shanghai AI Lab | חופשי | 11 מבחנים | |
| 11 | Qwen3.8 Max | Alibaba Qwen | $1.65 | 33 מבחנים | |
| 12 | DeepSeek-V4-Pro-0813 | DeepSeek | $0.44 | 11 מבחנים | |
| 13 | DeepSeek-V4.1-Flash | DeepSeek | $0.22 | 18 מבחנים | |
| 14 | Hy4 preview | Tencent | חופשי | 31 מבחנים | |
| 15 | Claude Opus 4.8 | Anthropic | $5.00 | 27 מבחנים | |
| 16 | GPT-5.6 Terra | OpenAI | $2.00 | 45 מבחנים | |
| 17 | Gemini 3.8 Flash | Google DeepMind | $0.75 | 10 מבחנים | |
| 18 | GLM-5.3-Flash | Zhipu AI (GLM) | $0.15 | 14 מבחנים | |
| 19 | Muse Spark 1.1 | Meta AI | $1.25 | 11 מבחנים | |
| 20 | Qwen3.8-Flash-Next | Alibaba Qwen | חופשי | 22 מבחנים |
שלישייה מובילה — קוד ותוכנה
🥇 #1
קנייני
7
GPT-6 Astra
OpenAI
$ / 1M
$10.00/M
TrueSkill
48.5
🥈 #2
קנייני
17
GPT-5.6 Sol
OpenAI
$ / 1M
$5.00/M
TrueSkill
46.0
🥉 #3
קנייני
9
Claude Fable 5
Anthropic
$ / 1M
$10.00/M
TrueSkill
45.7
| # | מודל | חברה | TrueSkill | $ / 1M | בנצ׳מרקים |
|---|---|---|---|---|---|
| 1 | GPT-6 Astra | OpenAI | $10.00 | 7 מבחנים | |
| 2 | GPT-5.6 Sol | OpenAI | $5.00 | 17 מבחנים | |
| 3 | Claude Fable 5 | Anthropic | $10.00 | 9 מבחנים | |
| 4 | Claude Mythos Preview | Anthropic | — | 6 מבחנים | |
| 5 | DeepSeek-V4.1-Flash | DeepSeek | $0.22 | 9 מבחנים | |
| 6 | Kimi K3 | Moonshot AI | $2.85 | 9 מבחנים | |
| 7 | GLM-5.3 | Zhipu AI (GLM) | $1.20 | 12 מבחנים | |
| 8 | GPT-5.6 Terra | OpenAI | $2.00 | 17 מבחנים | |
| 9 | Claude Opus 5 | Anthropic | $5.00 | 4 מבחנים | |
| 10 | Muse Spark 1.3 | Meta AI | $0.10 | 3 מבחנים | |
| 11 | Claude Opus 4.8 | Anthropic | $5.00 | 11 מבחנים | |
| 12 | DeepSeek-V4-Pro-0813 | DeepSeek | $0.44 | 5 מבחנים | |
| 13 | Qwen3.8 Max | Alibaba Qwen | $1.65 | 9 מבחנים | |
| 14 | Hy4 preview | Tencent | חופשי | 11 מבחנים | |
| 15 | Gemini 3.8 Flash | Google DeepMind | $0.75 | 3 מבחנים | |
| 16 | GPT-5.5 | OpenAI | $5.00 | 7 מבחנים | |
| 17 | Claude Mythos 5.1 | Anthropic | — | 1 מבחנים | |
| 18 | Grok 4.6 | xAI | $2.00 | 4 מבחנים | |
| 19 | Claude Sonnet 5 | Anthropic | $2.00 | 10 מבחנים | |
| 20 | Claude Opus 4.7 | Anthropic | $5.00 | 7 מבחנים |
שלישייה מובילה — חשיבה והיגיון
🥇 #1
קנייני
14
GPT-6 Astra
OpenAI
$ / 1M
$10.00/M
TrueSkill
57.5
🥈 #2
קנייני
12
Claude Mythos Preview
Anthropic
$ / 1M
—
TrueSkill
55.8
🥉 #3
קנייני
29
GPT-5.6 Sol
OpenAI
$ / 1M
$5.00/M
TrueSkill
54.0
| # | מודל | חברה | TrueSkill | $ / 1M | בנצ׳מרקים |
|---|---|---|---|---|---|
| 1 | GPT-6 Astra | OpenAI | $10.00 | 14 מבחנים | |
| 2 | Claude Mythos Preview | Anthropic | — | 12 מבחנים | |
| 3 | GPT-5.6 Sol | OpenAI | $5.00 | 29 מבחנים | |
| 4 | Claude Opus 5 | Anthropic | $5.00 | 9 מבחנים | |
| 5 | Claude Fable 5.1 | Anthropic | $10.00 | 4 מבחנים | |
| 6 | GLM-5.3 | Zhipu AI (GLM) | $1.20 | 9 מבחנים | |
| 7 | Claude Fable 5 | Anthropic | $10.00 | 13 מבחנים | |
| 8 | Muse Spark 1.3 | Meta AI | $0.10 | 7 מבחנים | |
| 9 | Kimi K3 | Moonshot AI | $2.85 | 20 מבחנים | |
| 10 | Hy4 preview | Tencent | חופשי | 25 מבחנים | |
| 11 | Qwen3.8 Max | Alibaba Qwen | $1.65 | 19 מבחנים | |
| 12 | Atria Dawn Preview | Shanghai AI Lab | חופשי | 8 מבחנים | |
| 13 | Claude Opus 4.8 | Anthropic | $5.00 | 20 מבחנים | |
| 14 | Muse Spark 1.1 | Meta AI | $1.25 | 9 מבחנים | |
| 15 | DeepSeek-V4-Pro-0813 | DeepSeek | $0.44 | 7 מבחנים | |
| 16 | GPT-5.6 Terra | OpenAI | $2.00 | 29 מבחנים | |
| 17 | GLM-5.3-Flash | Zhipu AI (GLM) | $0.15 | 11 מבחנים | |
| 18 | DeepSeek-V4.1-Flash | DeepSeek | $0.22 | 12 מבחנים | |
| 19 | Qwen3.8-Flash-Next | Alibaba Qwen | חופשי | 11 מבחנים | |
| 20 | Qwen3.8 Flash | Alibaba Qwen | $0.15 | 11 מבחנים |
שלישייה מובילה — סוכנים אוטונומיים
🥇 #1
קנייני
12
GPT-6 Astra
OpenAI
$ / 1M
$10.00/M
TrueSkill
45.7
🥈 #2
קנייני
4
Claude Fable 5.1
Anthropic
$ / 1M
$10.00/M
TrueSkill
41.3
🥉 #3
קנייני
26
GPT-5.6 Sol
OpenAI
$ / 1M
$5.00/M
TrueSkill
41.2
| # | מודל | חברה | TrueSkill | $ / 1M | בנצ׳מרקים |
|---|---|---|---|---|---|
| 1 | GPT-6 Astra | OpenAI | $10.00 | 12 מבחנים | |
| 2 | Claude Fable 5.1 | Anthropic | $10.00 | 4 מבחנים | |
| 3 | GPT-5.6 Sol | OpenAI | $5.00 | 26 מבחנים | |
| 4 | DeepSeek-V4.1-Flash | DeepSeek | $0.22 | 11 מבחנים | |
| 5 | Claude Fable 5 | Anthropic | $10.00 | 12 מבחנים | |
| 6 | Muse Spark 1.3 | Meta AI | $0.10 | 8 מבחנים | |
| 7 | Claude Opus 5 | Anthropic | $5.00 | 8 מבחנים | |
| 8 | GLM-5.3 | Zhipu AI (GLM) | $1.20 | 16 מבחנים | |
| 9 | Kimi K3 | Moonshot AI | $2.85 | 17 מבחנים | |
| 10 | Atria Dawn Preview | Shanghai AI Lab | חופשי | 11 מבחנים | |
| 11 | GPT-5.6 Terra | OpenAI | $2.00 | 26 מבחנים | |
| 12 | Qwen3.8 Max | Alibaba Qwen | $1.65 | 19 מבחנים | |
| 13 | DeepSeek-V4-Pro-0813 | DeepSeek | $0.44 | 8 מבחנים | |
| 14 | Grok 4.6 | xAI | $2.00 | 7 מבחנים | |
| 15 | GLM-5.3-Flash | Zhipu AI (GLM) | $0.15 | 8 מבחנים | |
| 16 | Hy4 preview | Tencent | חופשי | 21 מבחנים | |
| 17 | Claude Mythos Preview | Anthropic | — | 6 מבחנים | |
| 18 | Gemini 3.8 Flash | Google DeepMind | $0.75 | 5 מבחנים | |
| 19 | Claude Opus 4.8 | Anthropic | $5.00 | 16 מבחנים | |
| 20 | Qwen3.8-Flash-Next | Alibaba Qwen | חופשי | 11 מבחנים |
שלישייה מובילה — מתמטיקה ומדעים
🥇 #1
קנייני
3
Claude Mythos Preview
Anthropic
$ / 1M
—
TrueSkill
47.0
🥈 #2
קנייני
1
Claude Fable 5.1
Anthropic
$ / 1M
$10.00/M
TrueSkill
43.6
🥉 #3
קנייני
13
Qwen3.7 Max
Alibaba Qwen
$ / 1M
$1.25/M
TrueSkill
43.1
| # | מודל | חברה | TrueSkill | $ / 1M | בנצ׳מרקים |
|---|---|---|---|---|---|
| 1 | Claude Mythos Preview | Anthropic | — | 3 מבחנים | |
| 2 | Claude Fable 5.1 | Anthropic | $10.00 | 1 מבחנים | |
| 3 | Qwen3.7 Max | Alibaba Qwen | $1.25 | 13 מבחנים | |
| 4 | Claude Opus 5 | Anthropic | $5.00 | 1 מבחנים | |
| 5 | Gemini 3.1 Pro | Google DeepMind | $2.00 | 4 מבחנים | |
| 6 | Grok-4 Heavy | xAI | — | 4 מבחנים | |
| 7 | Claude Fable 5 | Anthropic | $10.00 | 2 מבחנים | |
| 8 | GLM-5.2 | Zhipu AI (GLM) | $0.75 | 6 מבחנים | |
| 9 | GLM-5.3 | Zhipu AI (GLM) | $1.20 | 1 מבחנים | |
| 10 | DeepSeek-V4-Pro-0813 | DeepSeek | $0.44 | 3 מבחנים | |
| 11 | Hy4 preview | Tencent | חופשי | 6 מבחנים | |
| 12 | Kimi K3 | Moonshot AI | $2.85 | 2 מבחנים | |
| 13 | Muse Spark 1.1 | Meta AI | $1.25 | 1 מבחנים | |
| 14 | Seed 2.1 Pro | Bytedance | — | 11 מבחנים | |
| 15 | DeepSeek-V4-Pro-Max | DeepSeek | $1.30 | 7 מבחנים | |
| 16 | Claude Opus 4.6 | Anthropic | $5.00 | 4 מבחנים | |
| 17 | Seed 2.1 Turbo | Bytedance | — | 11 מבחנים | |
| 18 | Qwen3.7-Plus | Alibaba Qwen | — | 12 מבחנים | |
| 19 | Muse Spark | Meta AI | — | 1 מבחנים | |
| 20 | Claude Opus 4.8 | Anthropic | $5.00 | 2 מבחנים |
שלישייה מובילה — ראייה ומולטימודל
🥇 #1
קנייני
2
Claude Fable 5.1
Anthropic
$ / 1M
$10.00/M
TrueSkill
41.8
🥈 #2
קנייני
6
GPT-6 Astra
OpenAI
$ / 1M
$10.00/M
TrueSkill
41.8
🥉 #3
קנייני
5
Claude Mythos Preview
Anthropic
$ / 1M
—
TrueSkill
39.3
| # | מודל | חברה | TrueSkill | $ / 1M | בנצ׳מרקים |
|---|---|---|---|---|---|
| 1 | Claude Fable 5.1 | Anthropic | $10.00 | 2 מבחנים | |
| 2 | GPT-6 Astra | OpenAI | $10.00 | 6 מבחנים | |
| 3 | Claude Mythos Preview | Anthropic | — | 5 מבחנים | |
| 4 | Claude Opus 5 | Anthropic | $5.00 | 2 מבחנים | |
| 5 | Qwen3.8 Max | Alibaba Qwen | $1.65 | 11 מבחנים | |
| 6 | GPT-5.6 Sol | OpenAI | $5.00 | 7 מבחנים | |
| 7 | Claude Opus 4.8 | Anthropic | $5.00 | 5 מבחנים | |
| 8 | Kimi K3 | Moonshot AI | $2.85 | 8 מבחנים | |
| 9 | Claude Fable 5 | Anthropic | $10.00 | 3 מבחנים | |
| 10 | GPT-5.5 | OpenAI | $5.00 | 5 מבחנים | |
| 11 | Muse Spark 1.1 | Meta AI | $1.25 | 4 מבחנים | |
| 12 | Seed 2.1 Pro | Bytedance | — | 39 מבחנים | |
| 13 | Gemini 3.8 Flash | Google DeepMind | $0.75 | 4 מבחנים | |
| 14 | Qwen3.8-Flash-Next | Alibaba Qwen | חופשי | 11 מבחנים | |
| 15 | Qwen3.8 Flash | Alibaba Qwen | $0.15 | 11 מבחנים | |
| 16 | Claude Sonnet 5 | Anthropic | $2.00 | 6 מבחנים | |
| 17 | GLM-5.3 | Zhipu AI (GLM) | $1.20 | 1 מבחנים | |
| 18 | Qwen3.8-27B | Alibaba Qwen | $0.40 | 13 מבחנים | |
| 19 | Claude Opus 4.7 | Anthropic | $5.00 | 3 מבחנים | |
| 20 | Gemini 3.7 Flash | Google DeepMind | $0.75 | 4 מבחנים |
מתודולוגיה
כיצד נמדדים המודלים?
דירוג TrueSkill המתחשב בציון אבסולוטי וודאות סטטיסטית, מתוך אלפי הרצות במבחנים מורכבים.
SWE-Bench
בדיקת פיתוח תוכנה אמיתי: תיקון באגים, כתיבת בדיקות וסגירת Issues ב-GitHub.
קודHLE
המבחן האקדמי המאתגר בעולם — שאלות ברמת דוקטורט בשיתוף מאות חוקרים.
חשיבהBrowseComp
מבחן עומק לסוכנים אוטונומיים: פעולות מרובות שלבים, Tool Calling והסקה מורכבת.
סוכניםAIME 2025
תחרויות מתמטיקה עולמיות — פתרון שלם והוכחה פורמלית ללא ניחוש.
מתמטיקה