Rankingi Modeli LLM

Porównanie wydajności i możliwości lokalnych modeli językowych

Zaktualizowano: Styczeń 2026
PozycjaModelParametryBenchmarkWynik
1
Llama 3.3 70B
70BMMLU
93.8%
2
DeepSeek V3
671BMMLU
93.2%
3
Qwen 2.5 72B
72BMMLU
92.4%
4
Mistral Large 3
128BMMLU
91.5%
5
Phi-4 14B
14BMMLU
88.9%
6
Llama 3.3 8B
8BMMLU
87.3%
7
Gemma 2 27B
27BMMLU
85.8%
8
Mistral 7B v0.4
7BMMLU
83.1%

Kategorie według rozmiaru

Modele małe (< 10B parametrów)

  • • Phi-3 Mini (3.8B)
  • • Gemma 2 2B
  • • Llama 3.2 3B
  • • Qwen2.5 7B
Niskie wymagania sprzętowe

Modele średnie (10-30B parametrów)

  • • Llama 3.1 8B
  • • Gemma 2 9B
  • • Phi-3 Medium (14B)
  • • Mistral 7B v0.3
Optymalny stosunek jakości do rozmiaru

Modele duże (> 30B parametrów)

  • • Llama 3.1 70B
  • • Qwen2.5 72B
  • • Mistral Large 2 (123B)
Najwyższa jakość dla enterprise

Objaśnienia benchmarków

MMLU

Massive Multitask Language Understanding - test wiedzy ogólnej w 57 dziedzinach

HumanEval

Test umiejętności programowania - generowanie poprawnego kodu Python

GSM8K

Grade School Math - rozumowanie matematyczne na poziomie szkoły podstawowej

MGSM

Multilingual Grade School Math - matematyka w wielu językach

Potrzebujesz pomocy w wyborze odpowiedniego modelu?

Skontaktuj się z nami