- 1
Sprawdź swój sprzęt
Otwórz /check, podaj ilość RAM i VRAM. Dowiesz się, jak duże modele realnie obsłużysz — zanim cokolwiek pobierzesz.
- 2
Zainstaluj narzędzie
- LM Studio — najprostszy start, graficzny interfejs, wyszukiwarka modeli (Windows/Linux/macOS).
- Ollama — jeden plik, model uruchamiasz jedną komendą w terminalu, świetny na Linuxa.
- llama.cpp — dla zaawansowanych: pełna kontrola nad parametrami, działa nawet na CPU.
- 3
Pobierz właściwy format
Do LM Studio i llama.cpp szukaj plików GGUF. Kwantyzacja Q4_K_M to dobry start: mniejsza pamięć, minimalna utrata jakości. Q8 oraz FP16 potrzebują wyraźnie więcej RAM i VRAM.
- 4
Dobierz okno kontekstu
Pamięć rośnie liniowo z kontekstem. 4 tys. tokenów starczy na rozmowę, 16–32 tys. na dokumenty. Więcej kontekstu = więcej RAM — zweryfikuj w kalkulatorze.
Ładowanie zawartości…