GPU szerver LLM-hez
LLM GPU szerver választása weights, quantization, KV cache, context length, concurrency és latency alapján.
LLM esetén nem elég, hogy a weights beleférjen a VRAM-ba. Számold hozzá a precision/quantization hatását, runtime overheadet, KV cache-t, context length-et és a párhuzamos sessionöket. Ami egy tesztkérésnél elindul, productionben még lehet kevés.
A KV cache és concurrency is része a VRAM-tervnek
A helyi oldalak adnak modell- és GPU-példákat, de a production memóriaigényt ritkábban kezelik egységesen. A KV cache a context és a sessionök számával nő, ezért headroom kell.
A hosszú context megváltoztatja a kapacitást
Nagyobb context és több egyidejű kérés csökkentheti az egy GPU-n kiszolgálható felhasználók számát. Tesztelj a valós context és concurrency célokkal.
Mit ellenőrizz rendelés előtt?
- A GPU tényleges allokációját és a workload számára elérhető VRAM-ot.
- A CPU, RAM és storage egyensúlyát, hogy a GPU ne várjon adatra.
- Az operációs rendszert, drivert, frameworköt, containert és a szükséges hozzáférést.
- A használati időt, idle-t, storage-ot és adatátvitelt a teljes költségben.
- Ha magyar adatközpont, helyi számlázás vagy support fontos, ezt közvetlenül a providernél ellenőrizd.
Tesztelj reprezentatív workloadot
Ne minimális demo alapján méretezz. Productionhöz közeli inputtal mérd a VRAM-ot, futási időt, stabilitást és bottleneckeket. Hagyj tartalékot a normál terhelésváltozásra.
Gyakori kérdések
Kapcsolódó útmutatók
Ellenőrizd az elérhető GPU-opciókat
A rendelés előtt hasonlítsd össze a konfigurációt a workload, VRAM, software, allokáció és használati idő igényeivel.
GPU-opciók megtekintése