Co jsem postavil

Chtěl jsem si postavit vlastní RAG, tedy systém, ve kterém AI při odpovídání čerpá z mých dokumentů. Zároveň mi nevyhovovala bezpečnostní omezení veřejných modelů, jako jsou Fable a Astra. Proto jsem chtěl modely provozovat lokálně a mít jejich nastavení pod kontrolou.

Vybral jsem dvě karty Intel Arc Pro: B70 s 32 GB a B60 s 24 GB paměti. Dohromady mají 56 GB VRAM, tedy paměti pro modely přímo na grafických kartách.

Sestavu doplňuje Ryzen 9 9900X, 64 GB RAM a 1TB SSD. Celý počítač stál v květnu 2026 100 331 Kč s DPH. Používám Windows 11 Pro.

Jak rychle to běží

Modely spouštím přes llama.cpp. Vyzkoušel jsem Vulkan a SYCL, dvě rozhraní pro výpočty na grafické kartě. Vulkan byl ve většině testů rychlejší. Největší rozdíl měl GPT OSS 20B: na B70 psal přes Vulkan 132 tokenů za sekundu, přes SYCL jen 56. Token je krátký úsek textu.

Pro představu, takhle rychle modely psaly odpovědi přes Vulkan:

ModelKartyTokenů za sekundu
GPT OSS 20BB70132
Qwen3 Coder 30BB70121
DeepSeek R1 Distill Llama 70BB70 + B6010

Velký model 70B se na jednu kartu nevešel. Ve zmenšené verzi Q4_K_M zabíral 39,6 GiB a přes obě karty fungoval. SYCL ho zvládl až rychlostí 11,6 tokenu za sekundu, ale pro běžné použití jsem zůstal u Vulkanu. Rychleji zpracovával zadání a nechával více volné paměti.

Co mě zdrželo

Windows ukazoval chybné údaje o připojení karet a jejich paměti. Skutečný stav jsem musel ověřit jinými nástroji a měřením.

Vulkan mezi spuštěními měnil pořadí zařízení. Jednou tak test omylem běžel na integrované grafice. Výběr karty podle názvu tenhle problém vyřešil. Starší PowerShell zase špatně odesílal českou diakritiku, takže jsem musel opravit kódování požadavků.

Závěr po prvním dni

Chat, pomoc s kódem i velký model přes obě karty fungují. Za celý den testování nedošlo k žádnému resetu ovladače. Nejvíc práce dalo nastavení a ověření, že program používá správnou kartu.

Pro moje použití se zatím nejlépe osvědčil Vulkan. Výsledky ale platí pro tuhle sestavu a verze softwaru.

Měřeno 28. 8. 2026 na Windows 11 26200.9168, s llama.cpp b10666 a ovladačem 32.0.101.8805. Benchmark měl 512 tokenů na vstupu, 128 na výstupu a pět opakování. Doplnil jsem ho testy skutečných konverzací.

Podrobné výsledky

Samotná B70: Vulkan a SYCL

Všechna čísla jsou v tokenech za sekundu. Čtení znamená zpracování zadání, psaní tvorbu odpovědi. Vyšší číslo znamená větší rychlost.

ModelSYCL čteníSYCL psaníVulkan čteníVulkan psaní
GPT OSS 20B (MXFP4)92956,41 697132,4
Qwen3 Coder 30B1 362114,21 698121,1
Qwen3 8B1 22483,41 43783,4
Qwen3.8 27B33622,036424,6
Qwen3 32B28522,934524,0

Model 70B přes obě karty

DeepSeek R1 Distill Llama 70B ve verzi Q4_K_M. Režim layer rozděluje mezi karty celé vrstvy modelu. Režim tensor rozděluje i výpočty uvnitř vrstev. Poměry 4:3 a 5:3 určují rozdělení práce mezi B70 a B60.

RežimČtení (tokenů/s)Psaní (tokenů/s)
SYCL layer, automaticky101,79,45
SYCL layer, 4:3101,49,45
SYCL layer, 5:3104,29,65
SYCL tensor118,711,62
Vulkan layer134,410,3
Vulkan tensor169,48,85

Pro běžné použití jsem vybral Vulkan layer. SYCL tensor psal rychleji, ale při kontextu 16 tisíc tokenů nechával na B60 jen asi 0,5 GiB volné paměti.

Kompletní sestava

Ceny jsou z faktur z května 2026, v korunách a zaokrouhlené na celé Kč.

KomponentaModelBez DPHS DPH
Grafická karta 1ASRock Intel Arc Pro B70 Creator, 32 GB25 48930 841
Grafická karta 2ASRock Intel Arc Pro B60 Creator, 24 GB15 12518 302
ProcesorAMD Ryzen 9 9900X6 7698 190
ChladičNoctua NH D15S2 0072 429
PaměťKingston FURY Beast RGB, 2×32 GB DDR5 6000 CL3614 54517 600
Základní deskaASRock X870E Taichi Lite7 8079 447
SSDSamsung 9100 PRO, 1 TB3 8834 699
ZdrojSeasonic Focus GX 1000, ATX 3.13 2683 954
SkříňFractal Design Meshify 2 XL4 0244 869
Celkem82 917100 331

Operační systém: Windows 11 Pro 25H2. Jeho cena není v součtu hardwaru zahrnutá.

Vnitřek počítače se dvěma kartami ASRock Intel Arc Pro a velkým chladičem Noctua nad nimi
Sestava ve skříni Fractal Design Meshify 2 XL. Dvě karty Intel Arc Pro B70 a B60, nad nimi chladič Noctua.