Visas sistēmas darbojas Tavs IP: 216.73.217.36 info@cloudhosting.lv +371 66 66 29 69 Klientu zona

← Visi jautājumi

Kā izvēlēties serveri AI darbiem: kas tiešām ir svarīgi

Šī pamācība paskaidro, kā izvēlēties servera izmēru AI darbiem, nepārmaksājot. Pareizā atbilde pilnībā atkarīga no tā, ko tu darbini: ārējo API izsaukšana, aģentu hostēšana vai atvērto modeļu darbināšana uz sava dzelža, un starpība starp šiem variantiem ir 2 GB RAM pret GPU serveri. Tā rakstīta izstrādātājiem un sistēmu administratoriem, kam vajag strādājošus skaitļus, nevis modes vārdus.

Sāc ar darba slodzi, nevis ar dzelzi

AI serveris nav viena lieta. Praksē ir trīs atšķirīgas slodzes, katrai sava šaurā vieta:

  • Ārējo AI API izsaukšana: tavs kods sūta pieprasījumus uz hostētu modeli. Šaurā vieta ir tīkls un uzticamība.
  • Aģenti un automatizācijas: plānotāji, sarunu atmiņa, headless pārlūki, rindas. Šaurā vieta ir RAM un disks.
  • Atvērto modeļu pašhostēšana: inference uz sava CPU vai GPU. Šaurā vieta ir atmiņas caurlaidība un tīra skaitļošanas jauda.

Lielākā daļa izmēra kļūdu rodas, pērkot trešajam gadījumam, kad patiesībā esi pirmajā.

Ārējo API izsaukšana: der gandrīz jebkurš VPS

Ja tava aplikācija sūta pieprasījumus uz OpenAI, Anthropic vai līdzīgu pakalpojumu, smagā skaitļošana notiek viņu pusē. Tavs serveris dara HTTP, JSON un nedaudz rindu apstrādes. Mašīna ar 1-2 vCPU un 2 GB RAM mierīgi apstrādā tūkstošiem API izsaukumu dienā.

Kas šeit tiešām svarīgi:

  • Darbspējas laiks un stabils izejošais tīkls. Nestabils savienojums nozīmē kritušus webhook izsaukumus un dubultus atkārtojumus, kas tērē API tokenus divreiz.
  • Taimauti un atkārtojumu loģika. Modeļa atbilde var prasīt 30-120 sekundes. Iestati klienta taimautus atbilstoši un padari apstrādātājus idempotentus.
  • Ne latentums. Inferences laiks dominē: 40 ms papildu ceļa nav pamanāmi blakus 15 sekunžu ģenerācijai.

Ātra pārbaude no tava servera:

curl -o /dev/null -s -w "connect: %{time_connect}s  total: %{time_total}s\n" https://api.anthropic.com/

Aģenti un automatizācijas: RAM un disks piepildās pirmie

Aģentu steks uz papīra izskatās viegls, praksē smags. Python vai Node izpildvide, vektoru krātuve, Redis, datubāze un it īpaši headless pārlūki ātri summējas: viena headless Chromium instance viena pati aizņem 400 MB līdz 1 GB. Plāno 4-8 GB RAM un 2-4 vCPU nelielam produkcijas aģentu setapam, un vairāk, ja aģenti darbina pārlūka sesijas paralēli.

Disks piepildās klusi. Aģenti logo katru soli, glabā sarunu kontekstu un kešo lejupielādes. Aktīva automatizācija var ierakstīt vairākus GB logu mēnesī. Ņem 40-80 GB NVMe un konfigurē rotāciju jau pirmajā dienā:

free -h
du -sh /var/log /home/agent/.cache
journalctl --vacuum-size=500M

Swap ir vērts turēt kā apdrošināšanu pret OOM, bet, ja aģenti regulāri lieto swap, kāp uz augstāku RAM līmeni: konteksta swapošana darbības vidū liek aģentiem apstāties ar taimautu neglītos, grūti atkļūdojamos veidos.

Mazu atvērto modeļu pašhostēšana uz CPU

Modeļus ar 3-8B parametriem vari darbināt uz VPS bez GPU, izmantojot llama.cpp vai Ollama. Divas lietas izšķir, vai tas ir lietojami: RAM un AVX atbalsts.

Kvantizācijas pamati. Modeļa svari parasti glabājas 16 bitos. Kvantizācija tos glabā 4-5 bitos ar nelielu kvalitātes zudumu, samazinot RAM vajadzību aptuveni četras reizes. Ierastais zelta vidusceļš ir Q4_K_M. Īkšķa likums: Q4 modelim vajag apmēram 0.7 GB RAM uz miljardu parametru, plus 1-2 GB operētājsistēmai un kontekstam. 8B modelis tātad grib ap 7-8 GB kopā, tāpēc 16 GB plāns to darbina ar rezervi.

Vispirms pārbaudi CPU. Bez AVX2 inference strādā, bet mokoši:

grep -o 'avx[0-9_]*' /proc/cpuinfo | sort -u

Gaidi godīgus skaitļus: uz 4-8 moderniem vCPU ar AVX2 7-8B Q4 modelis ģenerē aptuveni 3-8 tokenus sekundē. Tas der fona kopsavilkumiem, klasifikācijai vai tādu datu apstrādei, kas nedrīkst pamest tavu infrastruktūru. Interaktīvam čatam ar gaidošiem lietotājiem tas ir par lēnu. Notestē piecās minūtēs:

curl -fsSL https://ollama.com/install.sh | sh
ollama run llama3.1:8b "Apkopo šo vienā teikumā: ..."

Izmēru špikeris

Skaitļi, kas praksē strādā, pa slodzēm:

Slodze                           vCPU   RAM      Disks      Piezīmes
Tikai API izsaukumi              1-2    2 GB     20 GB      tīkla uzticamība pirmajā vietā
Aģenti un automatizācijas        2-4    4-8 GB   40-80 GB   NVMe, logu rotācija
1-3B modelis, Q4 kvantizēts      4      8 GB     40 GB      nepieciešams AVX2
7-8B modelis, Q4 kvantizēts      6-8    16 GB    60 GB      3-8 tokeni/s, fona darbi
13B+ vai interaktīva inference   GPU serveris vai ārējais API

Šie skaitļi pieņem, ka modelis ir mašīnas galvenais īrnieks. Ja tā pati mašīna darbina arī tavu aplikāciju un datubāzi, pieskaiti to prasības klāt, nevis dali resursus.

Kad GPU serveris vai API godīgi ir lētāks

Izrēķini, pirms pērc dzelzi. Mazi hostētie modeļi maksā ap 0.1-0.5 EUR par miljonu tokenu. Ja apstrādā mazāk par aptuveni 1 miljonu tokenu dienā, API rēķins ir daži EUR mēnesī: neviens noīrējams serveris to nepārspēj. CPU pašhostēšana uzvar tikai tad, ja datiem jāpaliek tavā infrastruktūrā, vai ja tev ir vienmērīgs partiju apjoms un latentumam nav nozīmes.

GPU ir jēga, kad vajag modeļus virs 13B, interaktīvu latentumu, fine-tuning vai noturīgu caurlaidību, kas API izmaksātu simtiem EUR mēnesī. Āķis ir noslodze: GPU, kas strādā 2 stundas dienā, ir dārgs, un ekonomika strādā tikai tad, kad tas iet tuvu pilnai jaudai, tāpēc vai nu konsolidē slodzes uz tā, vai paliec pie API.

Saprātīgs ceļš: sāc ar VPS API slodzēm un aģentiem, mēnesi mēri savu reālo tokenu apjomu un RAM lietojumu un tad pārej uz dedicēto serveri ar CPU vai GPU konfigurāciju, ko tavi mērījumi pamato. Izmērs pēc datiem sit izmēru pēc palaišanas dienas optimisma.

Gribi, lai to darām mēs?
AI aģenti. Tavs AI asistents Telegram, jau uzstādīts.
Uzzināt vairāk

Gatavs sākt?

Palaid dažās minūtēs vai aprunājies ar inženieri par piemērotāko risinājumu.