Visas sistēmas darbojas Tavs IP: 216.73.217.113 info@cloudhosting.lv +371 66 66 29 69 Klientu zona

← Visi jautājumi

OpenClaw un Ollama: darbini lokālus modeļus

Atjaunināts:

OpenClaw var strādāt pilnībā uz lokāla modeļa: uzinstalē Ollama, lejupielādē modeli, kas atbalsta rīku izsaukšanu (tool calling), un norādi OpenClaw uz Ollama natīvo galapunktu portā 11434 ar provaidera iestatījumu api: "ollama". Noteikums, uz kura paklūp lielākā daļa, ir oficiālajā dokumentācijā: Ollama gadījumā neizmanto ar OpenAI saderīgo /v1 URL, jo tas salauž rīku izsaukšanu un modelis sāk drukāt neapstrādātu rīka izsaukuma JSON kā tekstu. 9B klases modelis, piemēram, qwen3.5:9b vai gemma4, ietilpst 12-16 GB GPU un dod tev privātu asistentu ar nulles izmaksām par katru ziņu; uz datora tikai ar CPU tas strādā, bet nāksies pagaidīt.

Kāpēc darbināt OpenClaw uz lokāla modeļa

OpenClaw ir personīgā AI aģenta vārteja (gateway): tā atrodas starp ziņapmaiņas lietotni (mūsu uzstādījumā Telegram) un LLM un modeļa vārdā izpilda rīkus, piemēram, čaulas komandas, pārlūku vai MCP serverus. Norādi to uz Ollama, un katra uzvedne, fails un rīka rezultāts paliek uz aparatūras, kuru kontrolē tu, bez maksas par tokeniem un bez provaidera limitiem. Cena ir spējas: modelis, kas ietilpst vienā GPU, ir visvājākais tieši tajā, kas aģentu padara par aģentu, proti, rīka izvēlē un pareizi noformēta izsaukuma sagatavošanā.

1. solis: uzinstalē Ollama un lejupielādē modeli ar rīku atbalstu

Uz Linux oficiālais instalētājs iestata Ollama kā systemd servisu uz 127.0.0.1:11434:

curl -fsSL https://ollama.com/install.sh | sh
ollama pull qwen3.5:9b
curl http://localhost:11434/api/tags

Pēdējā komanda parāda modeļus uz diska; ja tā atbild, dēmons darbojas. Ollama ir pieejama arī kā Docker attēls: docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama, NVIDIA kartēm pievienojot --gpus=all, bet AMD gadījumā izmantojot tagu ollama/ollama:rocm kopā ar --device /dev/kfd --device /dev/dri.

Modeļa izvēle ir vissvarīgākā. OpenClaw iestatīšanas lapa nosaka minimumu: rīku atbalsts un vismaz 16K tokenu konteksts. Pašas Ollama OpenClaw integrācijas lapa lokāliem modeļiem iesaka vismaz 64K. Katra Ollama bibliotēkas lapa rāda spēju emblēmas; meklē "tools" (ollama.com/search var filtrēt pēc tās). Uz 2026. gada septembri gan qwen3.5 (redze, rīki, domāšana), gan gemma4 (redze, rīki, domāšana, audio) atbilst prasībām; gemma4 ir noklusējums, ko iesaka OpenClaw iestatīšanas lapa. Modelis bez rīku emblēmas lieliski tērzē un klusi atsaka tajā brīdī, kad OpenClaw tam prasa kaut ko izpildīt.

2. solis: norādi OpenClaw uz Ollama (natīvais API, nevis /v1)

Kad Ollama un vārteja atrodas uz vienas mašīnas, ātrākais ceļš ir automātiskā atklāšana (discovery):

export OLLAMA_API_KEY="ollama-local"
openclaw models list --provider ollama
openclaw models set ollama/qwen3.5:9b
openclaw models status

Saskaņā ar modeļu atklāšanas dokumentāciju, ja ir iestatīts OLLAMA_API_KEY un nav neviena eksplicīta provaidera bloka, OpenClaw vaicā http://127.0.0.1:11434, nolasa katalogu no /api/tags un ar /api/show katram modelim noskaidro konteksta logu un tā redzes, rīku un domāšanas karodziņus. Vērtība ollama-local ir vietturis lokāliem vai LAN hostiem; dokumentācija saka, ka tur der jebkura vērtība.

Visam, kas pārsniedz noklusējumu (cits hosts, fiksēts konteksts, taimauti), deklarē provaideru eksplicīti failā ~/.openclaw/openclaw.json. Dokumentācija šo failu lasa kā JSON5, tāpēc parasts JSON kā blokā zemāk vienmēr tiek pieņemts. Šis bloks seko oficiālajai receptei:

{
  "models": {
    "providers": {
      "ollama": {
        "baseUrl": "http://127.0.0.1:11434",
        "apiKey": "ollama-local",
        "api": "ollama",
        "timeoutSeconds": 300,
        "maxTokens": 8192,
        "models": [
          {
            "id": "qwen3.5:9b",
            "name": "qwen3.5:9b",
            "reasoning": true,
            "input": ["text"],
            "contextTokens": 32768,
            "params": { "num_ctx": 32768, "thinking": false, "keep_alive": "15m" }
          }
        ]
      }
    }
  },
  "agents": {
    "defaults": {
      "model": { "primary": "ollama/qwen3.5:9b" }
    }
  }
}

Svarīgas ir trīs detaļas. Pirmkārt, baseUrl nav /v1 sufiksa. Ollama gan piedāvā ar OpenAI saderīgu galapunktu, un vairums trešo pušu pamācību to izmanto, bet OpenClaw dokumentācija ir nepārprotama: /v1 ieslēdz ar OpenAI saderīgo režīmu, kurā rīku izsaukšana ir nestabila un modeļi var izvadīt neapstrādātu rīka izsaukuma JSON kā tekstu. Natīvais režīms runā ar Ollama /api/chat, kas straumēšanu un rīku izsaukšanu apstrādā kopā. Otrkārt, netukšs models saraksts atslēdz atklāšanu, tāpēc uzskaiti katru modeli, ko vēlies. Treškārt, atsauces uz modeļiem ir formā provider/model: ollama/qwen3.5:9b.

Vārteja daudzas konfigurācijas izmaiņas piemēro uzreiz, bet dokumentācija saka, ka dažām vajadzīga restartēšana, tāpēc pēc provaidera maiņas to restartē (mūsu uzstādījumos tā darbojas kā ghcr.io/openclaw/openclaw konteiners). Tad pārbaudi visu ķēdi ar pārbaudes komandu no lokālo modeļu dokumentācijas:

openclaw infer model run --gateway --model ollama/qwen3.5:9b --prompt "Reply with exactly: pong" --json

Kuri modeļi ietilpst kādā RAM un VRAM

Lejupielādes izmēri un citētie VRAM skaitļi ņemti no Ollama bibliotēkas un Ollama OpenClaw integrācijas lapas, 2026. gada septembris; kolonna "reāls mājas dators" ir mūsu aplēse pēc šiem skaitļiem. Lejupielādes izmērs ir kvantizētais svaru fails; tev vajag tik daudz atmiņas plus vietu kontekstam, un 32K-64K konteksts 9B modelim pievieno vairākus gigabaitus.

Modeļa tagsLejupielādeReāls mājas datorsPiezīmes
qwen3.5:4b3.4 GB8 GB RAM, CPU vai mazs GPURīku emblēma; tērzēšana un vienkāršas komandas
qwen3.5:9b6.6 GB12-16 GB VRAM (Ollama norāda ap 11 GB)Mūsu noklusējums lokāliem aģentiem; rīki, domāšana, redze
gemma4 (e4b)9.6 GB16 GB VRAM (Ollama norāda ap 16 GB)OpenClaw ieteiktais noklusējums; rīki, domāšana, redze, audio
gemma4:12b7.6 GB16 GB VRAM256K natīvais konteksts
qwen3.5:27b17 GB24 GB VRAM vai vairākLabāka rīku disciplīna; vajag īstu GPU mašīnu
qwen3.5:35b / gemma4:31b20-24 GB32 GB VRAM vai divi GPUDarbstacija vai dedicēts AI serveris

Divas pārbaudes. ollama ps rāda kolonnu PROCESSOR: "100% GPU" nozīmē, ka viss modelis atrodas VRAM, jaukts skaitlis nozīmē, ka tas sadalīts ar sistēmas RAM un ātrums krīt strauji. Un OpenClaw lokālo modeļu dokumentācija brīdina, ka modelis, kas atbild uz īsu uzvedni, joprojām var izgāzties aģenta gājienā; testē ar reālu uzdevumu.

Kur darbojas Ollama: tā pati VM vai atsevišķa GPU mašīna

Tā pati VM, tikai CPU. Lētākais variants; 4B-9B modelis ar mazu kontekstu strādā, bet rēķinies ar atbildēm desmitos sekunžu un ar rīkiem piesātinātiem gājieniem minūtēs, atkarībā no CPU. Der, lai apgūtu steku, pirms maksāt par GPU laiku. Vienas lamatas, kad vārteja darbojas Docker, kā pie mums: konteinera iekšienē 127.0.0.1 ir pats konteiners, nevis VM, tāpēc http://127.0.0.1:11434 saņem "connection refused"; Ollama problēmu novēršanas lapa OpenClaw dokumentācijā min tieši šo gadījumu, baseUrl, kas norāda uz localhost, kamēr vārteja darbojas Docker vai uz cita hosta. Vai nu darbini Ollama kā otru konteineru tajā pašā Docker tīklā un uzrunā to pēc nosaukuma, vai piesaisti Ollama adresei, kas nav loopback, kā Ollama FAQ apraksta systemd gadījumā:

sudo systemctl edit ollama.service
# add under [Service]:
Environment="OLLAMA_HOST=0.0.0.0:11434"
sudo systemctl daemon-reload && sudo systemctl restart ollama

Lokālam Ollama dēmonam nav iebūvētas autentifikācijas (tāpēc OpenClaw viettura atslēga nekad netiek pārbaudīta), tāpēc, ja piesaisti to visām saskarnēm, ar ugunsmūri atļauj portu 11434 tikai vārtejas hostam. Nekad neatver to, tāpat kā OpenClaw vārtejas portu, internetam: vārtejai jau ir bijusi viena klikšķa attālinātas koda izpildes ievainojamība (CVE-2026-25253).

Atsevišķa GPU mašīna lokālajā tīklā. Tieši šādu formu rāda OpenClaw receptes: vārteja uz mazas, vienmēr ieslēgtas VM, inference uz mašīnas ar īstu GPU. Iestati baseUrl uz to hostu, palielini timeoutSeconds, lai auksta ielāde nebeigtos ar taimautu, un fiksē keep_alive, lai modelis paliktu atmiņā (Ollama pēc noklusējuma to izlādē pēc 5 minūtēm). Dokumentācija pat rāda divus Ollama provaiderus vienlaikus, ollama-fast uz mazas mašīnas un ollama-large uz GPU mašīnas kā rezerves variantu. Ja tev nav sava GPU, īrēts ar 16-24 GB VRAM nosedz 9B-27B diapazonu; skati mūsu AI serverus un kādu serveri izvēlēties lokālam AI modelim.

Konteksta logs: iestatījums, ko visi palaiž garām

Ollama noklusētais konteksta garums ir 4096 tokeni. Ar to pietiek tērzēšanai un nepietiek aģentam: OpenClaw sistēmas uzvedne, rīku definīcijas un vēsture vien var to pārsniegt, un tad modelis zaudē gājiena sākumu un rīku lietošana pasliktinās. OpenClaw minimums ir 16K; Ollama OpenClaw lapa iesaka 64K. Palielini to globāli ar OLLAMA_CONTEXT_LENGTH=32768 Ollama servisa vidē vai katram modelim atsevišķi failā openclaw.json kā augstāk, kur contextTokens ierobežo to, ko sūta OpenClaw, un params.num_ctx pasaka Ollama, cik daudz piešķirt (ja num_ctx nav norādīts, OpenClaw to atvasina no contextTokens, kā teikts padziļināto iestatījumu lapā). Konteksts maksā atmiņu, tāpēc uz fiksēta GPU tieši šo regulatoru tu maini pret modeļa izmēru.

Latentums un kvalitāte salīdzinājumā ar mitinātiem API

Mitinātie modeļi uzvar tīrajās spējās un laikā līdz pirmajam tokenam. 9B lokālais modelis uzvar privātumā, izmaksās pie apjoma un paredzamībā: nav limitu, nav novecojušu versiju atslēgšanas, nav rēķina par nekontrolēti aizgājušu ciklu. Kur tas zaudē, ir pati aģenta slodze; OpenClaw lokālo modeļu lapa brīdina par nepareizi noformētiem rīku izsaukumiem un pārāk lielām uzvednēm pilnos aģenta gājienos. Divi dokumentēti risinājumi: ieslēdz Tool Search (tools.toolSearch: { "mode": "tools" }), lai modelis rīku shēmas redz pēc pieprasījuma, un kā pēdējo līdzekli provaideram iestati compat.supportsTools: false, lai šis modelis kļūtu par parastu tērzēšanas botu.

Viegli palaist garām arī to, ka lokāliem modeļiem nav mitināto provaideru drošības filtru. Dokumentācija saka, ka rīku atļaujas un aizsardzība pret uzvedņu injekcijām jātur modelim atbilstošā līmenī: allowFrom ierobežots uz īpašnieku, rīki ierobežoti katram sūtītājam un smilškaste visam, kas kaut ko izpilda.

Lokāla modeļa apvienošana ar mitinātu

OpenClaw atbalsta provaiderus katram aģentam atsevišķi, tāpēc "lēts lokālais modelis tērzēšanai, mitināts modelis grūtiem uzdevumiem" ir sasniedzams kā manuāls dalījums, nevis automātisks grūtības maršrutētājs. Trīs dokumentēti veidi:

Rezerves ķēde. agents.defaults.model.fallbacks tiek izmēģināti pēc kārtas, kad primārais neizdodas. Lokāls primārais, mitināts rezervē: mitinātā atslēga tiek tērēta tikai tad, kad lokālā mašīna ir nost. Noturība, nevis maršrutēšana.

Modeļi katram aģentam. Zem agents.entries katram aģentam ir savs model, un piesaistes (bindings) kanālus, kontus vai konkrētus sarunbiedrus kartē uz aģentiem. Minimāls dalījums (modeļu id kā OpenClaw dokumentācijā; izmanto to, ko piedāvā tavs mitinātais konts):

{
  "agents": {
    "entries": {
      "chat": { "default": true, "model": "ollama/qwen3.5:9b" },
      "work": { "model": "anthropic/claude-sonnet-4-6",
                "tools": { "allow": ["exec", "read", "write"] } }
    }
  },
  "bindings": [
    { "agentId": "work", "match": { "channel": "telegram", "accountId": "work-bot" } }
  ]
}

Vairāku aģentu lapa dokumentē match laukus un to prioritāti (vispirms precīzs sarunbiedrs, tad konts un kanāls, līdz noklusētajam aģentam) un rāda tieši šo shēmu Telegram gadījumā: viens bots katram aģentam, kas tiek atlasīts pēc channel: "telegram" plus accountId, kas definēts zem channels.telegram.accounts. Tātad: viens bots uz lokālā aģenta ikdienas jautājumiem, otrs uz mitinātā aģenta ar ieslēgtu exec.

Pārslēgšana sarunā. Tērzēšanas komanda /model maina modeli uzreiz: /model ollama/qwen3.5:9b -s fiksē to pašreizējai sesijai, -a atjaunina aģenta noklusējumu, bet -g globālo noklusējumu (abi tikai īpašniekam). Aizstājvārdi zem agents.defaults.models ļauj rakstīt /model local vai /model big.

Problēmu novēršanas kontrolsaraksts

  • Connection refused: ollama serve, tad curl http://localhost:11434/api/tags; no attālas vārtejas openclaw gateway status --deep. Pārbaudi ugunsmūrus un Docker loopback lamatas.
  • Rīku izsaukumi parādās kā parasts teksts: tu esi uz /v1. Noņem sufiksu un iestati "api": "ollama".
  • Nav pieejamu modeļu: lejupielādē modeli vai uzskaiti to zem models.providers.ollama.models.
  • Lēna pirmā atbilde: timeoutSeconds 300 un keep_alive 15m.
  • Dīvainas atbildes garās sarunās: maxTokens 8192, contextTokens un num_ctx 32768, un ar ollama ps pārliecinies, ka modelis pilnībā ir uz GPU.
  • Vispārēja veselība: openclaw doctor --fix.

Ja vēlies izlaist vārtejas instalēšanu un sākt uzreiz ar šī raksta 1. soli, mūsu gatavais OpenClaw serveris (no 9.35 EUR mēnesī) nāk ar Docker iepriekš uzinstalētu vārteju, piesaistītu tavam Telegram kontam, ar rīkiem smilškastē; Ollama pievienošana tad ir konfigurācijas bloks augstāk. Plašākai izmaksu ainai skati paša mitināta AI izmaksas pret API.

Jautājumi

Vai ar OpenClaw var izmantot Ollama ar OpenAI saderīgo /v1 galapunktu?

OpenClaw dokumentācija saka, ka nevajag. Ceļš /v1 pārslēdz provaideru ar OpenAI saderīgajā režīmā, kurā rīku izsaukšana ir nestabila un modelis var drukāt rīka izsaukuma JSON kā tekstu. Izmanto baseUrl bez /v1 un "api": "ollama".

Ar kuru lokālo modeli sākt?

12-16 GB GPU gadījumā ar qwen3.5:9b vai gemma4; abiem ir rīku emblēma, un abi nosaukti OpenClaw un Ollama dokumentācijā. Uz datora tikai ar CPU sāc ar qwen3.5:4b un 16K kontekstu, lai redzētu, vai latentums ir pieņemams, pirms pirkt GPU laiku.

Vai OpenClaw automātiski sūta vieglos jautājumus lokālajam modelim un grūtos mitinātam API?

Nē. Dokumentētie mehānismi ir rezerves ķēde (mitinātais modelis tiek lietots tikai tad, kad lokālais neizdodas), modeļi katram aģentam ar kanālu vai sarunbiedru piesaistēm un komanda /model pārslēgšanai sesijas ietvaros. Gudrāku maršrutēšanu būvē pats virs tā, piemēram, otru botu, kas piesaistīts mitinātajam aģentam.

Kāpēc modelis, kas labi tērzē, salūst, kad OpenClaw lieto rīkus?

Parasti viens no trim iemesliem: modelim nav rīku spējas, konteksts ir Ollama noklusētajos 4096, tāpēc rīku shēmas izstumj sarunu no atmiņas, vai provaideris ir uz /v1 ceļa. Labo tos pēc kārtas; ja mazs modelis joprojām veido nepareizi noformētus izsaukumus, ieslēdz Tool Search vai iestati compat.supportsTools: false.

Gribat, lai tas darbojas privāti?
AI asistents uz sava servera ES, un dati paliek tur, kur jūs tos nolikāt.
Apskatīt cenas

Gatavs sākt?

Palaid dažās minūtēs vai aprunājies ar inženieri par piemērotāko risinājumu.