From ca63a3a26eaf043348304ae9e8a05e5b19e3752b Mon Sep 17 00:00:00 2001 From: chris Date: Wed, 22 Jul 2026 01:32:05 +0000 Subject: [PATCH] chore: update docs/HANDOFF-LOCAL-LLM-GITEA-MCP.md via opax-mcp --- docs/HANDOFF-LOCAL-LLM-GITEA-MCP.md | 100 ++++++++++++++++++++++++---- 1 file changed, 88 insertions(+), 12 deletions(-) diff --git a/docs/HANDOFF-LOCAL-LLM-GITEA-MCP.md b/docs/HANDOFF-LOCAL-LLM-GITEA-MCP.md index 59f2ff3..4d44658 100644 --- a/docs/HANDOFF-LOCAL-LLM-GITEA-MCP.md +++ b/docs/HANDOFF-LOCAL-LLM-GITEA-MCP.md @@ -7,7 +7,7 @@ Denne handoffen er det eneste autoritative arbeidsdokumentet for sporet "lokal L --- -## FREMDRIFT – OPPDATERT 2026-07-22 00:55 CEST +## FREMDRIFT – OPPDATERT 2026-07-22 03:29 CEST ### ✅ FASE 0–5 — FERDIG ### ✅ FASE 6 – CPU-optimalisering — FERDIG @@ -15,14 +15,83 @@ Denne handoffen er det eneste autoritative arbeidsdokumentet for sporet "lokal L ### ✅ DNS – NS-bytte utført — FERDIG 2026-07-21 23:44 CEST ### ✅ OPAX-MCP – GITEA_URL permanent + deploy — FERDIG 2026-07-21 23:53 CEST ### ✅ SMOKE-TEST – Alle 37 tools — FERDIG 2026-07-22 00:25 CEST +### ✅ FASE 6.5 – VM-oppgradering + modellarkitektur — VERIFISERT 2026-07-22 ### ⏳ GPG-SIGNERING – Commits verified — PÅGÅR ### ⏳ FASE 7 – Lokal hjerne / derivat-modell — PLANLAGT ### ⏳ FASE 8 – Backup / snapshot-strategi — PLANLAGT --- +## FASE 6.5 — OPPDATERT LOKAL LLM-STACK (2026-07-22) + +### Bekreftet drift +- `gitea-cpu-vm` er oppe i `us-central1-b` +- VM kjører nå på `e2-highmem-4` (4 vCPU / 32 GB RAM) +- Statisk IP beholdt: `34.170.51.84` +- Gitea svarer på port `3000` +- Ollama svarer på port `11434` + +### Bekreftet ressursstatus +- Disk: ca. 99 GB total, ca. 74 GB ledig +- Ollama-modeller bruker ca. 13 GB +- Systemet er komfortabelt i idle og har god RAM-headroom for videre modelltesting + +### Faktisk modeller lokalt per 2026-07-22 +- `gemma3:4b` +- `gemma3:12b` +- `qwen2.5:3b` + +### Ny anbefalt modellarkitektur +- **Frontmodell:** `gemma3:4b` + - Brukes for raske svar, enkel resonnering og billig default +- **Standard agent/tool-modell:** `qwen2.5:14b` + - Brukes når oppgaven trenger tool calling, bedre struktur og høyere kvalitet +- **Kode-/repo-modell:** `qwen2.5-coder:14b` + - Brukes for repo-forståelse, patching, refaktorering, debugging og tyngre dev-assistanse +- **Valgfri tung resonneringsmodell later:** `gemma3:27b` + - Kun ved behov, etter praktisk validering av RAM, lastetid og latency + +### Operativ ruting +1. Start med `gemma3:4b` +2. Eskaler til `qwen2.5:14b` når tools, struktur eller mer resonnering trengs +3. Eskaler til `qwen2.5-coder:14b` når oppgaven er tydelig kode- eller repo-orientert +4. Test `gemma3:27b` kun som valgfri tung modell, ikke som default + +### Viktige vurderinger +- `qwen2.5-coder:32b` vurderes foreløpig som mulig for tung på nåværende oppsett og utsettes +- Nåværende strategi er gradvis oppskalering av modellstack, ikke ny VM-oppgradering +- Fokus er å validere praktisk responstid, RAM-bruk og stabilitet før større modellvalg fryses + +### Neste konkrete steg +- Last ned: + - `qwen2.5:14b` + - `qwen2.5-coder:14b` +- Test: + - enkel chat-latency + - tool calling + - repo-/kodeoppgaver + - RAM- og diskpåvirkning + +```bash +# Last ned neste lag +ollama pull qwen2.5:14b +ollama pull qwen2.5-coder:14b + +# Bekreft etter nedlasting +curl http://localhost:11434/api/tags +df -h / +du -sh /usr/share/ollama/.ollama/models +``` + +--- + ## LÅST SYSTEMKONFIGURASJON – GITEA-CPU-VM (komplett) +### VM-spesifikasjon (oppdatert 2026-07-22) +- **Maskintype:** `e2-highmem-4` (4 vCPU / 32 GB RAM) +- **Zone:** `us-central1-b` +- **Statisk IP:** `34.170.51.84` + ### Systemd-dropins ``` override.conf — OLLAMA_HOST=0.0.0.0:11434 @@ -125,19 +194,22 @@ Lokal stor modell ← Hjerne (lokal, gratis) Emma gemma3:4b ← Lokal inferens (rask) ``` -### Kandidatmodeller for CPU-VM (15 GB RAM) +### Kandidatmodeller for e2-highmem-4 (32 GB RAM) — oppdatert 2026-07-22 | Modell | RAM | Tok/s CPU | Agentevne | Vurdering | |---|---|---|---|---| -| `gemma3:4b` (nå) | 2.9 GB | ~5 | Svak | For svak som hjerne | -| `gemma3:12b` | ~8 GB | ~1.5–2 | God | **Test dette først** | -| `qwen2.5:14b` | ~9 GB | ~1.5 | Sterk | Alternativ | -| `gemma3:27b` | ~17 GB | <1 | Tilnærmet god | Krever GPU | +| `gemma3:4b` (nå) | 2.9 GB | ~5 | Svak | Front/hurtig default | +| `gemma3:12b` | ~8 GB | ~1.5–2 | God | Allsidig | +| `qwen2.5:14b` | ~9 GB | ~1.5 | Sterk | **Standard agent/tool — last ned nå** | +| `qwen2.5-coder:14b` | ~9 GB | ~1.5 | Kode-sterk | **Kode/repo — last ned nå** | +| `gemma3:27b` | ~17 GB | <1 | Tilnærmet god | Valgfri tung — test etter 14B-laget | +| `qwen2.5-coder:32b` | ~20 GB | <1 | Svært sterk | Utsatt — mulig for tung | ### Exit-kriterier Fase 7 -- [ ] `gemma3:12b` installert og testet på CPU-VM +- [ ] `qwen2.5:14b` installert og testet +- [ ] `qwen2.5-coder:14b` installert og testet - [ ] Ytelsesmåling: tok/s, RAM-bruk, swap=0 -- [ ] Kvalitetstest: kan modellen planlegge og bruke tools? +- [ ] Kvalitetstest: tool calling, kode- og repo-oppgaver - [ ] GEMINI.md-lignende systemd-prompt/konfig for Emma laget - [ ] Beslutning: erstatter eller komplementerer? @@ -211,10 +283,11 @@ gcloud compute disks create gitea-restore \ ## ÅPNE PUNKTER 1. GPG-signering — få commits verified (pågår) 2. `git.vauco.no` — verifiser propagering -3. Fase 7: `gemma3:12b` test på CPU-VM -4. Emma derivat-dokument (tilsvarende GEMINI.md) -5. Fase 8: Snapshot-policy aktiveres -6. Gitea passord byttes (eksponert i chat) +3. **Fase 6.5/7: Last ned `qwen2.5:14b` + `qwen2.5-coder:14b`** ← neste steg +4. Test: tool calling, kode-/repo-oppgaver, RAM/disk-påvirkning +5. Emma derivat-dokument (tilsvarende GEMINI.md) +6. Fase 8: Snapshot-policy aktiveres +7. Gitea passord byttes (eksponert i chat) ## FASTE SANNHETER - Gitea er source of truth @@ -233,8 +306,10 @@ gcloud compute disks create gitea-restore \ - ✅ Boot-warming verifisert - ✅ DNS migrert til Google Cloud DNS - ✅ Smoke-test alle 37 tools — FERDIG +- ✅ VM oppgradert til e2-highmem-4 (32 GB RAM) — FERDIG - ⏳ `git.vauco.no` live — propagering pågår - ⏳ GPG-signering verified — pågår +- ⏳ `qwen2.5:14b` + `qwen2.5-coder:14b` lastet ned og testet — planlagt - ⏳ Fase 7: lokal hjerne verifisert — planlagt - ⏳ Fase 8: daglig snapshot-backup — planlagt @@ -247,3 +322,4 @@ gcloud compute disks create gitea-restore \ | 2026-07-22 00:05 | Smoke-test plan klar, Fase 7 (lokal hjerne) lagt inn | | 2026-07-22 00:25 | Smoke-test fullført — alle kategorier grønne | | 2026-07-22 00:55 | Fase 8 (backup/snapshot) lagt inn, GPG-signering pågår | +| 2026-07-22 03:29 | FASE 6.5 lagt inn: e2-highmem-4 verifisert, ny modellarkitektur (Gemma4b → Qwen14b → Qwen-coder-14b → Gemma27b), neste steg: pull qwen2.5:14b + qwen2.5-coder:14b |