chore: update docs/HANDOFF-LOCAL-LLM-GITEA-MCP.md via opax-mcp
Some checks are pending
Check Python Version Consistency / Check Python Version (push) Waiting to run

This commit is contained in:
chris 2026-07-22 01:32:05 +00:00
parent 0f786c781b
commit ca63a3a26e

View File

@ -7,7 +7,7 @@ Denne handoffen er det eneste autoritative arbeidsdokumentet for sporet "lokal L
--- ---
## FREMDRIFT OPPDATERT 2026-07-22 00:55 CEST ## FREMDRIFT OPPDATERT 2026-07-22 03:29 CEST
### ✅ FASE 05 — FERDIG ### ✅ FASE 05 — FERDIG
### ✅ FASE 6 CPU-optimalisering — FERDIG ### ✅ FASE 6 CPU-optimalisering — FERDIG
@ -15,14 +15,83 @@ Denne handoffen er det eneste autoritative arbeidsdokumentet for sporet "lokal L
### ✅ DNS NS-bytte utført — FERDIG 2026-07-21 23:44 CEST ### ✅ DNS NS-bytte utført — FERDIG 2026-07-21 23:44 CEST
### ✅ OPAX-MCP GITEA_URL permanent + deploy — FERDIG 2026-07-21 23:53 CEST ### ✅ OPAX-MCP GITEA_URL permanent + deploy — FERDIG 2026-07-21 23:53 CEST
### ✅ SMOKE-TEST Alle 37 tools — FERDIG 2026-07-22 00:25 CEST ### ✅ SMOKE-TEST Alle 37 tools — FERDIG 2026-07-22 00:25 CEST
### ✅ FASE 6.5 VM-oppgradering + modellarkitektur — VERIFISERT 2026-07-22
### ⏳ GPG-SIGNERING Commits verified — PÅGÅR ### ⏳ GPG-SIGNERING Commits verified — PÅGÅR
### ⏳ FASE 7 Lokal hjerne / derivat-modell — PLANLAGT ### ⏳ FASE 7 Lokal hjerne / derivat-modell — PLANLAGT
### ⏳ FASE 8 Backup / snapshot-strategi — PLANLAGT ### ⏳ FASE 8 Backup / snapshot-strategi — PLANLAGT
--- ---
## FASE 6.5 — OPPDATERT LOKAL LLM-STACK (2026-07-22)
### Bekreftet drift
- `gitea-cpu-vm` er oppe i `us-central1-b`
- VM kjører nå på `e2-highmem-4` (4 vCPU / 32 GB RAM)
- Statisk IP beholdt: `34.170.51.84`
- Gitea svarer på port `3000`
- Ollama svarer på port `11434`
### Bekreftet ressursstatus
- Disk: ca. 99 GB total, ca. 74 GB ledig
- Ollama-modeller bruker ca. 13 GB
- Systemet er komfortabelt i idle og har god RAM-headroom for videre modelltesting
### Faktisk modeller lokalt per 2026-07-22
- `gemma3:4b`
- `gemma3:12b`
- `qwen2.5:3b`
### Ny anbefalt modellarkitektur
- **Frontmodell:** `gemma3:4b`
- Brukes for raske svar, enkel resonnering og billig default
- **Standard agent/tool-modell:** `qwen2.5:14b`
- Brukes når oppgaven trenger tool calling, bedre struktur og høyere kvalitet
- **Kode-/repo-modell:** `qwen2.5-coder:14b`
- Brukes for repo-forståelse, patching, refaktorering, debugging og tyngre dev-assistanse
- **Valgfri tung resonneringsmodell later:** `gemma3:27b`
- Kun ved behov, etter praktisk validering av RAM, lastetid og latency
### Operativ ruting
1. Start med `gemma3:4b`
2. Eskaler til `qwen2.5:14b` når tools, struktur eller mer resonnering trengs
3. Eskaler til `qwen2.5-coder:14b` når oppgaven er tydelig kode- eller repo-orientert
4. Test `gemma3:27b` kun som valgfri tung modell, ikke som default
### Viktige vurderinger
- `qwen2.5-coder:32b` vurderes foreløpig som mulig for tung på nåværende oppsett og utsettes
- Nåværende strategi er gradvis oppskalering av modellstack, ikke ny VM-oppgradering
- Fokus er å validere praktisk responstid, RAM-bruk og stabilitet før større modellvalg fryses
### Neste konkrete steg
- Last ned:
- `qwen2.5:14b`
- `qwen2.5-coder:14b`
- Test:
- enkel chat-latency
- tool calling
- repo-/kodeoppgaver
- RAM- og diskpåvirkning
```bash
# Last ned neste lag
ollama pull qwen2.5:14b
ollama pull qwen2.5-coder:14b
# Bekreft etter nedlasting
curl http://localhost:11434/api/tags
df -h /
du -sh /usr/share/ollama/.ollama/models
```
---
## LÅST SYSTEMKONFIGURASJON GITEA-CPU-VM (komplett) ## LÅST SYSTEMKONFIGURASJON GITEA-CPU-VM (komplett)
### VM-spesifikasjon (oppdatert 2026-07-22)
- **Maskintype:** `e2-highmem-4` (4 vCPU / 32 GB RAM)
- **Zone:** `us-central1-b`
- **Statisk IP:** `34.170.51.84`
### Systemd-dropins ### Systemd-dropins
``` ```
override.conf — OLLAMA_HOST=0.0.0.0:11434 override.conf — OLLAMA_HOST=0.0.0.0:11434
@ -125,19 +194,22 @@ Lokal stor modell ← Hjerne (lokal, gratis)
Emma gemma3:4b ← Lokal inferens (rask) Emma gemma3:4b ← Lokal inferens (rask)
``` ```
### Kandidatmodeller for CPU-VM (15 GB RAM) ### Kandidatmodeller for e2-highmem-4 (32 GB RAM) — oppdatert 2026-07-22
| Modell | RAM | Tok/s CPU | Agentevne | Vurdering | | Modell | RAM | Tok/s CPU | Agentevne | Vurdering |
|---|---|---|---|---| |---|---|---|---|---|
| `gemma3:4b` (nå) | 2.9 GB | ~5 | Svak | For svak som hjerne | | `gemma3:4b` (nå) | 2.9 GB | ~5 | Svak | Front/hurtig default |
| `gemma3:12b` | ~8 GB | ~1.52 | God | **Test dette først** | | `gemma3:12b` | ~8 GB | ~1.52 | God | Allsidig |
| `qwen2.5:14b` | ~9 GB | ~1.5 | Sterk | Alternativ | | `qwen2.5:14b` | ~9 GB | ~1.5 | Sterk | **Standard agent/tool — last ned nå** |
| `gemma3:27b` | ~17 GB | <1 | Tilnærmet god | Krever GPU | | `qwen2.5-coder:14b` | ~9 GB | ~1.5 | Kode-sterk | **Kode/repo — last ned nå** |
| `gemma3:27b` | ~17 GB | <1 | Tilnærmet god | Valgfri tung test etter 14B-laget |
| `qwen2.5-coder:32b` | ~20 GB | <1 | Svært sterk | Utsatt mulig for tung |
### Exit-kriterier Fase 7 ### Exit-kriterier Fase 7
- [ ] `gemma3:12b` installert og testet på CPU-VM - [ ] `qwen2.5:14b` installert og testet
- [ ] `qwen2.5-coder:14b` installert og testet
- [ ] Ytelsesmåling: tok/s, RAM-bruk, swap=0 - [ ] Ytelsesmåling: tok/s, RAM-bruk, swap=0
- [ ] Kvalitetstest: kan modellen planlegge og bruke tools? - [ ] Kvalitetstest: tool calling, kode- og repo-oppgaver
- [ ] GEMINI.md-lignende systemd-prompt/konfig for Emma laget - [ ] GEMINI.md-lignende systemd-prompt/konfig for Emma laget
- [ ] Beslutning: erstatter eller komplementerer? - [ ] Beslutning: erstatter eller komplementerer?
@ -211,10 +283,11 @@ gcloud compute disks create gitea-restore \
## ÅPNE PUNKTER ## ÅPNE PUNKTER
1. GPG-signering — få commits verified (pågår) 1. GPG-signering — få commits verified (pågår)
2. `git.vauco.no` — verifiser propagering 2. `git.vauco.no` — verifiser propagering
3. Fase 7: `gemma3:12b` test på CPU-VM 3. **Fase 6.5/7: Last ned `qwen2.5:14b` + `qwen2.5-coder:14b`** ← neste steg
4. Emma derivat-dokument (tilsvarende GEMINI.md) 4. Test: tool calling, kode-/repo-oppgaver, RAM/disk-påvirkning
5. Fase 8: Snapshot-policy aktiveres 5. Emma derivat-dokument (tilsvarende GEMINI.md)
6. Gitea passord byttes (eksponert i chat) 6. Fase 8: Snapshot-policy aktiveres
7. Gitea passord byttes (eksponert i chat)
## FASTE SANNHETER ## FASTE SANNHETER
- Gitea er source of truth - Gitea er source of truth
@ -233,8 +306,10 @@ gcloud compute disks create gitea-restore \
- ✅ Boot-warming verifisert - ✅ Boot-warming verifisert
- ✅ DNS migrert til Google Cloud DNS - ✅ DNS migrert til Google Cloud DNS
- ✅ Smoke-test alle 37 tools — FERDIG - ✅ Smoke-test alle 37 tools — FERDIG
- ✅ VM oppgradert til e2-highmem-4 (32 GB RAM) — FERDIG
- ⏳ `git.vauco.no` live — propagering pågår - ⏳ `git.vauco.no` live — propagering pågår
- ⏳ GPG-signering verified — pågår - ⏳ GPG-signering verified — pågår
- ⏳ `qwen2.5:14b` + `qwen2.5-coder:14b` lastet ned og testet — planlagt
- ⏳ Fase 7: lokal hjerne verifisert — planlagt - ⏳ Fase 7: lokal hjerne verifisert — planlagt
- ⏳ Fase 8: daglig snapshot-backup — planlagt - ⏳ Fase 8: daglig snapshot-backup — planlagt
@ -247,3 +322,4 @@ gcloud compute disks create gitea-restore \
| 2026-07-22 00:05 | Smoke-test plan klar, Fase 7 (lokal hjerne) lagt inn | | 2026-07-22 00:05 | Smoke-test plan klar, Fase 7 (lokal hjerne) lagt inn |
| 2026-07-22 00:25 | Smoke-test fullført — alle kategorier grønne | | 2026-07-22 00:25 | Smoke-test fullført — alle kategorier grønne |
| 2026-07-22 00:55 | Fase 8 (backup/snapshot) lagt inn, GPG-signering pågår | | 2026-07-22 00:55 | Fase 8 (backup/snapshot) lagt inn, GPG-signering pågår |
| 2026-07-22 03:29 | FASE 6.5 lagt inn: e2-highmem-4 verifisert, ny modellarkitektur (Gemma4b → Qwen14b → Qwen-coder-14b → Gemma27b), neste steg: pull qwen2.5:14b + qwen2.5-coder:14b |