From 4c4b582e25af430ed365e30d0670d5f3e7e16c92 Mon Sep 17 00:00:00 2001 From: chris Date: Wed, 22 Jul 2026 02:19:45 +0000 Subject: [PATCH] chore: update docs/llm-stack.md via opax-mcp --- docs/llm-stack.md | 70 +++++++++++++++++++++++++++++++++++++++++++++++ 1 file changed, 70 insertions(+) create mode 100644 docs/llm-stack.md diff --git a/docs/llm-stack.md b/docs/llm-stack.md new file mode 100644 index 0000000..674ad46 --- /dev/null +++ b/docs/llm-stack.md @@ -0,0 +1,70 @@ +# LLM Stack — gitea-cpu-vm + +**Sist oppdatert:** 2026-07-22 04:19 CEST +**VM:** `gitea-cpu-vm` · `e2-highmem-4` (4 vCPU / 32 GB RAM) · `us-central1-b` +**Statisk IP:** `34.170.51.84` +**Ollama:** port `11434` · **Gitea:** port `3000` + +--- + +## Aktiv modellstack + +| Prioritet | Modell | Params | Disk | Capabilities | Rolle | +|---|---|---|---|---|---| +| 1 | `gemma3:4b` | 4.3B | 3.3 GB | completion | Frontmodell / rask default | +| 2 | `qwen2.5:3b` | 3.1B | 1.9 GB | completion, tools | Lett tool-/agentmodell | +| 3 | `qwen2.5:7b` | 7.6B | 4.7 GB | completion, tools | Standard mellomlag | +| 4 | `qwen2.5-coder:7b` | 7.6B | 4.7 GB | completion, tools, insert | **Target coder** | +| 5 | `qwen2.5-coder:14b` | 14.8B | 9.0 GB | completion, tools, insert | Backup coder (asynkron) | + +**Total diskbruk:** ~23.6 GB + +--- + +## Operativ ruting + +1. Start med `gemma3:4b` — raske svar, enkel resonnering +2. Eskaler til `qwen2.5:3b` når oppgaven trenger tools og fart er kritisk +3. Eskaler til `qwen2.5:7b` når kvalitet må opp, men latency fortsatt må være brukbar (~2.7 tok/s) +4. Bruk `qwen2.5-coder:7b` som standard for kode-/repo-arbeid +5. Bruk `qwen2.5-coder:14b` kun for tunge batch-/asynkrone kodeoppgaver + +--- + +## Fjernede modeller (med begrunnelse) + +| Modell | Fjernet | Begrunnelse | +|---|---|---| +| `qwen2.5:14b` | 2026-07-22 | Testet til 1.4 tok/s varm — for treg som interaktiv standardmodell | +| `gemma3:12b` | 2026-07-22 | Ingen tool-support, tregere enn `qwen2.5:7b`, dekket ingen unik rolle | + +--- + +## Ikke anbefalt på denne VM-en + +- `gemma3:27b` — CPU er flaskehalsen, ikke RAM +- Alle modeller > 14B — upraktisk responstid for interaktiv bruk + +--- + +## Neste steg + +- [ ] Test `qwen2.5-coder:7b` på ekte repo-/kodeoppgave +- [ ] Sammenlign subjektivt med `qwen2.5-coder:14b` +- [ ] Mål RAM/swap under last (`free -h`) +- [ ] Vurder å fjerne `qwen2.5-coder:14b` hvis 7B er god nok i praksis + +--- + +## Nyttige kommandoer + +```bash +# Bekreft modelliste +curl http://localhost:11434/api/tags + +# RAM / swap under last +free -h + +# Modellplass på disk +du -sh /usr/share/ollama/.ollama/models +```