OSVauco/docs/llm-stack.md
chris 4c4b582e25
Some checks are pending
Check Python Version Consistency / Check Python Version (push) Waiting to run
chore: update docs/llm-stack.md via opax-mcp
2026-07-22 02:19:45 +00:00

71 lines
2.1 KiB
Markdown

# LLM Stack — gitea-cpu-vm
**Sist oppdatert:** 2026-07-22 04:19 CEST
**VM:** `gitea-cpu-vm` · `e2-highmem-4` (4 vCPU / 32 GB RAM) · `us-central1-b`
**Statisk IP:** `34.170.51.84`
**Ollama:** port `11434` · **Gitea:** port `3000`
---
## Aktiv modellstack
| Prioritet | Modell | Params | Disk | Capabilities | Rolle |
|---|---|---|---|---|---|
| 1 | `gemma3:4b` | 4.3B | 3.3 GB | completion | Frontmodell / rask default |
| 2 | `qwen2.5:3b` | 3.1B | 1.9 GB | completion, tools | Lett tool-/agentmodell |
| 3 | `qwen2.5:7b` | 7.6B | 4.7 GB | completion, tools | Standard mellomlag |
| 4 | `qwen2.5-coder:7b` | 7.6B | 4.7 GB | completion, tools, insert | **Target coder** |
| 5 | `qwen2.5-coder:14b` | 14.8B | 9.0 GB | completion, tools, insert | Backup coder (asynkron) |
**Total diskbruk:** ~23.6 GB
---
## Operativ ruting
1. Start med `gemma3:4b` — raske svar, enkel resonnering
2. Eskaler til `qwen2.5:3b` når oppgaven trenger tools og fart er kritisk
3. Eskaler til `qwen2.5:7b` når kvalitet må opp, men latency fortsatt må være brukbar (~2.7 tok/s)
4. Bruk `qwen2.5-coder:7b` som standard for kode-/repo-arbeid
5. Bruk `qwen2.5-coder:14b` kun for tunge batch-/asynkrone kodeoppgaver
---
## Fjernede modeller (med begrunnelse)
| Modell | Fjernet | Begrunnelse |
|---|---|---|
| `qwen2.5:14b` | 2026-07-22 | Testet til 1.4 tok/s varm — for treg som interaktiv standardmodell |
| `gemma3:12b` | 2026-07-22 | Ingen tool-support, tregere enn `qwen2.5:7b`, dekket ingen unik rolle |
---
## Ikke anbefalt på denne VM-en
- `gemma3:27b` — CPU er flaskehalsen, ikke RAM
- Alle modeller > 14B — upraktisk responstid for interaktiv bruk
---
## Neste steg
- [ ] Test `qwen2.5-coder:7b` på ekte repo-/kodeoppgave
- [ ] Sammenlign subjektivt med `qwen2.5-coder:14b`
- [ ] Mål RAM/swap under last (`free -h`)
- [ ] Vurder å fjerne `qwen2.5-coder:14b` hvis 7B er god nok i praksis
---
## Nyttige kommandoer
```bash
# Bekreft modelliste
curl http://localhost:11434/api/tags
# RAM / swap under last
free -h
# Modellplass på disk
du -sh /usr/share/ollama/.ollama/models
```