chore: update docs/llm-stack.md via opax-mcp
Some checks are pending
Check Python Version Consistency / Check Python Version (push) Waiting to run
Some checks are pending
Check Python Version Consistency / Check Python Version (push) Waiting to run
This commit is contained in:
parent
baf60c1dda
commit
4c4b582e25
70
docs/llm-stack.md
Normal file
70
docs/llm-stack.md
Normal file
|
|
@ -0,0 +1,70 @@
|
||||||
|
# LLM Stack — gitea-cpu-vm
|
||||||
|
|
||||||
|
**Sist oppdatert:** 2026-07-22 04:19 CEST
|
||||||
|
**VM:** `gitea-cpu-vm` · `e2-highmem-4` (4 vCPU / 32 GB RAM) · `us-central1-b`
|
||||||
|
**Statisk IP:** `34.170.51.84`
|
||||||
|
**Ollama:** port `11434` · **Gitea:** port `3000`
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## Aktiv modellstack
|
||||||
|
|
||||||
|
| Prioritet | Modell | Params | Disk | Capabilities | Rolle |
|
||||||
|
|---|---|---|---|---|---|
|
||||||
|
| 1 | `gemma3:4b` | 4.3B | 3.3 GB | completion | Frontmodell / rask default |
|
||||||
|
| 2 | `qwen2.5:3b` | 3.1B | 1.9 GB | completion, tools | Lett tool-/agentmodell |
|
||||||
|
| 3 | `qwen2.5:7b` | 7.6B | 4.7 GB | completion, tools | Standard mellomlag |
|
||||||
|
| 4 | `qwen2.5-coder:7b` | 7.6B | 4.7 GB | completion, tools, insert | **Target coder** |
|
||||||
|
| 5 | `qwen2.5-coder:14b` | 14.8B | 9.0 GB | completion, tools, insert | Backup coder (asynkron) |
|
||||||
|
|
||||||
|
**Total diskbruk:** ~23.6 GB
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## Operativ ruting
|
||||||
|
|
||||||
|
1. Start med `gemma3:4b` — raske svar, enkel resonnering
|
||||||
|
2. Eskaler til `qwen2.5:3b` når oppgaven trenger tools og fart er kritisk
|
||||||
|
3. Eskaler til `qwen2.5:7b` når kvalitet må opp, men latency fortsatt må være brukbar (~2.7 tok/s)
|
||||||
|
4. Bruk `qwen2.5-coder:7b` som standard for kode-/repo-arbeid
|
||||||
|
5. Bruk `qwen2.5-coder:14b` kun for tunge batch-/asynkrone kodeoppgaver
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## Fjernede modeller (med begrunnelse)
|
||||||
|
|
||||||
|
| Modell | Fjernet | Begrunnelse |
|
||||||
|
|---|---|---|
|
||||||
|
| `qwen2.5:14b` | 2026-07-22 | Testet til 1.4 tok/s varm — for treg som interaktiv standardmodell |
|
||||||
|
| `gemma3:12b` | 2026-07-22 | Ingen tool-support, tregere enn `qwen2.5:7b`, dekket ingen unik rolle |
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## Ikke anbefalt på denne VM-en
|
||||||
|
|
||||||
|
- `gemma3:27b` — CPU er flaskehalsen, ikke RAM
|
||||||
|
- Alle modeller > 14B — upraktisk responstid for interaktiv bruk
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## Neste steg
|
||||||
|
|
||||||
|
- [ ] Test `qwen2.5-coder:7b` på ekte repo-/kodeoppgave
|
||||||
|
- [ ] Sammenlign subjektivt med `qwen2.5-coder:14b`
|
||||||
|
- [ ] Mål RAM/swap under last (`free -h`)
|
||||||
|
- [ ] Vurder å fjerne `qwen2.5-coder:14b` hvis 7B er god nok i praksis
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## Nyttige kommandoer
|
||||||
|
|
||||||
|
```bash
|
||||||
|
# Bekreft modelliste
|
||||||
|
curl http://localhost:11434/api/tags
|
||||||
|
|
||||||
|
# RAM / swap under last
|
||||||
|
free -h
|
||||||
|
|
||||||
|
# Modellplass på disk
|
||||||
|
du -sh /usr/share/ollama/.ollama/models
|
||||||
|
```
|
||||||
Loading…
Reference in New Issue
Block a user