chore: update docs/llm-stack.md via opax-mcp
Some checks are pending
Check Python Version Consistency / Check Python Version (push) Waiting to run
Some checks are pending
Check Python Version Consistency / Check Python Version (push) Waiting to run
This commit is contained in:
parent
baf60c1dda
commit
4c4b582e25
70
docs/llm-stack.md
Normal file
70
docs/llm-stack.md
Normal file
|
|
@ -0,0 +1,70 @@
|
|||
# LLM Stack — gitea-cpu-vm
|
||||
|
||||
**Sist oppdatert:** 2026-07-22 04:19 CEST
|
||||
**VM:** `gitea-cpu-vm` · `e2-highmem-4` (4 vCPU / 32 GB RAM) · `us-central1-b`
|
||||
**Statisk IP:** `34.170.51.84`
|
||||
**Ollama:** port `11434` · **Gitea:** port `3000`
|
||||
|
||||
---
|
||||
|
||||
## Aktiv modellstack
|
||||
|
||||
| Prioritet | Modell | Params | Disk | Capabilities | Rolle |
|
||||
|---|---|---|---|---|---|
|
||||
| 1 | `gemma3:4b` | 4.3B | 3.3 GB | completion | Frontmodell / rask default |
|
||||
| 2 | `qwen2.5:3b` | 3.1B | 1.9 GB | completion, tools | Lett tool-/agentmodell |
|
||||
| 3 | `qwen2.5:7b` | 7.6B | 4.7 GB | completion, tools | Standard mellomlag |
|
||||
| 4 | `qwen2.5-coder:7b` | 7.6B | 4.7 GB | completion, tools, insert | **Target coder** |
|
||||
| 5 | `qwen2.5-coder:14b` | 14.8B | 9.0 GB | completion, tools, insert | Backup coder (asynkron) |
|
||||
|
||||
**Total diskbruk:** ~23.6 GB
|
||||
|
||||
---
|
||||
|
||||
## Operativ ruting
|
||||
|
||||
1. Start med `gemma3:4b` — raske svar, enkel resonnering
|
||||
2. Eskaler til `qwen2.5:3b` når oppgaven trenger tools og fart er kritisk
|
||||
3. Eskaler til `qwen2.5:7b` når kvalitet må opp, men latency fortsatt må være brukbar (~2.7 tok/s)
|
||||
4. Bruk `qwen2.5-coder:7b` som standard for kode-/repo-arbeid
|
||||
5. Bruk `qwen2.5-coder:14b` kun for tunge batch-/asynkrone kodeoppgaver
|
||||
|
||||
---
|
||||
|
||||
## Fjernede modeller (med begrunnelse)
|
||||
|
||||
| Modell | Fjernet | Begrunnelse |
|
||||
|---|---|---|
|
||||
| `qwen2.5:14b` | 2026-07-22 | Testet til 1.4 tok/s varm — for treg som interaktiv standardmodell |
|
||||
| `gemma3:12b` | 2026-07-22 | Ingen tool-support, tregere enn `qwen2.5:7b`, dekket ingen unik rolle |
|
||||
|
||||
---
|
||||
|
||||
## Ikke anbefalt på denne VM-en
|
||||
|
||||
- `gemma3:27b` — CPU er flaskehalsen, ikke RAM
|
||||
- Alle modeller > 14B — upraktisk responstid for interaktiv bruk
|
||||
|
||||
---
|
||||
|
||||
## Neste steg
|
||||
|
||||
- [ ] Test `qwen2.5-coder:7b` på ekte repo-/kodeoppgave
|
||||
- [ ] Sammenlign subjektivt med `qwen2.5-coder:14b`
|
||||
- [ ] Mål RAM/swap under last (`free -h`)
|
||||
- [ ] Vurder å fjerne `qwen2.5-coder:14b` hvis 7B er god nok i praksis
|
||||
|
||||
---
|
||||
|
||||
## Nyttige kommandoer
|
||||
|
||||
```bash
|
||||
# Bekreft modelliste
|
||||
curl http://localhost:11434/api/tags
|
||||
|
||||
# RAM / swap under last
|
||||
free -h
|
||||
|
||||
# Modellplass på disk
|
||||
du -sh /usr/share/ollama/.ollama/models
|
||||
```
|
||||
Loading…
Reference in New Issue
Block a user