Some checks are pending
Check Python Version Consistency / Check Python Version (push) Waiting to run
71 lines
2.1 KiB
Markdown
71 lines
2.1 KiB
Markdown
# LLM Stack — gitea-cpu-vm
|
|
|
|
**Sist oppdatert:** 2026-07-22 04:19 CEST
|
|
**VM:** `gitea-cpu-vm` · `e2-highmem-4` (4 vCPU / 32 GB RAM) · `us-central1-b`
|
|
**Statisk IP:** `34.170.51.84`
|
|
**Ollama:** port `11434` · **Gitea:** port `3000`
|
|
|
|
---
|
|
|
|
## Aktiv modellstack
|
|
|
|
| Prioritet | Modell | Params | Disk | Capabilities | Rolle |
|
|
|---|---|---|---|---|---|
|
|
| 1 | `gemma3:4b` | 4.3B | 3.3 GB | completion | Frontmodell / rask default |
|
|
| 2 | `qwen2.5:3b` | 3.1B | 1.9 GB | completion, tools | Lett tool-/agentmodell |
|
|
| 3 | `qwen2.5:7b` | 7.6B | 4.7 GB | completion, tools | Standard mellomlag |
|
|
| 4 | `qwen2.5-coder:7b` | 7.6B | 4.7 GB | completion, tools, insert | **Target coder** |
|
|
| 5 | `qwen2.5-coder:14b` | 14.8B | 9.0 GB | completion, tools, insert | Backup coder (asynkron) |
|
|
|
|
**Total diskbruk:** ~23.6 GB
|
|
|
|
---
|
|
|
|
## Operativ ruting
|
|
|
|
1. Start med `gemma3:4b` — raske svar, enkel resonnering
|
|
2. Eskaler til `qwen2.5:3b` når oppgaven trenger tools og fart er kritisk
|
|
3. Eskaler til `qwen2.5:7b` når kvalitet må opp, men latency fortsatt må være brukbar (~2.7 tok/s)
|
|
4. Bruk `qwen2.5-coder:7b` som standard for kode-/repo-arbeid
|
|
5. Bruk `qwen2.5-coder:14b` kun for tunge batch-/asynkrone kodeoppgaver
|
|
|
|
---
|
|
|
|
## Fjernede modeller (med begrunnelse)
|
|
|
|
| Modell | Fjernet | Begrunnelse |
|
|
|---|---|---|
|
|
| `qwen2.5:14b` | 2026-07-22 | Testet til 1.4 tok/s varm — for treg som interaktiv standardmodell |
|
|
| `gemma3:12b` | 2026-07-22 | Ingen tool-support, tregere enn `qwen2.5:7b`, dekket ingen unik rolle |
|
|
|
|
---
|
|
|
|
## Ikke anbefalt på denne VM-en
|
|
|
|
- `gemma3:27b` — CPU er flaskehalsen, ikke RAM
|
|
- Alle modeller > 14B — upraktisk responstid for interaktiv bruk
|
|
|
|
---
|
|
|
|
## Neste steg
|
|
|
|
- [ ] Test `qwen2.5-coder:7b` på ekte repo-/kodeoppgave
|
|
- [ ] Sammenlign subjektivt med `qwen2.5-coder:14b`
|
|
- [ ] Mål RAM/swap under last (`free -h`)
|
|
- [ ] Vurder å fjerne `qwen2.5-coder:14b` hvis 7B er god nok i praksis
|
|
|
|
---
|
|
|
|
## Nyttige kommandoer
|
|
|
|
```bash
|
|
# Bekreft modelliste
|
|
curl http://localhost:11434/api/tags
|
|
|
|
# RAM / swap under last
|
|
free -h
|
|
|
|
# Modellplass på disk
|
|
du -sh /usr/share/ollama/.ollama/models
|
|
```
|