OSVauco/docs/llm-stack.md

2.1 KiB

LLM Stack — gitea-cpu-vm

Sist oppdatert: 2026-07-22 04:19 CEST
VM: gitea-cpu-vm · e2-highmem-4 (4 vCPU / 32 GB RAM) · us-central1-b
Statisk IP: 34.170.51.84
Ollama: port 11434 · Gitea: port 3000


Aktiv modellstack

Prioritet Modell Params Disk Capabilities Rolle
1 gemma3:4b 4.3B 3.3 GB completion Frontmodell / rask default
2 qwen2.5:3b 3.1B 1.9 GB completion, tools Lett tool-/agentmodell
3 qwen2.5:7b 7.6B 4.7 GB completion, tools Standard mellomlag
4 qwen2.5-coder:7b 7.6B 4.7 GB completion, tools, insert Target coder
5 qwen2.5-coder:14b 14.8B 9.0 GB completion, tools, insert Backup coder (asynkron)

Total diskbruk: ~23.6 GB


Operativ ruting

  1. Start med gemma3:4b — raske svar, enkel resonnering
  2. Eskaler til qwen2.5:3b når oppgaven trenger tools og fart er kritisk
  3. Eskaler til qwen2.5:7b når kvalitet må opp, men latency fortsatt må være brukbar (~2.7 tok/s)
  4. Bruk qwen2.5-coder:7b som standard for kode-/repo-arbeid
  5. Bruk qwen2.5-coder:14b kun for tunge batch-/asynkrone kodeoppgaver

Fjernede modeller (med begrunnelse)

Modell Fjernet Begrunnelse
qwen2.5:14b 2026-07-22 Testet til 1.4 tok/s varm — for treg som interaktiv standardmodell
gemma3:12b 2026-07-22 Ingen tool-support, tregere enn qwen2.5:7b, dekket ingen unik rolle

Ikke anbefalt på denne VM-en

  • gemma3:27b — CPU er flaskehalsen, ikke RAM
  • Alle modeller > 14B — upraktisk responstid for interaktiv bruk

Neste steg

  • Test qwen2.5-coder:7b på ekte repo-/kodeoppgave
  • Sammenlign subjektivt med qwen2.5-coder:14b
  • Mål RAM/swap under last (free -h)
  • Vurder å fjerne qwen2.5-coder:14b hvis 7B er god nok i praksis

Nyttige kommandoer

# Bekreft modelliste
curl http://localhost:11434/api/tags

# RAM / swap under last
free -h

# Modellplass på disk
du -sh /usr/share/ollama/.ollama/models