Token-optimering: samme kvalitet — en brøkdel af prisen
Alt hvad en AI læser og skriver, koster tokens — og tokens koster penge. Token-optimering er et af mine allerstørste fokusområder: Jeg designer løsninger, hvor omkostningerne ikke eksploderer, når brugen vokser. Smart AI er kun halvdelen af opgaven; billig drift er den anden.
- Den dyreste model bruges til alt — også opgaver en lille model klarer lige så godt.
- Hele dokumenter og lange historikker sendes med i hvert eneste kald, igen og igen.
- Ingen ved, hvad en enkelt opgave koster — regningen er en sort boks, der vokser med brugen.
- Det, der var billigt i pilotfasen, bliver en ubehagelig overraskelse i drift.
- Hver opgave rammer den billigste model, der kan løse den — de store modeller gemmes til de svære.
- Gentaget indhold caches, og kun den kontekst, der faktisk er relevant, sendes med.
- Forbruget måles pr. opgave, så I kender prisen på en faktura, en mail eller et referat.
- Omkostningerne er forudsigelige og skalerer pænt, når brugen tidobles.
Sådan optimerer jeg
Mål før jeg optimerer
Jeg starter med at måle tokenforbruget pr. opgave, så jeg ved præcis, hvor pengene løber hen — og hvor gevinsten er størst.
Den rigtige model til opgaven
Simple opgaver rammer små, hurtige modeller; kun de svære sendes til de store. Alene den routing skærer ofte størstedelen af regningen.
Prompt-caching
Instruktioner, vidensbaser og eksempler, der går igen i hvert kald, caches — så I ikke betaler fuld pris for det samme indhold tusindvis af gange.
Kun relevant kontekst
I stedet for at sende hele dokumentarkivet med, henter løsningen kun de afsnit, der er relevante for den konkrete opgave.
Skarpe, strukturerede svar
Modellen bliver bedt om præcis det output, der skal bruges — ikke tre afsnit høflig indpakning. Kortere svar er både billigere og lettere at arbejde videre med.
Løbende overvågning
Forbruget overvåges i drift med alarmer for udsving — så en fejl eller en ny brugsmåde aldrig når at blive en dyr overraskelse.
Typiske greb i værktøjskassen
Grebene er de samme, uanset om løsningen kører på OpenAI, Anthropic, Google eller en europæisk udbyder — jeg vælger det, der passer til opgaven og budgettet.
Hvad det typisk betyder
AI-omkostninger i drift, når routing, caching og kontekst-styring er på plads
optimeringen sker bag kulisserne — svarene bliver ikke dårligere, ofte hurtigere
I kender prisen pr. opgave og kan skalere brugen uden at frygte regningen
Besparelsen afhænger af, hvor uoptimeret udgangspunktet er — jeg måler altid før og efter, så gevinsten er sort på hvidt.