AI & produktion
AI-agenter er gået fra eksperiment til backlog-item hos de fleste produktteams. Problemet er at "agent" dækker over alt fra en simpel FAQ-bot til en autonom workflow der rører jeres database og sender mails på vegne af brugeren.
Forskellen mellem demo og produktion er ikke modellen — det er alt det omkringliggende: hvad må den gøre, hvad logger I, og hvad sker der når den tager fejl?
TL;DR
De vigtigste pointer
- Start med et snævert use case — ikke "en agent der kan alt".
- Tool-calling skal have eksplicitte tilladelser: hvilke API'er, hvilke data, hvilke sideeffekter.
- Log prompts, tool-kald og outputs — I kan ikke debugge det I ikke kan se.
- Planlæg menneskelig eskalering og fallback fra dag ét — autonomi er et spektrum, ikke en switch.
Hvad der adskiller demo fra produktion
I en demo accepterer I hallucinationer som "det er AI". I produktion er det en incident. I en demo kører modellen med fuld kontekst. I produktion skal I begrænse tokens, filtrere input og sikre at sensitive data ikke sendes til modellen unødigt.
Vi bygger agenter som pipelines: klassificer intent, vælg tilladte tools, kør med timeout, valider output, og eskalér hvis confidence er lav eller handlingen er irreversibel. Det er mindre sexet end "autonom agent" — men det er det der holder i drift.
Chatbot vs. produktionsagent
Chatbot / Q&A
Svarer på spørgsmål ud fra jeres docs — få sideeffekter, nemmere at shippe.
- RAG over dokumentation eller help center
- Ingen skrivende handlinger mod jeres systemer
- Fallback: link til support eller søgning
- Godt første skridt for mange teams
- Begrænset værdi hvis brugeren skal gøre arbejdet bagefter
Agent med tools
Kan udføre handlinger — højere værdi, højere risiko, mere engineering.
- Kalder jeres API'er: opret ticket, opdater status, hent data
- Kræver auth, rate limits og audit log per handling
- Menneske-i-loop ved destructive eller højrisiko-kald
- Observability på hvert tool-kald — ikke kun slut-svar
- Kun værd at bygge når use caset er tydeligt og gentageligt
Spørgsmål vi får igen og igen
Hvilken model skal vi bruge?
Den der matcher latency, sprog og tool-calling-krav — ikke nødvendigvis den nyeste. Vi evaluerer på jeres rigtige prompts og tools, og holder abstraktion så I kan skifte model uden at omskrive hele agenten.
Skal data sendes til OpenAI / Anthropic?
Kun det der skal — og under de databehandleraftaler I har. Mange flows kan køre med anonymiseret eller aggregeret kontekst. Sensitive felter filtreres før de rammer modellen. Hvis data ikke må forlade EU, vælger vi host og model derefter.
Hvordan måler vi om agenten virker?
Definér success per use case: løste sager uden eskalering, korrekte tool-kald, tid sparet for support. Log alt og review et udsnit manuelt de første uger. Automatiske evals kommer bagefter — når I ved hvad "godt" betyder.
Kan vi starte uden at bygge en fuld agent?
Ja. Ofte starter vi med klassificering + foreslået svar eller et enkelt read-only tool. Det giver læring og logging uden at I åbner skrivende API'er med det samme.
Overvejer I AI-agenter til produktet?
Lad os afklare use case og grænser — før I shipper til brugere.
Vi hjælper med at skære scope, vælge arkitektur og sætte guardrails op — så det I shipper er noget I kan stå inde for i drift.