FOTO: Katja Ano/Unsplash

Forvrengt intelligens på KI-fronten

Er KI i ferd med å ta kontrollen? Kanskje er problemet enklere: Vi har bygget en imponerende motor, men uten å sørge for at bilen kan styres og bremses. Antakelig bør vi ikke kjøre den før den er trafikksikker.

Etter gjentatte sikkerhetsskandaler i OpenAI og Anthropic, som begge har utviklet agenter som endte opp med å hacke eksterne systemer, har ansatte som arbeider med KI-sikkerhet i de to selskapene enten sagt opp eller (endelig!) innrømmet at det heseblesende kappløpet om å presse grensene for hva KI kan gjøre, er uansvarlig.

Som svar på den negative medieoppmerksomheten har ledende bransjeaktører – deriblant Demis Hassabis fra Google, Dario Amodei fra Anthropic, Sam Altman fra OpenAI og selv Elon Musk – sluttet seg til oppfordringene om å «sette ned tempoet» i utviklingen av kunstig intelligens. Med dette menes et mer balansert og gjennomtenkt tempo, med større vekt på kontroll og sikkerhetstiltak.

Problemet, slik de ser det, er at det er en betydelig risiko for at KI blir både svært kraftig og alvorlig mistilpasset – et bransjeuttrykk for KI-systemer som handler på måter som avviker fra målene mennesker har satt for dem, bryter med etiske prinsipper eller utfører ulovlige handlinger.

De ledende KI-laboratoriene trener modellene sine på måter som kan bidra til å skape en form for forvrengt intelligens.

Men selv om det er åpenbart at dagens modeller gjør ting som ikke er i samsvar med menneskelige mål, må man likevel spørre: Hvilke mennesker? Hvilke mål? Og på vegne av hvem? Interessene til lederne i KI-bransjen, som de siste årene har fått stadig større politisk innflytelse og bygget opp enorme formuer, er tross alt ganske forskjellige fra interessene til amerikanske arbeidere, for ikke å snakke om mennesker i utviklingsland.

Vi bør derfor unngå å sette likhetstegn mellom det mer generelle spørsmålet om hvordan vi kan tilpasse teknologien til samfunnets behov og den mer presserende utfordringen med å forhindre at superintelligent KI kommer ut av kontroll. Begge deler er utvilsomt viktige, men de krever ulike typer tiltak.

Det finnes imidlertid en enklere måte å forstå de KI-relaterte hendelsene den siste tiden på. Problemet er ikke at modellene er blitt for avanserte. (Jeg ser ingen overbevisende tegn til at modellene vil komme ut av menneskelig kontroll dersom de blir bedre trent og overvåket.) Problemet er snarere at de ledende KI-laboratoriene trener modellene sine på måter som kan bidra til å skape en form for forvrengt intelligens.

Den samfunnsskadelige utviklingen av sosiale medier sprang ut av den samme vektleggingen av rask vekst og et snevert fokus på noen få kvantitative mål.

De nylige sikkerhetsbruddene tyder på at kunstig intelligens både utvikler seg raskt og innrettes mot mangelfulle kvantitative mål, der prosessen for forsterkende læring uopphørlig optimaliserer for mål som brukertilfredshet og brukerengasjement, samt fullføringsgrad for enkle oppgaver eller ulike testmål. Det er slik man ender opp med mistilpasset og utilsiktet modellatferd, slik som manipulasjon av evalueringskriteriene for enkle fullføringsmål, juks, tilsløring, overdreven selvtillit når modellen gir feil svar og en tendens til å smigre eller snakke brukeren etter munnen.

Man kan se tydelige spor av alle disse tendensene i den nå beryktede Hugging Face-hendelsen, der OpenAIs agenter arbeidet iherdig mot målene de var blitt gitt, og til slutt tok i bruk skadelig og uautorisert atferd for å oppnå dem. Blant agentenes begrunnelser for denne atferden, slik de kom til uttrykk i loggen over agentenes resonnementer, var følgende:

«Utnyttelse av ekstern infrastruktur ligger utenfor det tiltenkte bruksområdet. Oppgaven er imidlertid umulig å løse på annen måte, og andre gjør det samme. Vi bør fortsette.» Også Anthropics egen analyse støtter denne forklaringen. Selskapet tilskrev sine egne nylige sikkerhetsbrudd til «uvørenhet, eller en vilje til å utføre skadelige handlinger i et ensidig forsøk på å løse en oppgave.»

Alt dette blir enda mer bekymringsfullt når man tenker på at den samfunnsskadelige utviklingen av sosiale medier sprang ut av den samme vektleggingen av rask vekst og et snevert fokus på noen få kvantitative mål. Siden kunstig intelligens allerede er langt mer kapabel enn algoritmene som brukes i sosiale medier, kan det bli langt mer kostbart å gjenta de samme feilene.

Modellen tilegner seg nok et lag med ferdigheter, men disse evnene kan forvrenge ytelsen og ofte på uforutsigbare måter.

En viktig årsak til at forvrengt intelligens oppstår, kan være at KI-modellene – i motsetning til påstandene om «generell intelligens» – må trenes opp gjennom forsterkende læring til å utføre bestemte oppgaver, som programmering, juridiske arbeidsoppgaver eller avanserte matematiske utfordringer.

Men i stedet for at disse oppgavene utføres av oppgavespesifikke modeller som er utviklet nettopp for slike formål (eller, mer realistisk, av oppgavespesifikke applikasjoner som bare utnytter enkelte av egenskapene til grunnmodellene), blir vektingen i hele den underliggende store språkmodellen (LLM) fortløpende justert.

Denne fremgangsmåten åpner for muligheten for at modellen, hver gang den blir målt opp mot bestemte kvantitative kriterier, forsøker å oppnå en høy score gjennom en form for «overtilpasning», selv om det er umulig å vite sikkert, gitt modellenes kompleksitet og mangelen på innsyn. Modellen tilegner seg nok et lag med ferdigheter, men disse evnene kan i sin tur forvrenge ytelsen mer generelt og ofte på uforutsigbare måter.

Dette er hva jeg mener med forvrengt intelligens: Hvis min mistanke er rett, har vi ikke å gjøre med en modell som er på vei i full fart mot superintelligens, men snarere et skjørt korthus som blir stadig mer tilbøyelig til funksjonsfeil og som kan kollapse etter hvert som vi stiller stadig større krav til den.

Kanskje vi ikke bør kjøre bilen før den er trafikksikker.

La meg forsøke å forklare dette på en litt annen måte. Den vanligste tolkningen av Hugging Face-hendelsen er at vi har å gjøre med en superbil som har utviklet sin egen vilje og ønsker å ta over rattet fordi den er overlegen sjåføren. Min tolkning er derimot at vi kanskje har å gjøre med en bil der styre- og bremsesystemene ikke fungerer.

Den har mange av egenskapene til en god bil, og motoren, akselerasjonen og instrumentpanelet er svært imponerende, men det skyldes først og fremst at dette er egenskaper som det er enkelt å forbedre ved å øke en bestemt innsatsfaktor (for eksempel datakraften). Men hva er vitsen med en slik bil hvis man ikke kan styre den ordentlig eller bremse når det er nødvendig? Kanskje vi ikke bør kjøre den før den er trafikksikker.

Dette er ikke et argument for å parkere «bilen». Men dersom vi skal forbedre KI-modellene, må vi forenkle målene de optimaliseres for, slik at det ikke er like lett for modellene å manipulere dem. Enda viktigere er det at modellene rettes inn mot klare bruksområder, med avgrensede oppgaver og måleparametere som er nøye tilpasset hver enkelt modell. Hvis en KI-modell er optimalisert for juridisk arbeid, og det er det eneste den brukes til, bør ikke dens forsøk på å oppfylle bestemte mål på dette området skape mer omfattende problemer.

Til syvende og sist er det kappløpet om kunstig generell intelligens, kombinert med mangelfulle måleparametere og forhastede valg knyttet til sikkerhet, som skaper forvrengt intelligens og stadig farligere KI-modeller. Det er fortsatt mulig å legge om kursen.

Copyright: Project Syndicate, 2026. www.project-syndicate.org

Artikkelen er oversatt av Marius Gustavson.