Evidensbasert medisin: kritisk vurdering av studier

Sammendrag

Kritisk vurdering innebærer å bedømme om en studie besvarer et klinisk relevant spørsmål, om resultatet kan være systematisk skjevt, hvor stor og presis effekten er, og om resultatet kan overføres til den aktuelle pasienten. Ikke begynn med konklusjonen eller p-verdien. Identifiser først problemstilling, studiedesign, populasjon, intervensjon eller eksponering, sammenligning, utfall og oppfølgingstid. Vurder deretter intern validitet, effektmål og presisjon, etterfulgt av ekstern validitet og samlet evidens.

For randomiserte studier er de sentrale spørsmålene om randomiseringssekvensen var korrekt, om allokeringen var skjult, om det oppstod avvik fra tildelt behandling, hvordan frafall ble håndtert, om utfallsmålingen var pålitelig og om de rapporterte analysene var forhåndsbestemt. For observasjonsstudier kommer i hovedsak seleksjonsskjevhet, konfundering, feilklassifisering og tidsrelatert bias i tillegg. Diagnostiske studier må vurderes ut fra pasientutvalg, indekstest og referansetest, blinding, terskelverdier og pasientflyt. Systematiske oversikter krever et reproduserbart søk, transparent studieutvalg, egnet vurdering av risiko for bias og en rimelig syntese.

Statistisk signifikans er ikke det samme som klinisk betydning. Tolk alltid punktestimater sammen med konfidensintervaller og absolutte effekter. Et ikke-signifikant resultat viser ikke automatisk likeverdighet. Et stort materiale kan gi et presist, men skjevt resultat, mens et lite materiale kan gi et usikkert resultat til tross for god studiedesign. Til slutt skal studiens resultater veies sammen med øvrig evidens, pasientens baselinerisiko, verdier, behandlingsbyrde, bivirkninger, ressurser og svensk helsetjenestekontekst.

Fra klinisk spørsmål til vurderingsplan

Formuler spørsmålet før artikkelen vurderes

En nyttig vurdering begynner med et spørsmål som kan besvares. For behandlingseffekter brukes vanligvis PICO:

Komponent Spørsmål
Population Hvilke pasienter gjelder spørsmålet?
Intervention Hvilken behandling, strategi eller tiltak vurderes?
Comparator Hva sammenlignes intervensjonen med?
Outcome Hvilke pasientrelevante effekter og skader er viktige?
Tid Hvor lang behandling og oppfølging kreves for at utfallet skal være meningsfullt?

For diagnostikk må spørsmålet også angi indekstest, referansestandard, tiltenkt klinisk rolle og hvor i pasientforløpet testen skal brukes. For prognose angis populasjon, prognostisk faktor eller modell, utfall og tidshorisont. For etiologi eller skade spesifiseres eksponering, relevant sammenligning og mulige konfundere.

Den samme artikkelen kan være relevant for ett spørsmål, men uegnet for et annet. En placebokontrollert effektstudie kan vise at en behandling har biologisk effekt, men trenger ikke vise om den er bedre enn svensk standardbehandling. En studie av diagnostisk treffsikkerhet kan vise hvor godt en test klassifiserer sykdom, men ikke om testen forbedrer pasientutfall.

Identifiser studiedesign ut fra hva som faktisk ble gjort

Ikke stol utelukkende på forfatternes betegnelse. Vurder hvordan deltakerne ble valgt ut, hvordan sammenligningsgruppene ble dannet, når eksponering og utfall ble målt og hvordan oppfølgingen ble gjennomført.

Spørsmålstype Ofte egnet design Viktigste trusler mot validiteten
Behandlingseffekt Randomisert kontrollert studie Svakheter i randomisering, avvik, frafall, selektiv rapportering
Sjelden eller langsiktig skade Kohort, kasus-kontroll-studie, registerstudie Konfundering, seleksjon, feilklassifisering, tidsrelatert bias
Diagnostisk treffsikkerhet Tverrsnittsstudie eller kohort der de samme pasientene gjennomgår indekstest og referansetest Spektrumbias, verifikasjonsbias, uegnet referansestandard
Prognose Inception-kohort med relevant oppfølging Selektiv inklusjon, frafall, overtilpasning
Prevalens Representativ tverrsnittsstudie Utvalgsfeil, frafall, målefeil
Samlet behandlingsevidens Systematisk oversikt, der det er hensiktsmessig med metaanalyse Ufullstendig søk, bias i primærstudier, uegnet sammenstilling

Rapporteringsretningslinjer hjelper leseren med å finne nødvendig informasjon. CONSORT 2025 omfatter 30 rapporteringspunkter for randomiserte studier og vektlegger blant annet registrering, protokoll, statistisk analyseplan, datahåndtering, frafall og bivirkninger [1]. STROBE omfatter kohort-, kasus-kontroll- og tverrsnittsstudier og understreker at populasjon, datainnsamling, variabler, mulig bias og analyse må beskrives tydelig [2]. STARD fyller tilsvarende funksjon for diagnostiske studier [3], mens PRISMA 2020 inneholder 27 rapporteringspunkter for systematiske oversikter [4].

Disse retningslinjene er ikke kvalitetsinstrumenter. Fullstendig rapportering gjør det mulig å vurdere en studie, men garanterer ikke at metoden er korrekt. Mangelfull rapportering innebærer derimot at risiko for bias ofte ikke kan utelukkes.

flowchart TD
A["Formuler det kliniske spørsmålet<br>og viktige utfall"] --> B["Identifiser hva forskerne<br>faktisk sammenlignet"]
B --> C["Vurder intern validitet<br>og risiko for bias"]
C --> D["Tolk effektstørrelse<br>og presisjon"]
D --> E["Vurder alternative analyser<br>og rapporteringsseleksjon"]
E --> F["Vurder overførbarhet<br>til pasient og helsetjenestekontekst"]
F --> G["Vei sammen med øvrig evidens<br>nytte, skade og ressurser"]

Felles vurdering av alle studier

Forskningsspørsmål, protokoll og forhåndsregistrering

Kontroller om hypotese, primært utfall, oppfølgingstid og analyse ble definert før dataene ble analysert. For randomiserte studier bør registreringen ha skjedd før den første deltakeren ble inkludert. Sammenlign publikasjonen med studieprotokoll, registeroppføring og statistisk analyseplan. Undersøk om:

  • primært utfall er byttet ut
  • tidspunktet for primæranalysen er endret
  • utfall er lagt til eller fjernet
  • subgrupper eller justeringsvariabler er valgt etter at resultatene ble kjent
  • studien ble avsluttet tidlig uten tydelige forhåndsbestemte regler
  • analysen avviker fra den planlagte uten overbevisende forklaring

Et avvik trenger ikke være uheldig. Klinisk utvikling eller uventede dataproblemer kan begrunne en endring. Problemet er en udokumentert, resultatstyrt endring som øker risikoen for at et tilfeldig funn fremstilles som bekreftende evidens.

Populasjon og rekruttering

Beskriv kildepopulasjonen før du vurderer studiepopulasjonen. Spør hvilke pasienter som kunne ha blitt inkludert, hvilke som faktisk ble vurdert for deltakelse og hvilke som til slutt ble analysert. Rekruttering fra høyspesialiserte sentre kan gi høy behandlingskvalitet, men begrenset generaliserbarhet. Rekruttering via annonser eller frivillig deltakelse kan selektere særlig motiverte og helsebevisste personer.

Kontroller:

  • inklusjons- og eksklusjonskriterier
  • rekrutteringsland, omsorgsnivå og tidsperiode
  • andelen forespurte som ble inkludert
  • komorbiditet, alder, kjønnsfordeling og sykdommens alvorlighetsgrad
  • tidligere og samtidig behandling
  • om eldre, skrøpelige, gravide eller andre viktige grupper ble ekskludert
  • om de diagnostiske kriteriene tilsvarer klinisk praksis

En behandling kan ha samme relative effekt ved ulik baselinerisiko, men svært ulik absolutt nytte. Derfor er pasientens baselinerisiko sentral for anvendelsen.

Intervensjon, sammenligning og samtidig behandling

Intervensjonen må være tilstrekkelig beskrevet til at den kan reproduseres. For legemidler trengs dose, administrasjonsmåte, behandlingsvarighet, dosejustering og etterlevelse. For kirurgi, fysioterapi eller komplekse behandlingsprogrammer trengs informasjon om utøvere, opplæring, komponenter og faktisk gjennomføring. TIDieR ble utviklet for å forbedre beskrivelsen og reproduserbarheten av slike intervensjoner [5].

Sammenligningsbehandlingen er like viktig som intervensjonen. Placebo kan være rimelig når effektiv standardbehandling mangler, men er utilstrekkelig hvis spørsmålet gjelder valg mellom etablerte behandlinger. En for lav dose eller feilaktig administrert aktiv kontroll kan overdrive den nye behandlingens relative nytte.

Vurder også samtidig behandling. Dersom gruppene får ulik redningsbehandling, rehabilitering, oppfølging eller diagnostikk, kan forskjellen i utfall ikke med sikkerhet tilskrives den tiltenkte intervensjonen.

Utfall og oppfølgingstid

Prioriter pasientrelevante utfall som overlevelse, symptomer, funksjon, livskvalitet, sykehusinnleggelse og alvorlige komplikasjoner. Biomarkører og radiologiske mål kan være nyttige, men et surrogatendepunkt må være validert for den aktuelle sykdommen, behandlingsmekanismen og pasientpopulasjonen. En behandling kan forbedre en laboratorieverdi uten å forbedre pasientenes helse.

Vurder hvordan utfallet ble definert og målt:

  • Var definisjonen klinisk meningsfull?
  • Var målemetoden validert?
  • Var utfallet selvrapportert eller avhengig av bedømmer?
  • Var bedømmerne blindet?
  • Ble utfallet målt like ofte og på samme måte i gruppene?
  • Var oppfølgingen lang nok for nytte og skade?
  • Inngikk komponenter med svært ulik klinisk betydning i et sammensatt utfall?

Et sammensatt utfall kan domineres av den vanligste, men minst alvorlige komponenten. Rapporten bør derfor vise både det sammensatte utfallet og hver komponent separat.

Randomiserte behandlingsstudier

Randomisering reduserer i forventning både kjent og ukjent konfundering, men bare hvis sekvensen er genuint tilfeldig og allokeringen ikke kan forutsies. RoB 2 vurderer fem domener: randomiseringsprosessen, avvik fra tiltenkte intervensjoner, manglende utfallsdata, utfallsmåling og seleksjon av rapportert resultat [6].

Randomiseringsprosess og skjult allokering

Kontroller hvordan sekvensen ble generert. Datagenererte tilfeldige tall og sentral randomisering er vanligvis egnet. Alternering, fødselsdato, journalnummer eller ukedag er forutsigbare og utgjør ikke sikker randomisering.

Skjult allokering betyr at den som inkluderer deltakeren, ikke kan kjenne til neste tildeling. Dette er atskilt fra blinding etter randomiseringen. Sentral nettbasert eller telefonbasert tildeling gir ofte bedre beskyttelse enn lokalt oppbevarte konvolutter. Dersom allokeringen kunne forutsies, kan den som rekrutterer, påvirke hvilke pasienter som havner i hvilken gruppe.

Gå gjennom baselinetabellen, men bruk ikke utelukkende signifikanstester for å vurdere randomiseringen. Tilfeldige ubalanser kan oppstå. Store eller usannsynlige forskjeller i flere prognostisk viktige variabler kan derimot begrunne nærmere gransking av prosessen.

Blinding og avvik fra behandling

Blinding reduserer risikoen for at forventninger påvirker behandling, samtidig behandling, frafall eller utfallsmåling. Betydningen avhenger av utfallet. Totalmortalitet er mindre følsom for påvirkning fra bedømmer enn smerte, funksjonsskår eller beslutning om sykehusinnleggelse.

Dersom blinding ikke er mulig, spør om:

  • gruppene fikk ulik ivaretakelse eller samtidig behandling
  • etterlevelsen ble påvirket av kjennskap til behandlingen
  • avvikene var balanserte
  • utfallet ble vurdert av en uavhengig blindet komité
  • analysen estimerte effekten av tildeling eller effekten av faktisk behandling

Intention-to-treat og per protokoll

En intention-to-treat-analyse beholder deltakerne i den gruppen de ble randomisert til. Den bevarer randomiseringens sammenlignbarhet og estimerer vanligvis effekten av en behandlingsstrategi under studiens betingelser. En analyse etter faktisk behandling bryter randomiseringen og kan gjeninnføre konfundering.

Per protokoll-analyse inkluderer bare deltakere som fulgte protokollen etter forhåndsbestemte kriterier. Den kan være informativ, men er følsom for seleksjon, fordi etterlevelse ofte henger sammen med prognose. I superioritetsstudier er intention-to-treat vanligvis primær. I non-inferiority-studier er både intention-to-treat og per protokoll viktige, fordi avvik og behandlingskrysning kan gjøre gruppene mer like og dermed favorisere konklusjonen om non-inferiority.

Non-inferiority og ekvivalens

Non-inferiority innebærer at den nye behandlingen ikke er uakseptabelt mye dårligere enn kontrollen. Det er ikke det samme som at ingen statistisk signifikant forskjell er påvist. Kontroller:

  1. At non-inferiority-marginen ble definert før studien.
  2. At marginen har klinisk og empirisk begrunnelse.
  3. At den aktive kontrollen tidligere er vist å være effektiv i en lignende populasjon.
  4. At behandling, etterlevelse og utfallsmåling har vært gode nok til at forskjeller kunne oppdages.
  5. At konfidensintervallet i sin helhet ligger på riktig side av marginen.
  6. At både nytte og mulige fordeler, for eksempel færre bivirkninger eller enklere administrasjon, vurderes.

Ekvivalens krever at hele konfidensintervallet ligger innenfor to forhåndsbestemte grenser. Fravær av signifikant forskjell er ikke tilstrekkelig.

Frafall og manglende data

Rapporter frafall separat for hver gruppe og for hvert sentralt utfall. Vurder både andelen og årsakene. Fem prosent frafall kan være alvorlig dersom få hendelser har inntruffet og frafallet er relatert til prognose. Et større frafall kan gi mindre skjevhet dersom årsakene er uavhengige av behandling og utfall.

Komplett kasus-analyse er bare trygg under restriktive antakelser. Moderne metoder omfatter blant annet multippel imputering, sannsynlighetsbaserte modeller og vekting. Ingen metode gjenoppretter informasjon som aldri ble samlet inn. Antakelsene skal være klinisk rimelige, og sensitivitetsanalyser bør vise hvordan konklusjonen påvirkes dersom manglende utfall er dårligere i den ene gruppen. En metodeoversikt fra 2024 fant at mange studier fortsatt bruker metoder som i praksis krever den sterke antakelsen om at data mangler helt tilfeldig [7].

Selektiv rapportering og subgrupper

Et primært utfall bør være forhåndsbestemt. Mange sekundære utfall, tidspunkter, subgrupper og modellvarianter øker sannsynligheten for tilfeldig positive resultater.

En troverdig subgruppeeffekt bør helst:

  • være forhåndsbestemt og begrenset til få hypoteser
  • ha biologisk eller klinisk plausibilitet
  • vises med en formell interaksjonstest
  • være konsistent innen og mellom studier
  • bygge på tilstrekkelig mange deltakere og hendelser
  • ikke utelukkende baseres på signifikans i én gruppe og ikke-signifikans i en annen

Forskjellen mellom et signifikant og et ikke-signifikant resultat er ikke nødvendigvis signifikant. I en analyse av 928 Cochrane-oversikter var aldersrelaterte subgruppeanalyser planlagt i 20,4 prosent, men ble bare gjennomført i et lite mindretall. Flere analyser manglet formell interaksjonstest, og de observerte interaksjonene hadde svak støtte [8].

Skader og bivirkninger

Effektstudier har ofte utilstrekkelig statistisk styrke og for kort oppfølging for sjeldne eller sene skader. Vurder hvordan bivirkninger ble etterspurt, definert, kodet og tilskrevet. Aktiv, systematisk overvåking fanger opp flere hendelser enn spontane opplysninger.

Rapporten bør angi antall deltakere med minst én hendelse, antall hendelser, alvorlighetsgrad, behandlingsavbrudd, alvorlige hendelser og dødsfall i hver gruppe. CONSORT Harms anbefaler en integrert og forhåndsbestemt rapportering av nytte og skade [9]. I en systematisk gjennomgang av 61 randomiserte vaksinestudier rapporterte samtlige dødsfall og alvorlige bivirkninger, men bare seks beskrev hvordan tilbakevendende bivirkninger ble håndtert [10].

Observasjonsstudier

Observasjonsstudier er nødvendige for mange spørsmål om prognose, etiologi, sjeldne skader og behandling i klinisk rutine. De kan være svært store og presise, men presisjon eliminerer ikke systematiske feil.

Seleksjon og sammenlignbarhet

I en kohortstudie skal eksponerte og ikke-eksponerte representere sammenlignbare personer ved et tydelig definert startpunkt. I en kasus-kontroll-studie skal kontrollene representere den populasjonen kasusene oppstod i. I tverrsnittsstudier er tidsrekkefølgen mellom eksponering og sykdom ofte uklar.

Vurder om inklusjon, behandling eller fortsatt oppfølging avhenger av prognose. Eksempler er seleksjon av personer som har overlevd frem til studieinklusjon, eksklusjon av alvorlig syke pasienter eller informativt tap til oppfølging.

Konfundering

En konfunder er assosiert både med eksponeringen og utfallet uten å være en følge av eksponeringen. Confounding by indication er særlig viktig når sykere pasienter oftere får en bestemt behandling. En statistisk justert observasjonsstudie er ikke automatisk kausal. Justering kan bare håndtere variabler som er målt tilstrekkelig godt og modellert korrekt.

Kontroller:

  • om viktige konfundere ble identifisert ut fra klinisk kunnskap
  • når og hvordan de ble målt
  • om variabler etter behandlingsstart feilaktig ble justert bort
  • om gruppene hadde overlappende sannsynlighet for å få behandling
  • om balanse etter matching eller vekting ble rapportert
  • om sensitivitetsanalyser for ukjent konfundering ble gjort

En kartleggingsoversikt av 117 metodeartikler om sekundære helsedatabaser identifiserte konfundering, seleksjon og målefeil som de vanligste problemområdene. Confounding by indication, residual konfundering, feilklassifisering av utfall og immortal time bias var særlig fremtredende [11].

Propensity score kan brukes til matching, stratifisering, vekting eller justering, men gjør ikke ukjente konfundere sammenlignbare. I en oversikt over 127 sammenligninger mellom propensity score-analyser og randomiserte studier var forskjellen mellom designene stor i 54 prosent av sammenligningene [12].

Målefeil og feilklassifisering

Diagnoser, legemiddeleksponeringer og utfall i administrative registre er ofte skapt for behandling eller refusjon, ikke for forskning. Kontroller kodenes positive og negative prediktive verdi i relevant setting. En resept betyr ikke at legemidlet er hentet ut, og utlevering betyr ikke at det er tatt.

Ikke-differensiell feilklassifisering trekker ikke alltid mot null, særlig ikke ved flere kategorier, avhengige målefeil eller justerte modeller. Differensiell feilklassifisering kan gi skjevhet i hvilken som helst retning.

Tidsrelatert bias

Starten for eksponering, sammenligning og oppfølging må ligge på et felles, klinisk meningsfullt tidspunkt. Ved immortal time bias klassifiseres en periode der utfallet ikke kunne inntreffe, som eksponert tid, noe som ofte gir en tilsynelatende beskyttende effekt.

En robust legemiddelstudie bruker ofte:

  • nye brukere i stedet for personer som allerede har tolerert behandlingen
  • en aktiv sammenligningsbehandling med lignende indikasjon
  • samme definisjon av indeksdato i gruppene
  • tidsavhengig eksponeringsmodell når eksponeringen endres
  • tydelig håndtering av behandlingsbytte, avbrudd og konkurrerende hendelser

Diagnostiske studier

Diagnostisk treffsikkerhet er ikke en uforanderlig egenskap ved en test. Den varierer med sykdomsspektrum, prevalens, omsorgsnivå, tidligere testing og hvordan testen utføres [3]. QUADAS-2 vurderer pasientutvalg, indekstest, referansestandard samt pasientflyt og tid. De tre første domenene vurderes også med hensyn til anvendbarhet [13].

Pasientutvalg og klinisk rolle

Studien bør helst inkludere en konsekutiv eller tilfeldig serie pasienter der testen faktisk ville blitt brukt. Sammenligning mellom tydelig syke kasus og friske kontroller gir ofte overdrevet treffsikkerhet. Angi om testen skal brukes til screening, triage, diagnostisk bekreftelse, erstatning av en eksisterende test eller som tilleggstest.

Indekstest og referansestandard

Indekstesten og referansestandarden skal beskrives slik at de kan reproduseres. Referansestandarden må klassifisere måltilstanden tilstrekkelig korrekt. Dersom den som vurderer referansetesten, kjenner til indeksresultatet, kan samsvaret bli kunstig høyt.

Terskelverdier bør være forhåndsbestemt. En grenseverdi som velges etter at alle resultater er analysert, har en tendens til å prestere for optimistisk og trenger ekstern validering.

Alle deltakere bør i prinsippet gjennomgå samme referansestandard innenfor et klinisk rimelig tidsintervall. Dersom bare indekspositive pasienter får definitiv diagnostikk, oppstår partiell verifikasjonsbias.

Effektmål

Mål Definisjon Klinisk bruk
Sensitivitet Andel syke med positiv test Vurderer falskt negative resultater
Spesifisitet Andel ikke-syke med negativ test Vurderer falskt positive resultater
Positiv likelihood ratio Sensitivitet dividert med 1 minus spesifisitet Øker sannsynligheten for sykdom
Negativ likelihood ratio 1 minus sensitivitet dividert med spesifisitet Reduserer sannsynligheten for sykdom
Positiv prediktiv verdi Andel testpositive som er syke Avhenger av prevalens og pasientutvalg
Negativ prediktiv verdi Andel testnegative som ikke er syke Avhenger av prevalens og pasientutvalg

Sensitivitet og spesifisitet skal rapporteres med konfidensintervaller. En enkelt AUC-verdi kan skjule klinisk viktige forskjeller ved den grenseverdien som faktisk skal brukes. Det avgjørende spørsmålet er ofte om testresultatet endrer sannsynligheten tilstrekkelig til å endre behandling, videre utredning eller behov for oppfølging.

Systematiske oversikter og metaanalyser

En systematisk oversikt er en studie av studier. Den kan ikke kompensere for alvorlig bias i primærstudiene. PRISMA gir støtte for transparent rapportering [4], mens AMSTAR 2 er et vurderingsinstrument for oversikter over randomiserte og ikke-randomiserte intervensjonsstudier [14].

Søk og studieutvalg

Kontroller at spørsmålet og inklusjonskriteriene ble definert i en protokoll før søk og analyse. Søket bør omfatte flere relevante databaser, studieregistre, referanselister og ved behov upubliserte eller regulatoriske kilder. Fullstendige søkestrategier og siste søkedato skal rapporteres.

Studieutvalg og dataekstraksjon bør gjennomføres av minst to personer eller kontrolleres uavhengig. En liste over studier som ble ekskludert etter fulltekstvurdering, med årsaker, gjør det mulig å oppdage selektiv eksklusjon.

Risiko for bias og sammenstilling

Forfatterne skal bruke et designtilpasset instrument og integrere vurderingen i syntesen. Å bare presentere en poengsum er uegnet, fordi én enkelt kritisk svakhet kan være viktigere enn flere mindre svakheter. AMSTAR 2 fraråder uttrykkelig å summere de 16 punktene til én samlet kvalitetsskår [14].

Metaanalyse er bare rimelig når studiene er tilstrekkelig sammenlignbare med hensyn til populasjon, intervensjon, kontroll, utfall og tid. En random effects-tilnærming løser ikke klinisk inkompatibilitet. Når randomiserte og observasjonsbaserte resultater kombineres, kan svært store observasjonsstudier dominere og skape et presist, men skjevt sammendragsestimat.

Heterogenitet

Heterogenitet skal forstås klinisk og metodologisk, ikke utelukkende gjennom I². I² angir omtrent hvor stor andel av den observerte variasjonen som ikke forklares av utvalgsfeil, men påvirkes av studienes presisjon. En lav I² utelukker ikke klinisk viktig variasjon, og en høy I² trenger ikke innebære store absolutte forskjeller.

Ved random effects-metaanalyse er prediksjonsintervallet ofte mer klinisk informativt enn konfidensintervallet rundt gjennomsnittseffekten. Det estimerer hvilket intervall av sanne effekter som kan forventes i en lignende fremtidig setting. I en analyse av statistisk signifikante Cochrane-metaanalyser med heterogenitet inkluderte 72,4 prosent av prediksjonsintervallene nulleffekt, og 20,3 prosent inkluderte en effekt motsatt av sammendragsestimatet [15].

Publikasjonsbias

Små positive studier publiseres ofte lettere enn små negative studier. Funnel plot og asymmetritester kan støtte mistanke om småstudieeffekter, men er vanskelige å tolke ved heterogenitet og har lav styrke ved få studier. AMSTAR 2 angir at minst omtrent ti studier vanligvis trengs for å vurdere funnel plot-asymmetri på en meningsfull måte [14]. Et symmetrisk funnel plot beviser ikke at publikasjonsbias er fraværende.

Tolkning av statistiske resultater

Punktestimat og konfidensintervall

Punktestimatet er studiens beste enkeltestimat. Konfidensintervallet beskriver statistisk usikkerhet under modellens antakelser, men fanger ikke opp systematisk bias. Et smalt intervall rundt et skjevt estimat gir ikke et troverdig resultat.

Vurder om intervallet inkluderer:

  • ingen effekt
  • en klinisk betydningsfull nytte
  • en klinisk betydningsfull skade
  • både nytte og skade

Et resultat kan være statistisk signifikant, men klinisk trivielt. Det kan også være ikke-signifikant, men forenlig med en viktig effekt fordi intervallet er bredt.

Relative og absolutte effekter

Anta at risikoen for et utfall er 20 prosent i kontrollgruppen og 15 prosent i behandlingsgruppen.

  • Risikoratio: 0,15 / 0,20 = 0,75.
  • Relativ risikoreduksjon: 1 minus 0,75 = 25 prosent.
  • Absolutt risikoreduksjon: 20 minus 15 prosentpoeng = 5 prosentpoeng.
  • Number needed to treat: 1 / 0,05 = 20 i den studerte perioden.

NNT må alltid knyttes til populasjon, sammenligning og tidsperiode. Fordi den absolutte effekten avhenger av kontrollrisikoen, kan NNT ikke uten videre sammenlignes mellom studier. NNT bør beregnes ut fra en egnet absolutt risikodifferanse og rapporteres med usikkerhet. For tidsavhengige utfall endres NNT med valgt tidspunkt [16].

Odds ratio og hasardratio

Odds ratio ligger nær risikoratioen når utfallet er sjeldent, men kan fremstå som større når utfallet er vanlig. Dersom kontrollrisikoen er kjent, bør resultatet også uttrykkes som absolutt risiko.

En hasardratio sammenligner momentane hendelsesintensiteter under oppfølgingen og er ikke direkte en risikoratio eller en forskjell i overlevelsestid. Tolkningen forutsetter ofte proporsjonale hasarder. Ved kryssende eller sent separerende overlevelseskurver kan én enkelt hasardratio være misvisende. Begrenset gjennomsnittlig overlevelsestid frem til et forhåndsbestemt tidspunkt kan da være lettere å tolke [17].

P-verdier og multiple analyser

P-verdien angir hvor uforenlige dataene er med en spesifisert statistisk modell, ofte nullhypotesen. Den angir ikke sannsynligheten for at hypotesen er sann, effektens størrelse, klinisk betydning eller risikoen for bias.

Grensen 0,05 er en konvensjon, ikke et biologisk skille. Resultatene p = 0,049 og p = 0,051 utgjør normalt ikke kvalitativt forskjellig evidens. Tolk effektstørrelse, konfidensintervall, forhåndsplanlegging, antall analyser og studiens validitet.

Dersom 20 uavhengige hypoteser testes ved signifikansnivået 0,05, forventes i gjennomsnitt ett positivt resultat ved en tilfeldighet når alle nullhypotesene er sanne. Derfor trengs et forhåndsbestemt analysehierarki eller egnet kontroll for multiplisitet.

Robusthet og sensitivitetsanalyser

Sensitivitetsanalyser bør teste rimelige alternative antakelser, for eksempel:

  • ulike antakelser om manglende data
  • justerte og ujusterte analyser
  • eksklusjon av studier med høy risiko for bias
  • ulike modeller for heterogenitet
  • alternativ definisjon av eksponering eller utfall
  • håndtering av konkurrerende hendelser
  • per protokoll i tillegg til intention-to-treat når det er relevant

Dersom konklusjonen endres ved små, rimelige modellendringer, er evidensen skjør. Fragilitetsindeks, antallet hendelser som må endres for at et dikotomt signifikant resultat skal bli ikke-signifikant, kan illustrere en viss statistisk ustabilitet, men erstatter ikke konfidensintervall eller vurdering av risiko for bias. Kritiske oversikter har vist at fragilitetsindeksen i mange randomiserte studier har vært svært lav og noen ganger lavere enn antallet deltakere som gikk tapt for oppfølging [18].

Overførbarhet og klinisk betydning

Intern validitet må vurderes før generaliserbarhet. Et resultat med høy risiko for bias blir ikke nyttig bare fordi studiepopulasjonen ligner pasienten. Når den interne validiteten er akseptabel, vurderes:

  • likhet i alder, komorbiditet, sykdomsgrad og tidligere behandling
  • baselinerisiko og absolutt forventet nytte
  • omsorgsnivå, kompetanse og tilgjengelige ressurser
  • intervensjonens gjennomførbarhet og behandlingsbyrde
  • oppfølgingens lengde
  • pasientens verdier og mål
  • relevante bivirkninger og interaksjoner
  • om kontrollbehandlingen tilsvarer svensk praksis

Svenske anbefalinger, godkjente indikasjoner, refusjonsbegrensninger og helsetjenestestrukturer kan avvike fra internasjonale studier. En metodologisk god studie fastslår derfor ikke alene hva som bør gjøres i svensk helse- og omsorgstjeneste.

Fra enkeltstudie til samlet evidens

En klinisk beslutning bør sjelden bygge på én enkelt studie. GRADE vurderer tilliten til evidensen per utfall ut fra blant annet studiedesign, risiko for bias, inkonsistens, indirekthet, manglende presisjon og publikasjonsbias. Anbefalingens styrke påvirkes i tillegg av balansen mellom nytte og skade, pasientenes verdier og andre konsekvenser [19].

Domene Spørsmål ved endelig vurdering
Risiko for bias Kan studienes resultater være systematisk skjeve?
Inkonsistens Peker studiene i samme retning, og er variasjonen forståelig?
Indirekthet Tilsvarer populasjon, intervensjon, kontroll og utfall det kliniske spørsmålet?
Manglende presisjon Utelukker konfidensintervallet viktige alternative konklusjoner?
Publikasjonsbias Kan negative eller ugunstige resultater mangle?
Effektstørrelse Er effekten stor og klinisk relevant?
Absolutt effekt Hvor mange hendelser påvirkes ved pasientens baselinerisiko?
Nytte og skade Er den samlede balansen gunstig for denne pasienten?

Praktisk konklusjon etter vurderingen

Avslutt vurderingen med en strukturert konklusjon, ikke med en generell karakteristikk som «god studie» eller «lav evidens». Angi:

  1. Hvilket spørsmål studien faktisk besvarer.
  2. De viktigste styrkene.
  3. De viktigste risikoene for bias.
  4. Punktestimat, konfidensintervall og absolutt effekt.
  5. Om resultatene er robuste og forhåndsbestemte.
  6. Hvilke pasienter og behandlingsmiljøer resultatene gjelder for.
  7. Hvordan studien forholder seg til øvrig evidens.
  8. Hva resultatet rimeligvis innebærer for klinisk praksis.
  9. Hvilken usikkerhet som gjenstår.

Kritisk vurdering er ikke en jakt på feil som automatisk diskvalifiserer en studie. Hensikten er å avgjøre hvor mye vekt resultatet fortjener. En liten, men godt gjennomført studie kan gi verdifull, om enn usikker, informasjon. En svært stor studie kan gi stor presisjon, men likevel være ubrukelig dersom sammenligningsgruppene er dannet på en systematisk skjev måte. Den klinisk relevante konklusjonen ligger i kombinasjonen av validitet, effektstørrelse, presisjon, overførbarhet og samsvar med den samlede evidensen.

Kilder

  1. Hopewell S et al. CONSORT 2025 explanation and elaboration: updated guideline for reporting randomised trials. BMJ 2025. PMID: 40228832
  2. Vandenbroucke JP et al. Strengthening the Reporting of Observational Studies in Epidemiology (STROBE): explanation and elaboration. PLoS Medicine 2007. PMID: 17941715
  3. Cohen JF et al. STARD 2015 guidelines for reporting diagnostic accuracy studies: explanation and elaboration. BMJ Open 2016. PMID: 28137831
  4. Page MJ et al. PRISMA 2020 explanation and elaboration: updated guidance and exemplars for reporting systematic reviews. BMJ 2021. PMID: 33781993
  5. Hoffmann TC et al. Better reporting of interventions: template for intervention description and replication (TIDieR) checklist and guide. BMJ 2014. PMID: 24609605
  6. Sterne JAC et al. RoB 2: a revised tool for assessing risk of bias in randomised trials. BMJ 2019. PMID: 31462531
  7. Medcalf E et al. Addressing missing outcome data in randomised controlled trials: A methodological scoping review. Contemporary Clinical Trials 2024. PMID: 38857674
  8. Liu P et al. Age-treatment subgroup analyses in Cochrane intervention reviews: a meta-epidemiological study. BMC Medicine 2019. PMID: 31639007
  9. Junqueira DR et al. CONSORT Harms 2022 statement, explanation, and elaboration: updated guideline for the reporting of harms in randomized trials. Journal of Clinical Epidemiology 2023. PMID: 37100738
  10. Yuniar CT et al. Adverse Events Reporting Quality of Randomized Controlled Trials of COVID-19 Vaccine Using the CONSORT Criteria for Reporting Harms: A Systematic Review. Vaccines 2022. PMID: 35214773
  11. Prada-Ramallal G et al. Bias in pharmacoepidemiologic studies using secondary health care databases: a scoping review. BMC Medical Research Methodology 2019. PMID: 30871502
  12. Forbes SP, Dahabreh IJ. Benchmarking Observational Analyses Against Randomized Trials: a Review of Studies Assessing Propensity Score Methods. Journal of General Internal Medicine 2020. PMID: 32193818
  13. Whiting PF et al. QUADAS-2: a revised tool for the quality assessment of diagnostic accuracy studies. Annals of Internal Medicine 2011. PMID: 22007046
  14. Shea BJ et al. AMSTAR 2: a critical appraisal tool for systematic reviews that include randomised or non-randomised studies of healthcare interventions, or both. BMJ 2017. PMID: 28935701
  15. IntHout J et al. Plea for routinely presenting prediction intervals in meta-analysis. BMJ Open 2016. PMID: 27406637
  16. Okwuokenye M et al. Number Needed to Treat in Multiple Sclerosis Clinical Trials. Neurology and Therapy 2017. PMID: 28176189
  17. Jiménez JL. Quantifying treatment differences in confirmatory trials under non-proportional hazards. Journal of Applied Statistics 2022. PMID: 35707213
  18. Mielke D, Rohde V. Randomized controlled trials, a critical re-appraisal. Neurosurgical Review 2021. PMID: 33025186
  19. Guyatt G et al. GRADE guidelines: 1. Introduction, GRADE evidence profiles and summary of findings tables. Journal of Clinical Epidemiology 2011. PMID: 21195583

Oppdatert 29. september 2026