Kunnskapsbasert medisin: tolkning av studieresultater

Sammendrag

Tolkning av studieresultater bør følge en fast rekkefølge. Begynn med problemstillingen, studiedesignet og det primære endepunktet. Vurder deretter risikoen for systematiske feil, les effektstørrelsen sammen med konfidensintervallet og oversett relative effekter til absolutte konsekvenser ved en relevant utgangsrisiko. Først etter dette bør p-verdien vurderes. Statistisk signifikans viser verken at effekten er klinisk viktig eller at resultatet er fritt for bias. Et ikke-signifikant resultat viser ikke at behandlingene er likeverdige.

Randomiserte studier gir som regel det beste grunnlaget for behandlingseffekter, men randomisering beskytter ikke mot manglende skjult allokering, frafall, selektiv rapportering eller uegnede analyser. Observasjonsstudier kan være nødvendige for prognose, sjeldne bivirkninger og langtidseffekter, men assosiasjoner må vurderes med særlig vekt på konfundering, seleksjon og tidsrelatert bias. Systematiske oversikter er ikke automatisk pålitelige. Verdien deres avhenger av litteratursøk, inklusjon av studier, risiko for bias, heterogenitet og publikasjonsskjevhet.

Til slutt skal resultatets overførbarhet vurderes opp mot den aktuelle pasientens risiko, komorbiditet, behandlingsalternativer, verdier og oppfølgingstid. En rimelig klinisk konklusjon gjør derfor rede for effektens retning, størrelse, usikkerhet, kunnskapsgrunnlagets pålitelighet og forventet absolutt nytte og skade.

En praktisk rekkefølge for tolkning

Rapporteringsretningslinjer som CONSORT, STROBE og PRISMA bedrer transparensen i rapporter om henholdsvis randomiserte studier, observasjonsstudier og systematiske oversikter [1-3]. De er derimot ikke kvalitetsstempler. En velskrevet studie kan være metodologisk svak, mens en mangelfullt rapportert studie av og til kan være godt gjennomført, men umulig å vurdere.

Følgende arbeidsgang reduserer risikoen for at konklusjonen styres av artikkelens tittel, sammendrag eller p-verdi:

flowchart TD
A["Formuler det kliniske spørsmålet<br>og identifiser studiedesignet"] --> B["Kontroller populasjon,<br>intervensjon, sammenligning og endepunkt"]
B --> C["Identifiser primært endepunkt<br>og forhåndsregistrert analyse"]
C --> D["Vurder risiko for systematiske feil<br>og frafall"]
D --> E["Les effektstørrelse og<br>konfidensintervall"]
E --> F["Beregn absolutt effekt<br>ved relevant utgangsrisiko"]
F --> G["Vurder klinisk betydning,<br>skader og oppfølgingstid"]
G --> H["Vurder samstemthet,<br>indirekthet og publikasjonsskjevhet"]
H --> I["Avgjør om resultatet er<br>overførbart til pasienten"]

GRADE skiller mellom enkeltstudiers metodologiske kvalitet og påliteligheten i et samlet kunnskapsgrunnlag. Kunnskapsgrunnlagets pålitelighet graderes som høy, moderat, lav eller svært lav ut fra risiko for bias, inkonsistens, indirekthet, manglende presisjon og publikasjonsskjevhet. Graderingen av kunnskapsgrunnlaget skal holdes adskilt fra anbefalingens styrke, fordi også nytte, skade, ressursbruk og pasientpreferanser påvirker en klinisk beslutning [4].

Begynn med riktig spørsmål og riktig studiedesign

Strukturer spørsmålet

Et behandlingsspørsmål kan vanligvis beskrives med:

  • Populasjon: Hvilke pasienter ble studert?
  • Intervensjon: Hvilken behandling, dose, intensitet og behandlingsvarighet ble brukt?
  • Sammenligning: Placebo, ingen behandling, standardbehandling eller aktiv kontroll?
  • Endepunkt: Hvilke pasientviktige endepunkter ble målt?
  • Tid: Når ble endepunktet målt?

Spørsmålet må samsvare med studiens estimand, altså den effekten analysen faktisk tar sikte på å estimere. Effekten av å bli tildelt behandling, effekten av å starte behandling og effekten av å følge behandlingen i henhold til protokollen er ulike spørsmål.

Velg studiedesign etter spørsmålet

Klinisk spørsmål Vanligvis mest informative design Viktige begrensninger
Effekt av behandling eller forebygging Randomisert kontrollert studie Frafall, overkrysning, manglende blinding, kort oppfølging
Sjeldne eller sene bivirkninger Stor kohort, registerstudie, kasus-kontroll-studie Konfundering, feilklassifisering, seleksjon
Diagnostisk treffsikkerhet Tverrsnittsstudie eller prospektiv kohort med relevant referansestandard Spektrumbias, verifikasjonsbias, uegnet terskelverdi
Prognose Inception-kohort med tilstrekkelig oppfølging Selektivt frafall, overtilpasning, konkurrerende hendelser
Prevalens Representativ tverrsnittsstudie Utvalgs- og frafallsbias
Samlet behandlingseffekt Systematisk oversikt og metaanalyse Mangler i søk, primærstudier, syntese eller rapportering

Studiedesignet bestemmer hvilke konklusjoner som er mulige. En randomisert studie kan gi støtte for en kausal behandlingseffekt. En observasjonsstudie viser primært en assosiasjon, også etter statistisk justering. En diagnostisk studie viser hvordan en test klassifiserer pasienter, ikke nødvendigvis om innføring av testen bedrer helsen.

Vurder intern validitet før resultatenes størrelse

Randomiserte studier

Randomisering skaper sammenlignbare grupper i forventning, men bare dersom tildelingssekvensen er tilfeldig og skjult frem til inklusjon. Skjult allokering skal ikke forveksles med blinding:

  • Skjult allokering hindrer den som inkluderer pasienter, i å forutse neste tildeling.
  • Blinding hindrer at deltakere, behandlere eller endepunktsvurderere påvirkes av kunnskap om tildelingen.

Metaepidemiologiske data viser at utilstrekkelig eller uklar sekvensgenerering og skjult allokering i gjennomsnitt er forbundet med overdrevne behandlingseffekter. Problemet er tydeligst for subjektivt vurderte endepunkter og ved manglende blinding av endepunktsvurderere [5].

Gjennomgå minst følgende:

  1. Var randomiseringsmetoden troverdig?
  2. Var tildelingen skjult frem til inklusjon?
  3. Var blinding mulig, gjennomført og sannsynligvis vellykket?
  4. Var primært endepunkt definert før innsyn i dataene?
  5. Ble gruppene analysert i henhold til opprinnelig tildeling?
  6. Hvor stort var frafallet, hvorfor oppstod det, og var det forskjellig mellom gruppene?
  7. Var oppfølgingen lang nok for både nytte og skade?
  8. Stemmer publikasjonen med protokoll, register og statistisk analyseplan?

Statistiske signifikanstester av baselinevariabler bør ikke brukes til å avgjøre om randomiseringen lyktes. Tilfeldige forskjeller er forventet. Viktigere er om forskjellene er prognostisk betydningsfulle, om de kan ha oppstått gjennom seleksjon etter randomisering, og om den planlagte analysen håndterte sterke prognostiske faktorer.

Intention-to-treat og per protokoll

En intention-to-treat-analyse sammenligner deltakerne etter randomisert gruppe, uavhengig av etterlevelse og overkrysning. Den bevarer randomiseringens prognostiske balanse og estimerer som regel effekten av en behandlingsstrategi eller behandlingstildeling.

En per-protokoll-analyse begrenser eller omklassifiserer deltakere etter etterlevelse. Den kan bedre tilnærme seg effekten av faktisk å følge behandlingen, men randomiseringens beskyttelse kan gå tapt fordi etterlevelse ofte henger sammen med prognose.

Begrepet modifisert intention-to-treat har ikke en enhetlig betydning. Les nøyaktig hvilke deltakere som er ekskludert. Eksklusjon etter randomisering, for eksempel av pasienter som aldri tok en dose eller manglet en bestemt prøve, kan skape seleksjonsbias.

Frafall og manglende data

Frafallsandelen alene avgjør ikke risikoen for bias. Fem prosent frafall kan være alvorlig dersom det er relatert til behandling og endepunkt, mens et større tilfeldig frafall av og til har mindre betydning. Vurder:

  • absolutt antall og andel i hver gruppe
  • årsaker og tidspunkt
  • om endepunktet kunne ha inntruffet etter siste kontakt
  • antakelser ved imputasjon
  • sensitivitetsanalyser under alternative antakelser

En analyse av positive kardiovaskulære studier fant en medianverdi for fragilitetsindeks på 13. I omtrent 30 prosent av studiene oversteg antallet tapt for oppfølging fragilitetsindeksen [6]. Fragilitetsindeksen angir hvor få hendelser som må endres for at et signifikant binært resultat skal bli ikke-signifikant. Målet kan illustrere statistisk skjørhet, men erstatter ikke effektstørrelse, konfidensintervall eller risiko for bias.

Finansiering og interessekonflikter

Finansiering er ikke i seg selv bevis for at en studie er feil, men skal inngå i helhetsvurderingen. I en metodologisk Cochrane-oversikt var industrisponsede studier av legemidler og medisinsk utstyr oftere gunstige for sponsorens produkt, både når det gjaldt effektresultater og konklusjoner. Forskjellen ble ikke fullt ut forklart av vanlige risiko for bias-domener [7].

Kontroller derfor sponsorens rolle i design, datahåndtering, analyse, manuskript og beslutning om publisering. Les forfatternes økonomiske relasjoner og om uavhengige forskere hadde tilgang til fullstendige data.

Forstå effektmålene

Et studieresultat bør beskrives med tre komponenter:

  1. Punktestimatet, det estimatet som er mest forenlig med observerte data.
  2. Usikkerheten, vanligvis et 95 prosents konfidensintervall.
  3. Den kliniske skalaen, for eksempel absolutt risiko, symptomskår eller overlevelsestid.

Binære endepunkter

Anta hypotetisk at en hendelse inntreffer hos 20 prosent i kontrollgruppen og 15 prosent i behandlingsgruppen.

Mål Beregning Resultat Tolkning
Risiko i kontrollgruppen 20 av 100 20 prosent Utgangsrisiko
Risiko i behandlingsgruppen 15 av 100 15 prosent Risiko under behandling
Risikoratio, RR 0,15 / 0,20 0,75 Relativ risiko er 25 prosent lavere
Relativ risikoreduksjon 1 minus 0,75 25 prosent Relativ reduksjon
Absolutt risikoreduksjon 0,20 minus 0,15 5 prosentpoeng 5 færre hendelser per 100
Number needed to treat, NNT 1 / 0,05 20 20 må behandles i angitt tid for å forebygge én hendelse

NNT skal alltid knyttes til populasjon, behandling, endepunkt og tid. En NNT på 20 etter fem år er ikke sammenlignbar med en NNT på 20 etter 30 dager. NNT avrundes vanligvis oppover til nærmeste heltall når den beskriver nytte. Ved skade brukes ofte number needed to harm, NNH.

Den absolutte effekten avhenger av utgangsrisikoen. Dersom RR 0,75 kan overføres til en populasjon med 4 prosents risiko, blir risikoen under behandling ca. 3 prosent, den absolutte risikoreduksjonen 1 prosentpoeng og NNT ca. 100. Den samme relative effekten kan derfor være klinisk betydningsfull hos høyrisikopasienter, men marginal hos lavrisikopasienter.

Oddsratio

Oddsratio, OR, sammenligner odds snarere enn risikoer. Dersom hendelsen er sjelden, ligger OR nær RR. Ved vanlige endepunkter kan OR gi et sterkere inntrykk av effekten og bør ikke beskrives som en risikoratio.

I kasus-kontroll-studier kan den absolutte risikoen normalt ikke beregnes direkte fra utvalget, fordi antallet kasus og kontroller bestemmes av studiedesignet. OR er der et naturlig assosiasjonsmål.

Kontinuerlige endepunkter

En gjennomsnittsdifferanse beholder den opprinnelige enheten, for eksempel 4 mm Hg lavere systolisk blodtrykk eller 1,5 poeng mindre smerte. Spør om forskjellen er større enn målefeilen og klinisk viktig.

Standardisert gjennomsnittsdifferanse brukes når studier måler samme fenomen med ulike skalaer. Resultatet uttrykkes i standardavvik og er mindre intuitivt. Den kliniske betydningen avhenger av skalaenes validitet og variasjonen i de studerte populasjonene.

En minste klinisk viktige forskjell er ingen universell naturkonstant. Den kan avhenge av utgangsverdi, sykdomsgrad, pasientperspektiv, metode og om endringen gjelder individ eller gruppe. Sammenlign derfor konfidensintervallet både med null og med en på forhånd begrunnet klinisk grense.

Tidsavhengige endepunkter

En hasardratio, HR, sammenligner den momentane hendelsesintensiteten mellom gruppene. HR 0,75 betyr ikke automatisk at 25 prosent av hendelsene forebygges, at overlevelsen forlenges med 25 prosent eller at risikoen på et bestemt tidspunkt er 25 prosent lavere.

Tolk HR sammen med:

  • Kaplan-Meier-kurver eller kumulative insidenskurver
  • antall pasienter under risiko over tid
  • absolutte hendelsesrisikoer på klinisk relevante tidspunkter
  • median oppfølging
  • vurdering av antakelsen om proporsjonale hasarder

Dersom kurvene krysser hverandre, kan én enkelt HR være misvisende. Alternativer som begrenset gjennomsnittlig overlevelsestid kan da være mer informative.

Ved konkurrerende risikoer, for eksempel død av annen årsak før nyresvikt, kan vanlig Kaplan-Meier-metode overestimere sannsynligheten for det aktuelle endepunktet. I en gjennomgang av randomiserte studier med tidsavhengige endepunkter var 31 av 40 potensielt utsatt for konkurrerende risikoer, men bare fem rapporterte kumulativ insidensfunksjon [8]. Konkurrerende hendelser skal ikke ukritisk håndteres som vanlig sensurering.

Konfidensintervaller, p-verdier og klinisk betydning

Konfidensintervallet

Et 95 prosents konfidensintervall beskriver hvilke effektstørrelser som er forenlige med dataene og modellens antakelser. I gjentatte studier med samme metode ville 95 prosent av de beregnede intervallene dekke den sanne parameterverdien.

Nullverdien er:

  • RR, OR eller HR = 1
  • risikodifferanse eller gjennomsnittsdifferanse = 0

Et smalt intervall viser høyere presisjon enn et bredt intervall, men presisjon garanterer ikke riktighet. En svært stor observasjonsstudie kan gi et ekstremt smalt intervall rundt et skjevt estimat.

Fire vanlige mønstre er:

Resultat Konfidensintervall Rimelig tolkning
Klinisk viktig effekt Utelukker null og triviell effekt Støtte for relevant effekt, ved lav risiko for bias
Statistisk signifikant, men triviell effekt Utelukker null, men ligger nær klinisk grense Sannsynligvis liten klinisk nytte
Ikke-signifikant og presist Utelukker klinisk viktig effekt Støtte mot en meningsfull effekt
Ikke-signifikant og upresist Omfatter både viktig nytte og skade Utilstrekkelig informasjon, ikke bevis for fravær av effekt

P-verdien

P-verdien er sannsynligheten, gitt nullhypotesen og analysemodellens antakelser, for å observere et resultat minst like ekstremt som det oppnådde. Den er ikke:

  • sannsynligheten for at nullhypotesen er sann
  • sannsynligheten for at resultatet skyldes tilfeldigheter
  • effektens størrelse
  • sannsynligheten for at resultatet replikeres
  • et mål på klinisk betydning

Grensen 0,05 er en konvensjon, ikke en biologisk skillelinje. Resultater med p = 0,049 og p = 0,051 bør ikke behandles som kvalitativt motsatte. Rapporter og tolk den eksakte p-verdien sammen med effektstørrelse og konfidensintervall.

Multiple analyser

Dersom 20 uavhengige hypoteser testes med signifikansnivå 0,05, er sannsynligheten for minst ett falskt positivt resultat ca. 64 prosent når alle nullhypotesene er sanne. Risikoen øker ved mange:

  • endepunkter
  • tidspunkter
  • doser
  • subgrupper
  • statistiske modeller
  • alternative definisjoner

Avgjør derfor om analysen var forhåndsdefinert, hierarkisk testet eller korrigert for multiplisitet. Et signifikant sekundært endepunkt veier lite dersom det primære endepunktet var negativt og det ikke fantes noen multiplisitetsstrategi.

Misvisende fremstilling, ofte kalt spin, innebærer at forfatterne fremhever sekundære endepunkter, subgrupper eller gunstige formuleringer selv om det primære endepunktet ikke støtter konklusjonen. I en systematisk gjennomgang av negative non-inferiority-studier innen onkologi ble spin identifisert i 75 prosent av rapportene [9]. Les derfor resultatdelen før diskusjonens konklusjon.

Endepunktenes relevans

Primære, sekundære og eksplorative endepunkter

Det primære endepunktet styrer vanligvis beregningen av utvalgsstørrelse og den viktigste hypotesetestingen. Sekundære endepunkter kan gi viktig tilleggsinformasjon, men har ofte lavere statistisk sikkerhet. Post hoc-analyser er hypotesegenererende.

Kontroller at:

  • primært endepunkt er det samme i register, protokoll, analyseplan og publikasjon
  • tidspunktet ikke er endret
  • endepunktsdefinisjonen ikke er modifisert etter innsyn i dataene
  • alle forhåndsdefinerte viktige endepunkter rapporteres

Pasientviktige endepunkter og surrogatendepunkter

Mortalitet, funksjon, symptomer, livskvalitet, sykehusinnleggelse og alvorlige komplikasjoner er vanligvis mer direkte relevante enn laboratorieverdier eller bildediagnostiske mål. Et surrogatendepunkt kan være nyttig dersom det er godt validert for den aktuelle sykdommen, virkningsmekanismen og pasientgruppen. Sammenheng mellom surrogatendepunkt og klinisk endepunkt er ikke tilstrekkelig. Det må også finnes støtte for at behandlingens effekt på surrogatendepunktet pålitelig predikerer effekten på det pasientviktige endepunktet.

Sammensatte endepunkter

Sammensatte endepunkter øker antallet hendelser og den statistiske presisjonen, men kan skjule hvilken komponent som driver resultatet. Vurder komponentene hver for seg med hensyn til:

  1. betydning for pasienten
  2. hyppighet
  3. effektens retning og størrelse
  4. følsomhet for vurdererens beslutning

Jo større forskjell i klinisk betydning og hyppighet mellom komponentene, desto mindre informativt er det sammensatte endepunktet. En reduksjon i kombinasjonen død, infarkt eller kontakt med helsetjenesten kan i sin helhet drives av flere kontakter med helsetjenesten uten påvist effekt på død eller infarkt [10].

Bivirkninger

Fravær av statistisk signifikant forskjell i bivirkninger viser sjelden at behandlingene er like sikre. Studier dimensjoneres vanligvis for effekt, ikke for sjeldne skader. Gjennomgå aktiv kontra passiv innsamling, definisjoner, eksponeringstid, antall behandlede og om behandlingsavbrudd er inkludert.

Publiserte artikler kan inneholde betydelig mindre skadeinformasjon enn kliniske studierapporter. I en sammenligning av fem orlistatstudier var metoder og fullstendige bivirkningsdata mer utførlig presentert i studierapportene enn i tidsskriftpublikasjonene [11]. For sikkerhetsvurdering trengs derfor ofte registerdata, regulatoriske rapporter og lengre observasjonsstudier i tillegg til randomiserte studier.

Spesielle studiedesign

Non-inferiority og ekvivalens

En non-inferiority-studie skal vise at den nye behandlingen ikke er dårligere enn kontrollen med mer enn en forhåndsdefinert margin. Den viser ikke at behandlingene er identiske. Marginen må være klinisk og metodologisk begrunnet.

Tolkningen bør baseres på konfidensintervallets forhold til både nulldifferansen og marginen. Både intention-to-treat- og per-protokoll-analyse er viktige, fordi manglende etterlevelse kan få behandlinger til å fremstå som mer like og dermed favorisere konklusjonen non-inferiority.

I en gjennomgang av 209 non-inferiority- og ekvivalensstudier var marginen definert i 94 prosent, men begrunnet i bare omtrent en fjerdedel. Både intention-to-treat- og per-protokoll-analyse ble rapportert i mindre enn halvparten, og 21 prosent av konklusjonene ble vurdert som feilaktige eller uforståelige [12].

Et ikke-signifikant resultat i en vanlig superiority-studie beviser ikke non-inferiority eller ekvivalens. Slike konklusjoner krever en særskilt utformet studie med forhåndsdefinert margin og tilstrekkelig presisjon.

Subgrupper

Et resultat som er signifikant i én undergruppe, men ikke i en annen, viser ikke at behandlingseffekten er forskjellig mellom gruppene. Det kreves en interaksjonstest.

En troverdig subgruppeeffekt bør:

  • være forhåndsdefinert
  • bygge på en biologisk eller klinisk rimelig hypotese
  • gjelde få testede subgrupper
  • vise en statistisk understøttet interaksjon
  • være konsistent på tvers av beslektede endepunkter
  • helst bekreftes i andre studier

Subgrupper basert på variabler målt etter randomisering, for eksempel etterlevelse eller tidlig behandlingsrespons, er særlig utsatt for bias.

Diagnostiske studier

Fra sensitivitet til klinisk beslutning

Sensitivitet er andelen syke som tester positivt. Spesifisitet er andelen ikke-syke som tester negativt. Disse målene påvirkes mindre direkte av prevalensen enn prediktive verdier, men varierer med sykdomsspektrum, terskelverdi, tidligere testing og klinisk setting [13].

Positiv prediktiv verdi angir sannsynligheten for sykdom etter positiv test i den studerte populasjonen. Negativ prediktiv verdi angir sannsynligheten for fravær av sykdom etter negativ test. Begge endres når prevalensen eller pasientseleksjonen endres.

Likelihood ratioer er ofte mer overførbare:

  • Positiv likelihood ratio: sensitivitet / (1 minus spesifisitet)
  • Negativ likelihood ratio: (1 minus sensitivitet) / spesifisitet

Posttest-odds beregnes som pretest-odds multiplisert med likelihood ratio. Sannsynlighet omregnes til odds med formelen p/(1−p)p/(1-p).

En test med positiv likelihood ratio 10 gir en betydelig større økning i sykdomssannsynligheten enn en test med positiv likelihood ratio 2. Den kliniske nytten avhenger likevel av om posttest-sannsynligheten passerer en terskel for behandling, ytterligere testing eller avventende holdning.

Risiko for bias i diagnostiske studier

STARD anbefaler transparent rapportering av blant annet pasientseleksjon, indekstest, referansestandard, terskelverdier, blinding, ubestemte resultater og pasientflyt [14]. QUADAS-2 strukturerer vurderingen i fire domener: pasientseleksjon, indekstest, referansestandard samt flyt og tid [15].

Vær særlig oppmerksom på:

  • kasus-kontroll-design med alvorlig syke kasus og friske kontroller
  • eksklusjon av pasienter som er vanskelige å klassifisere
  • at bare testpositive får referansestandarden
  • ulike referansestandarder i ulike grupper
  • kjennskap til indekstesten ved tolkning av referansestandarden
  • datadrevet valg av optimal terskelverdi
  • lang eller varierende tid mellom testene

AUC for en ROC-kurve oppsummerer diskriminering over mange mulige terskler, men avgjør ikke hvilken terskelverdi som er klinisk egnet, og tar ikke direkte hensyn til konsekvensene av falskt positive og falskt negative resultater.

Prognosemodeller og risikoprediksjon

En prognosemodell skal ikke vurderes bare ut fra statistisk signifikante prediktorer. Viktigere er:

  • diskriminering, modellens evne til å rangere risiko
  • kalibrering, samsvaret mellom predikert og observert risiko
  • klinisk nytte ved relevante beslutningsterskler
  • intern og ekstern validering
  • håndtering av manglende data
  • risiko for overtilpasning

En høy C-indeks kan forekomme samtidig med dårlig kalibrering. En modell kan altså rangere pasienter godt, men systematisk overestimere eller underestimere deres absolutte risiko. TRIPOD angir rapporteringskrav for utvikling, validering og oppdatering av diagnostiske og prognostiske modeller [16].

Resultater fra utviklingsdatasettet alene er ofte optimistiske. Tilfeldig oppdeling av et lite datasett i trenings- og testdel er vanligvis mindre effektivt enn å bruke hele datasettet med bootstrap eller kryssvalidering for intern validering. Klinisk bruk krever dessuten ekstern validering i en annen tidsperiode, setting eller populasjon.

Observasjonsstudier

Assosiasjon er ikke automatisk kausalitet

Konfundering oppstår når en faktor påvirker både eksponeringen og endepunktet. Ved konfundering ved indikasjon (confounding by indication) får for eksempel sykere pasienter oftere en behandling, noe som kan få behandlingen til å virke skadelig. Omvendt kan seleksjon av friskere behandlede pasienter skape en tilsynelatende nytte.

Statistisk justering eliminerer bare konfundering fra variabler som er målt tilstrekkelig godt og modellert korrekt. Propensity score, matching og regresjonsanalyse gjør ikke en observasjonsstudie randomisert.

Vurder særlig:

  • hvordan behandlede og ubehandlede ble valgt ut
  • om viktige prognostiske faktorer ble målt før behandling
  • balanse før og etter justering
  • overlapp i behandlingssannsynlighet
  • feilklassifisering av eksponering og endepunkt
  • negativ kontroll eller andre sensitivitetsanalyser
  • om resultatene er robuste for ukjent konfundering

Tidsrelatert bias

Immortal time-bias oppstår når en pasient må overleve en viss periode for å bli klassifisert som eksponert, samtidig som denne perioden feilaktig regnes til den eksponerte gruppen. Det kan skape en kunstig overlevelsesfordel.

En nyttig måte å gjennomgå en observasjonsstudie av behandling på er å formulere den hypotetiske randomiserte målstudien som analysen forsøker å etterligne. Inklusjonskriterier, behandlingstildeling og start av oppfølging må sammenfalle. Manglende synkronisering kan skape immortal time-bias og seleksjonsbias selv om konfundering for øvrig er godt håndtert [17].

Systematiske oversikter og metaanalyser

Er oversikten virkelig systematisk?

PRISMA 2020 krever blant annet redegjørelse for søkestrategier, utvalg, risiko for bias, syntesemetoder, heterogenitet, sensitivitetsanalyser og kunnskapsgrunnlagets pålitelighet [3]. PRISMA vurderer rapportering, ikke metodologisk kvalitet.

AMSTAR 2 kan brukes til kritisk vurdering av systematiske oversikter. Særlig viktige domener er forhåndsregistrert protokoll, tilstrekkelig litteratursøk, begrunnelse for ekskluderte studier, vurdering av risiko for bias, egnet metaanalyse og hensyn til publikasjonsskjevhet. AMSTAR 2 skal ikke reduseres til en enkel totalsum, fordi en kritisk svakhet kan skjules av mange mindre godt gjennomførte elementer [18].

Tolk forest plot

Hver studies punktestimat og konfidensintervall skal leses før det sammenveide resultatet. Spør:

  • Peker effektene i samme retning?
  • Overlapper intervallene?
  • Dominerer én enkelt stor studie?
  • Er små studier mer gunstige?
  • Er intervensjoner, populasjoner og endepunkter tilstrekkelig like?
  • Er den sammenveide effekten klinisk forståelig?

En fixed effect-modell antar en felles underliggende effekt for alle studier. En random effects-modell tillater at den sanne effekten varierer mellom studier. Random effects løser ikke klinisk ulikhet og kan gi relativt større vekt til små studier.

Heterogenitet

Cochrans Q tester om variasjonen er større enn forventet ut fra tilfeldigheter, men har lav styrke ved få studier. I2I^2 estimerer andelen observert variasjon som tilskrives forskjeller mellom studier snarere enn utvalgsvariasjon. Verdien skal ikke tolkes mekanisk. Klinisk betydning avhenger av effektmål, presisjon, antall studier og variasjonens retning.

Tau i annen beskriver variansen mellom sanne studieeffekter på analysens skala. Et prediksjonsintervall estimerer innenfor hvilket intervall effekten i en ny sammenlignbar studie kan ligge. Ved betydelig heterogenitet er prediksjonsintervallet ofte mer klinisk informativt enn konfidensintervallet rundt gjennomsnittseffekten.

Småstudieeffekter og publikasjonsskjevhet

Asymmetri i funnel plot kan skyldes publikasjonsskjevhet, metodologiske svakheter, klinisk heterogenitet eller tilfeldigheter. Fravær av asymmetri utelukker ikke publikasjonsskjevhet, særlig når få studier inngår. AMSTAR 2 angir at funnel plot normalt krever minst omkring ti studier for en meningsfull vurdering [18].

I en metaepidemiologisk analyse av intensivmedisinske studier rapporterte små studier større gunstige effekter enn store studier. Små studier hadde også dårligere rapportert sekvensgenerering, skjult allokering, blinding og intention-to-treat-analyse [19]. Et sammenveid positivt resultat som i sin helhet drives av små studier, bør derfor betraktes som usikkert inntil det er bekreftet i større, godt gjennomførte studier.

Fra studie til pasient

Intern validitet kommer før ekstern validitet. Et sterkt skjevt resultat blir ikke klinisk nyttig bare fordi pasientene ligner den aktuelle pasienten. Når den interne validiteten er akseptabel, bør følgende sammenlignes:

Studieegenskap Klinisk spørsmål
Alder og skrøpelighet Er pasienten eldre, skrøpeligere eller mer multimorbid?
Sykdomsgrad Er utgangsrisikoen sammenlignbar?
Komorbiditet Ble vanlige samtidige sykdommer ekskludert?
Samtidig behandling Tilsvarer kontrollgruppen dagens standardbehandling?
Behandlingsintensitet Kan dose, monitorering og etterlevelse oppnås?
Endepunkt Er det viktig for pasienten?
Oppfølging Er den tilstrekkelig for forventet nytte og skade?
Behandlingssetting Kan resultatene overføres til svensk helsetjeneste?

Nasjonale behandlingsbegrensninger, refusjonsordninger og organisatoriske forutsetninger kan avvike fra internasjonale studier. Slike forskjeller må kontrolleres mot gjeldende svenske anbefalinger og produktinformasjon før resultatet omsettes i klinisk praksis.

En klinisk nyttig konklusjon kan formuleres slik:

Hos pasienter som ligner den studerte populasjonen, reduserte behandlingen det primære pasientviktige endepunktet relativt, men den absolutte effekten var avhengig av utgangsrisikoen. Konfidensintervallet var forenlig med mellom X og Y færre hendelser per 1 000 behandlede i løpet av Z år. Risikoen for bias var lav eller moderat, men overførbarheten var begrenset av kort oppfølging og få skrøpelige pasienter.

En slik formulering er mer informativ enn at behandlingen var effektiv, positiv eller statistisk signifikant.

Sjekkliste ved journal club eller klinisk beslutning

  1. Er spørsmålet relevant og tydelig definert?
  2. Er studiedesignet egnet for spørsmålet?
  3. Hva var det forhåndsdefinerte primære endepunktet?
  4. Er endepunktet pasientviktig?
  5. Var randomisering, skjult allokering og blinding adekvate?
  6. Hvordan ble frafall, overkrysning og manglende data håndtert?
  7. Stemmer artikkel, protokoll, register og analyseplan overens?
  8. Hvor stor er effekten relativt og absolutt?
  9. Hvor bredt er konfidensintervallet?
  10. Utelukker intervallet både ingen effekt og klinisk viktig effekt?
  11. Er multiple endepunkter, subgrupper eller tidspunkter analysert?
  12. Drives et sammensatt endepunkt av mindre viktige komponenter?
  13. Er sikkerhetsdataene tilstrekkelige?
  14. Er resultatet samstemt med andre studier?
  15. Foreligger heterogenitet, småstudieeffekter eller publikasjonsskjevhet?
  16. Er finansiering og forfatterinteresser transparente?
  17. Ligner studiepopulasjonen den aktuelle pasienten?
  18. Hvordan endres den absolutte nytten ved pasientens utgangsrisiko?
  19. Er behandlingens byrde og skaderisiko akseptable?
  20. Hvor høy er påliteligheten i det samlede kunnskapsgrunnlaget?

Kilder

  1. Moher D et al. CONSORT 2010 explanation and elaboration: updated guidelines for reporting parallel group randomised trials. International Journal of Surgery 2012. PMID: 22036893
  2. Vandenbroucke JP et al. Strengthening the Reporting of Observational Studies in Epidemiology (STROBE): explanation and elaboration. PLoS Medicine 2007. PMID: 17941715
  3. Page MJ et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ 2021. PMID: 33782057
  4. Balshem H et al. GRADE guidelines: 3. Rating the quality of evidence. Journal of Clinical Epidemiology 2011. PMID: 21208779
  5. Page MJ et al. Empirical Evidence of Study Design Biases in Randomized Trials: Systematic Review of Meta-Epidemiological Studies. PLoS One 2016. PMID: 27398997
  6. Khan MS et al. Fragility Index in Cardiovascular Randomized Controlled Trials. Circulation: Cardiovascular Quality and Outcomes 2019. PMID: 31822121
  7. Lundh A et al. Industry sponsorship and research outcome. Cochrane Database of Systematic Reviews 2017. PMID: 28207928
  8. Austin PC, Fine JP. Accounting for competing risks in randomized controlled trials: a review and recommendations for improvement. Statistics in Medicine 2017. PMID: 28102550
  9. Ito C et al. Misleading Reporting (Spin) in Noninferiority Randomized Clinical Trials in Oncology With Statistically Not Significant Results: A Systematic Review. JAMA Network Open 2021. PMID: 34874407
  10. McCoy CE. Understanding the Use of Composite Endpoints in Clinical Trials. Western Journal of Emergency Medicine 2018. PMID: 30013696
  11. Hodkinson A et al. Reporting of harms outcomes: a comparison of journal publications with unpublished clinical study reports of orlistat trials. Trials 2016. PMID: 27103582
  12. Schiller P et al. Quality of reporting of clinical non-inferiority and equivalence randomised trials: update and extension. Trials 2012. PMID: 23157733
  13. Fischer JE et al. A readers' guide to the interpretation of diagnostic test properties: clinical example of sepsis. Intensive Care Medicine 2003. PMID: 12734652
  14. Cohen JF et al. STARD 2015 guidelines for reporting diagnostic accuracy studies: explanation and elaboration. BMJ Open 2016. PMID: 28137831
  15. Whiting PF et al. QUADAS-2: a revised tool for the quality assessment of diagnostic accuracy studies. Annals of Internal Medicine 2011. PMID: 22007046
  16. Collins GS et al. Transparent reporting of a multivariable prediction model for individual prognosis or diagnosis (TRIPOD): the TRIPOD statement. BMJ 2015. PMID: 25569120
  17. Hernán MA et al. Specifying a target trial prevents immortal time bias and other self-inflicted injuries in observational analyses. Journal of Clinical Epidemiology 2016. PMID: 27237061
  18. Shea BJ et al. AMSTAR 2: a critical appraisal tool for systematic reviews that include randomised or non-randomised studies of healthcare interventions, or both. BMJ 2017. PMID: 28935701
  19. Zhang Z et al. Small studies may overestimate the effect sizes in critical care meta-analyses: a meta-epidemiological study. Critical Care 2013. PMID: 23302257

Oppdatert 15. september 2026