Sammendrag
Tolkning av studieresultater bør følge en fast rekkefølge. Begynn med problemstillingen, studiedesignet og det primære endepunktet. Vurder deretter risikoen for systematiske feil, les effektstørrelsen sammen med konfidensintervallet og oversett relative effekter til absolutte konsekvenser ved en relevant utgangsrisiko. Først etter dette bør p-verdien vurderes. Statistisk signifikans viser verken at effekten er klinisk viktig eller at resultatet er fritt for bias. Et ikke-signifikant resultat viser ikke at behandlingene er likeverdige.
Randomiserte studier gir som regel det beste grunnlaget for behandlingseffekter, men randomisering beskytter ikke mot manglende skjult allokering, frafall, selektiv rapportering eller uegnede analyser. Observasjonsstudier kan være nødvendige for prognose, sjeldne bivirkninger og langtidseffekter, men assosiasjoner må vurderes med særlig vekt på konfundering, seleksjon og tidsrelatert bias. Systematiske oversikter er ikke automatisk pålitelige. Verdien deres avhenger av litteratursøk, inklusjon av studier, risiko for bias, heterogenitet og publikasjonsskjevhet.
Til slutt skal resultatets overførbarhet vurderes opp mot den aktuelle pasientens risiko, komorbiditet, behandlingsalternativer, verdier og oppfølgingstid. En rimelig klinisk konklusjon gjør derfor rede for effektens retning, størrelse, usikkerhet, kunnskapsgrunnlagets pålitelighet og forventet absolutt nytte og skade.
En praktisk rekkefølge for tolkning
Rapporteringsretningslinjer som CONSORT, STROBE og PRISMA bedrer transparensen i rapporter om henholdsvis randomiserte studier, observasjonsstudier og systematiske oversikter [1-3]. De er derimot ikke kvalitetsstempler. En velskrevet studie kan være metodologisk svak, mens en mangelfullt rapportert studie av og til kan være godt gjennomført, men umulig å vurdere.
Følgende arbeidsgang reduserer risikoen for at konklusjonen styres av artikkelens tittel, sammendrag eller p-verdi:
flowchart TD
A["Formuler det kliniske spørsmålet<br>og identifiser studiedesignet"] --> B["Kontroller populasjon,<br>intervensjon, sammenligning og endepunkt"]
B --> C["Identifiser primært endepunkt<br>og forhåndsregistrert analyse"]
C --> D["Vurder risiko for systematiske feil<br>og frafall"]
D --> E["Les effektstørrelse og<br>konfidensintervall"]
E --> F["Beregn absolutt effekt<br>ved relevant utgangsrisiko"]
F --> G["Vurder klinisk betydning,<br>skader og oppfølgingstid"]
G --> H["Vurder samstemthet,<br>indirekthet og publikasjonsskjevhet"]
H --> I["Avgjør om resultatet er<br>overførbart til pasienten"]GRADE skiller mellom enkeltstudiers metodologiske kvalitet og påliteligheten i et samlet kunnskapsgrunnlag. Kunnskapsgrunnlagets pålitelighet graderes som høy, moderat, lav eller svært lav ut fra risiko for bias, inkonsistens, indirekthet, manglende presisjon og publikasjonsskjevhet. Graderingen av kunnskapsgrunnlaget skal holdes adskilt fra anbefalingens styrke, fordi også nytte, skade, ressursbruk og pasientpreferanser påvirker en klinisk beslutning [4].
Begynn med riktig spørsmål og riktig studiedesign
Strukturer spørsmålet
Et behandlingsspørsmål kan vanligvis beskrives med:
- Populasjon: Hvilke pasienter ble studert?
- Intervensjon: Hvilken behandling, dose, intensitet og behandlingsvarighet ble brukt?
- Sammenligning: Placebo, ingen behandling, standardbehandling eller aktiv kontroll?
- Endepunkt: Hvilke pasientviktige endepunkter ble målt?
- Tid: Når ble endepunktet målt?
Spørsmålet må samsvare med studiens estimand, altså den effekten analysen faktisk tar sikte på å estimere. Effekten av å bli tildelt behandling, effekten av å starte behandling og effekten av å følge behandlingen i henhold til protokollen er ulike spørsmål.
Velg studiedesign etter spørsmålet
| Klinisk spørsmål | Vanligvis mest informative design | Viktige begrensninger |
|---|---|---|
| Effekt av behandling eller forebygging | Randomisert kontrollert studie | Frafall, overkrysning, manglende blinding, kort oppfølging |
| Sjeldne eller sene bivirkninger | Stor kohort, registerstudie, kasus-kontroll-studie | Konfundering, feilklassifisering, seleksjon |
| Diagnostisk treffsikkerhet | Tverrsnittsstudie eller prospektiv kohort med relevant referansestandard | Spektrumbias, verifikasjonsbias, uegnet terskelverdi |
| Prognose | Inception-kohort med tilstrekkelig oppfølging | Selektivt frafall, overtilpasning, konkurrerende hendelser |
| Prevalens | Representativ tverrsnittsstudie | Utvalgs- og frafallsbias |
| Samlet behandlingseffekt | Systematisk oversikt og metaanalyse | Mangler i søk, primærstudier, syntese eller rapportering |
Studiedesignet bestemmer hvilke konklusjoner som er mulige. En randomisert studie kan gi støtte for en kausal behandlingseffekt. En observasjonsstudie viser primært en assosiasjon, også etter statistisk justering. En diagnostisk studie viser hvordan en test klassifiserer pasienter, ikke nødvendigvis om innføring av testen bedrer helsen.
Vurder intern validitet før resultatenes størrelse
Randomiserte studier
Randomisering skaper sammenlignbare grupper i forventning, men bare dersom tildelingssekvensen er tilfeldig og skjult frem til inklusjon. Skjult allokering skal ikke forveksles med blinding:
- Skjult allokering hindrer den som inkluderer pasienter, i å forutse neste tildeling.
- Blinding hindrer at deltakere, behandlere eller endepunktsvurderere påvirkes av kunnskap om tildelingen.
Metaepidemiologiske data viser at utilstrekkelig eller uklar sekvensgenerering og skjult allokering i gjennomsnitt er forbundet med overdrevne behandlingseffekter. Problemet er tydeligst for subjektivt vurderte endepunkter og ved manglende blinding av endepunktsvurderere [5].
Gjennomgå minst følgende:
- Var randomiseringsmetoden troverdig?
- Var tildelingen skjult frem til inklusjon?
- Var blinding mulig, gjennomført og sannsynligvis vellykket?
- Var primært endepunkt definert før innsyn i dataene?
- Ble gruppene analysert i henhold til opprinnelig tildeling?
- Hvor stort var frafallet, hvorfor oppstod det, og var det forskjellig mellom gruppene?
- Var oppfølgingen lang nok for både nytte og skade?
- Stemmer publikasjonen med protokoll, register og statistisk analyseplan?
Statistiske signifikanstester av baselinevariabler bør ikke brukes til å avgjøre om randomiseringen lyktes. Tilfeldige forskjeller er forventet. Viktigere er om forskjellene er prognostisk betydningsfulle, om de kan ha oppstått gjennom seleksjon etter randomisering, og om den planlagte analysen håndterte sterke prognostiske faktorer.
Intention-to-treat og per protokoll
En intention-to-treat-analyse sammenligner deltakerne etter randomisert gruppe, uavhengig av etterlevelse og overkrysning. Den bevarer randomiseringens prognostiske balanse og estimerer som regel effekten av en behandlingsstrategi eller behandlingstildeling.
En per-protokoll-analyse begrenser eller omklassifiserer deltakere etter etterlevelse. Den kan bedre tilnærme seg effekten av faktisk å følge behandlingen, men randomiseringens beskyttelse kan gå tapt fordi etterlevelse ofte henger sammen med prognose.
Begrepet modifisert intention-to-treat har ikke en enhetlig betydning. Les nøyaktig hvilke deltakere som er ekskludert. Eksklusjon etter randomisering, for eksempel av pasienter som aldri tok en dose eller manglet en bestemt prøve, kan skape seleksjonsbias.
Frafall og manglende data
Frafallsandelen alene avgjør ikke risikoen for bias. Fem prosent frafall kan være alvorlig dersom det er relatert til behandling og endepunkt, mens et større tilfeldig frafall av og til har mindre betydning. Vurder:
- absolutt antall og andel i hver gruppe
- årsaker og tidspunkt
- om endepunktet kunne ha inntruffet etter siste kontakt
- antakelser ved imputasjon
- sensitivitetsanalyser under alternative antakelser
En analyse av positive kardiovaskulære studier fant en medianverdi for fragilitetsindeks på 13. I omtrent 30 prosent av studiene oversteg antallet tapt for oppfølging fragilitetsindeksen [6]. Fragilitetsindeksen angir hvor få hendelser som må endres for at et signifikant binært resultat skal bli ikke-signifikant. Målet kan illustrere statistisk skjørhet, men erstatter ikke effektstørrelse, konfidensintervall eller risiko for bias.
Finansiering og interessekonflikter
Finansiering er ikke i seg selv bevis for at en studie er feil, men skal inngå i helhetsvurderingen. I en metodologisk Cochrane-oversikt var industrisponsede studier av legemidler og medisinsk utstyr oftere gunstige for sponsorens produkt, både når det gjaldt effektresultater og konklusjoner. Forskjellen ble ikke fullt ut forklart av vanlige risiko for bias-domener [7].
Kontroller derfor sponsorens rolle i design, datahåndtering, analyse, manuskript og beslutning om publisering. Les forfatternes økonomiske relasjoner og om uavhengige forskere hadde tilgang til fullstendige data.
Forstå effektmålene
Et studieresultat bør beskrives med tre komponenter:
- Punktestimatet, det estimatet som er mest forenlig med observerte data.
- Usikkerheten, vanligvis et 95 prosents konfidensintervall.
- Den kliniske skalaen, for eksempel absolutt risiko, symptomskår eller overlevelsestid.
Binære endepunkter
Anta hypotetisk at en hendelse inntreffer hos 20 prosent i kontrollgruppen og 15 prosent i behandlingsgruppen.
| Mål | Beregning | Resultat | Tolkning |
|---|---|---|---|
| Risiko i kontrollgruppen | 20 av 100 | 20 prosent | Utgangsrisiko |
| Risiko i behandlingsgruppen | 15 av 100 | 15 prosent | Risiko under behandling |
| Risikoratio, RR | 0,15 / 0,20 | 0,75 | Relativ risiko er 25 prosent lavere |
| Relativ risikoreduksjon | 1 minus 0,75 | 25 prosent | Relativ reduksjon |
| Absolutt risikoreduksjon | 0,20 minus 0,15 | 5 prosentpoeng | 5 færre hendelser per 100 |
| Number needed to treat, NNT | 1 / 0,05 | 20 | 20 må behandles i angitt tid for å forebygge én hendelse |
NNT skal alltid knyttes til populasjon, behandling, endepunkt og tid. En NNT på 20 etter fem år er ikke sammenlignbar med en NNT på 20 etter 30 dager. NNT avrundes vanligvis oppover til nærmeste heltall når den beskriver nytte. Ved skade brukes ofte number needed to harm, NNH.
Den absolutte effekten avhenger av utgangsrisikoen. Dersom RR 0,75 kan overføres til en populasjon med 4 prosents risiko, blir risikoen under behandling ca. 3 prosent, den absolutte risikoreduksjonen 1 prosentpoeng og NNT ca. 100. Den samme relative effekten kan derfor være klinisk betydningsfull hos høyrisikopasienter, men marginal hos lavrisikopasienter.
Oddsratio
Oddsratio, OR, sammenligner odds snarere enn risikoer. Dersom hendelsen er sjelden, ligger OR nær RR. Ved vanlige endepunkter kan OR gi et sterkere inntrykk av effekten og bør ikke beskrives som en risikoratio.
I kasus-kontroll-studier kan den absolutte risikoen normalt ikke beregnes direkte fra utvalget, fordi antallet kasus og kontroller bestemmes av studiedesignet. OR er der et naturlig assosiasjonsmål.
Kontinuerlige endepunkter
En gjennomsnittsdifferanse beholder den opprinnelige enheten, for eksempel 4 mm Hg lavere systolisk blodtrykk eller 1,5 poeng mindre smerte. Spør om forskjellen er større enn målefeilen og klinisk viktig.
Standardisert gjennomsnittsdifferanse brukes når studier måler samme fenomen med ulike skalaer. Resultatet uttrykkes i standardavvik og er mindre intuitivt. Den kliniske betydningen avhenger av skalaenes validitet og variasjonen i de studerte populasjonene.
En minste klinisk viktige forskjell er ingen universell naturkonstant. Den kan avhenge av utgangsverdi, sykdomsgrad, pasientperspektiv, metode og om endringen gjelder individ eller gruppe. Sammenlign derfor konfidensintervallet både med null og med en på forhånd begrunnet klinisk grense.
Tidsavhengige endepunkter
En hasardratio, HR, sammenligner den momentane hendelsesintensiteten mellom gruppene. HR 0,75 betyr ikke automatisk at 25 prosent av hendelsene forebygges, at overlevelsen forlenges med 25 prosent eller at risikoen på et bestemt tidspunkt er 25 prosent lavere.
Tolk HR sammen med:
- Kaplan-Meier-kurver eller kumulative insidenskurver
- antall pasienter under risiko over tid
- absolutte hendelsesrisikoer på klinisk relevante tidspunkter
- median oppfølging
- vurdering av antakelsen om proporsjonale hasarder
Dersom kurvene krysser hverandre, kan én enkelt HR være misvisende. Alternativer som begrenset gjennomsnittlig overlevelsestid kan da være mer informative.
Ved konkurrerende risikoer, for eksempel død av annen årsak før nyresvikt, kan vanlig Kaplan-Meier-metode overestimere sannsynligheten for det aktuelle endepunktet. I en gjennomgang av randomiserte studier med tidsavhengige endepunkter var 31 av 40 potensielt utsatt for konkurrerende risikoer, men bare fem rapporterte kumulativ insidensfunksjon [8]. Konkurrerende hendelser skal ikke ukritisk håndteres som vanlig sensurering.
Konfidensintervaller, p-verdier og klinisk betydning
Konfidensintervallet
Et 95 prosents konfidensintervall beskriver hvilke effektstørrelser som er forenlige med dataene og modellens antakelser. I gjentatte studier med samme metode ville 95 prosent av de beregnede intervallene dekke den sanne parameterverdien.
Nullverdien er:
- RR, OR eller HR = 1
- risikodifferanse eller gjennomsnittsdifferanse = 0
Et smalt intervall viser høyere presisjon enn et bredt intervall, men presisjon garanterer ikke riktighet. En svært stor observasjonsstudie kan gi et ekstremt smalt intervall rundt et skjevt estimat.
Fire vanlige mønstre er:
| Resultat | Konfidensintervall | Rimelig tolkning |
|---|---|---|
| Klinisk viktig effekt | Utelukker null og triviell effekt | Støtte for relevant effekt, ved lav risiko for bias |
| Statistisk signifikant, men triviell effekt | Utelukker null, men ligger nær klinisk grense | Sannsynligvis liten klinisk nytte |
| Ikke-signifikant og presist | Utelukker klinisk viktig effekt | Støtte mot en meningsfull effekt |
| Ikke-signifikant og upresist | Omfatter både viktig nytte og skade | Utilstrekkelig informasjon, ikke bevis for fravær av effekt |
P-verdien
P-verdien er sannsynligheten, gitt nullhypotesen og analysemodellens antakelser, for å observere et resultat minst like ekstremt som det oppnådde. Den er ikke:
- sannsynligheten for at nullhypotesen er sann
- sannsynligheten for at resultatet skyldes tilfeldigheter
- effektens størrelse
- sannsynligheten for at resultatet replikeres
- et mål på klinisk betydning
Grensen 0,05 er en konvensjon, ikke en biologisk skillelinje. Resultater med p = 0,049 og p = 0,051 bør ikke behandles som kvalitativt motsatte. Rapporter og tolk den eksakte p-verdien sammen med effektstørrelse og konfidensintervall.
Multiple analyser
Dersom 20 uavhengige hypoteser testes med signifikansnivå 0,05, er sannsynligheten for minst ett falskt positivt resultat ca. 64 prosent når alle nullhypotesene er sanne. Risikoen øker ved mange:
- endepunkter
- tidspunkter
- doser
- subgrupper
- statistiske modeller
- alternative definisjoner
Avgjør derfor om analysen var forhåndsdefinert, hierarkisk testet eller korrigert for multiplisitet. Et signifikant sekundært endepunkt veier lite dersom det primære endepunktet var negativt og det ikke fantes noen multiplisitetsstrategi.
Misvisende fremstilling, ofte kalt spin, innebærer at forfatterne fremhever sekundære endepunkter, subgrupper eller gunstige formuleringer selv om det primære endepunktet ikke støtter konklusjonen. I en systematisk gjennomgang av negative non-inferiority-studier innen onkologi ble spin identifisert i 75 prosent av rapportene [9]. Les derfor resultatdelen før diskusjonens konklusjon.
Endepunktenes relevans
Primære, sekundære og eksplorative endepunkter
Det primære endepunktet styrer vanligvis beregningen av utvalgsstørrelse og den viktigste hypotesetestingen. Sekundære endepunkter kan gi viktig tilleggsinformasjon, men har ofte lavere statistisk sikkerhet. Post hoc-analyser er hypotesegenererende.
Kontroller at:
- primært endepunkt er det samme i register, protokoll, analyseplan og publikasjon
- tidspunktet ikke er endret
- endepunktsdefinisjonen ikke er modifisert etter innsyn i dataene
- alle forhåndsdefinerte viktige endepunkter rapporteres
Pasientviktige endepunkter og surrogatendepunkter
Mortalitet, funksjon, symptomer, livskvalitet, sykehusinnleggelse og alvorlige komplikasjoner er vanligvis mer direkte relevante enn laboratorieverdier eller bildediagnostiske mål. Et surrogatendepunkt kan være nyttig dersom det er godt validert for den aktuelle sykdommen, virkningsmekanismen og pasientgruppen. Sammenheng mellom surrogatendepunkt og klinisk endepunkt er ikke tilstrekkelig. Det må også finnes støtte for at behandlingens effekt på surrogatendepunktet pålitelig predikerer effekten på det pasientviktige endepunktet.
Sammensatte endepunkter
Sammensatte endepunkter øker antallet hendelser og den statistiske presisjonen, men kan skjule hvilken komponent som driver resultatet. Vurder komponentene hver for seg med hensyn til:
- betydning for pasienten
- hyppighet
- effektens retning og størrelse
- følsomhet for vurdererens beslutning
Jo større forskjell i klinisk betydning og hyppighet mellom komponentene, desto mindre informativt er det sammensatte endepunktet. En reduksjon i kombinasjonen død, infarkt eller kontakt med helsetjenesten kan i sin helhet drives av flere kontakter med helsetjenesten uten påvist effekt på død eller infarkt [10].
Bivirkninger
Fravær av statistisk signifikant forskjell i bivirkninger viser sjelden at behandlingene er like sikre. Studier dimensjoneres vanligvis for effekt, ikke for sjeldne skader. Gjennomgå aktiv kontra passiv innsamling, definisjoner, eksponeringstid, antall behandlede og om behandlingsavbrudd er inkludert.
Publiserte artikler kan inneholde betydelig mindre skadeinformasjon enn kliniske studierapporter. I en sammenligning av fem orlistatstudier var metoder og fullstendige bivirkningsdata mer utførlig presentert i studierapportene enn i tidsskriftpublikasjonene [11]. For sikkerhetsvurdering trengs derfor ofte registerdata, regulatoriske rapporter og lengre observasjonsstudier i tillegg til randomiserte studier.
Spesielle studiedesign
Non-inferiority og ekvivalens
En non-inferiority-studie skal vise at den nye behandlingen ikke er dårligere enn kontrollen med mer enn en forhåndsdefinert margin. Den viser ikke at behandlingene er identiske. Marginen må være klinisk og metodologisk begrunnet.
Tolkningen bør baseres på konfidensintervallets forhold til både nulldifferansen og marginen. Både intention-to-treat- og per-protokoll-analyse er viktige, fordi manglende etterlevelse kan få behandlinger til å fremstå som mer like og dermed favorisere konklusjonen non-inferiority.
I en gjennomgang av 209 non-inferiority- og ekvivalensstudier var marginen definert i 94 prosent, men begrunnet i bare omtrent en fjerdedel. Både intention-to-treat- og per-protokoll-analyse ble rapportert i mindre enn halvparten, og 21 prosent av konklusjonene ble vurdert som feilaktige eller uforståelige [12].
Et ikke-signifikant resultat i en vanlig superiority-studie beviser ikke non-inferiority eller ekvivalens. Slike konklusjoner krever en særskilt utformet studie med forhåndsdefinert margin og tilstrekkelig presisjon.
Subgrupper
Et resultat som er signifikant i én undergruppe, men ikke i en annen, viser ikke at behandlingseffekten er forskjellig mellom gruppene. Det kreves en interaksjonstest.
En troverdig subgruppeeffekt bør:
- være forhåndsdefinert
- bygge på en biologisk eller klinisk rimelig hypotese
- gjelde få testede subgrupper
- vise en statistisk understøttet interaksjon
- være konsistent på tvers av beslektede endepunkter
- helst bekreftes i andre studier
Subgrupper basert på variabler målt etter randomisering, for eksempel etterlevelse eller tidlig behandlingsrespons, er særlig utsatt for bias.
Diagnostiske studier
Fra sensitivitet til klinisk beslutning
Sensitivitet er andelen syke som tester positivt. Spesifisitet er andelen ikke-syke som tester negativt. Disse målene påvirkes mindre direkte av prevalensen enn prediktive verdier, men varierer med sykdomsspektrum, terskelverdi, tidligere testing og klinisk setting [13].
Positiv prediktiv verdi angir sannsynligheten for sykdom etter positiv test i den studerte populasjonen. Negativ prediktiv verdi angir sannsynligheten for fravær av sykdom etter negativ test. Begge endres når prevalensen eller pasientseleksjonen endres.
Likelihood ratioer er ofte mer overførbare:
- Positiv likelihood ratio: sensitivitet / (1 minus spesifisitet)
- Negativ likelihood ratio: (1 minus sensitivitet) / spesifisitet
Posttest-odds beregnes som pretest-odds multiplisert med likelihood ratio. Sannsynlighet omregnes til odds med formelen .
En test med positiv likelihood ratio 10 gir en betydelig større økning i sykdomssannsynligheten enn en test med positiv likelihood ratio 2. Den kliniske nytten avhenger likevel av om posttest-sannsynligheten passerer en terskel for behandling, ytterligere testing eller avventende holdning.
Risiko for bias i diagnostiske studier
STARD anbefaler transparent rapportering av blant annet pasientseleksjon, indekstest, referansestandard, terskelverdier, blinding, ubestemte resultater og pasientflyt [14]. QUADAS-2 strukturerer vurderingen i fire domener: pasientseleksjon, indekstest, referansestandard samt flyt og tid [15].
Vær særlig oppmerksom på:
- kasus-kontroll-design med alvorlig syke kasus og friske kontroller
- eksklusjon av pasienter som er vanskelige å klassifisere
- at bare testpositive får referansestandarden
- ulike referansestandarder i ulike grupper
- kjennskap til indekstesten ved tolkning av referansestandarden
- datadrevet valg av optimal terskelverdi
- lang eller varierende tid mellom testene
AUC for en ROC-kurve oppsummerer diskriminering over mange mulige terskler, men avgjør ikke hvilken terskelverdi som er klinisk egnet, og tar ikke direkte hensyn til konsekvensene av falskt positive og falskt negative resultater.
Prognosemodeller og risikoprediksjon
En prognosemodell skal ikke vurderes bare ut fra statistisk signifikante prediktorer. Viktigere er:
- diskriminering, modellens evne til å rangere risiko
- kalibrering, samsvaret mellom predikert og observert risiko
- klinisk nytte ved relevante beslutningsterskler
- intern og ekstern validering
- håndtering av manglende data
- risiko for overtilpasning
En høy C-indeks kan forekomme samtidig med dårlig kalibrering. En modell kan altså rangere pasienter godt, men systematisk overestimere eller underestimere deres absolutte risiko. TRIPOD angir rapporteringskrav for utvikling, validering og oppdatering av diagnostiske og prognostiske modeller [16].
Resultater fra utviklingsdatasettet alene er ofte optimistiske. Tilfeldig oppdeling av et lite datasett i trenings- og testdel er vanligvis mindre effektivt enn å bruke hele datasettet med bootstrap eller kryssvalidering for intern validering. Klinisk bruk krever dessuten ekstern validering i en annen tidsperiode, setting eller populasjon.
Observasjonsstudier
Assosiasjon er ikke automatisk kausalitet
Konfundering oppstår når en faktor påvirker både eksponeringen og endepunktet. Ved konfundering ved indikasjon (confounding by indication) får for eksempel sykere pasienter oftere en behandling, noe som kan få behandlingen til å virke skadelig. Omvendt kan seleksjon av friskere behandlede pasienter skape en tilsynelatende nytte.
Statistisk justering eliminerer bare konfundering fra variabler som er målt tilstrekkelig godt og modellert korrekt. Propensity score, matching og regresjonsanalyse gjør ikke en observasjonsstudie randomisert.
Vurder særlig:
- hvordan behandlede og ubehandlede ble valgt ut
- om viktige prognostiske faktorer ble målt før behandling
- balanse før og etter justering
- overlapp i behandlingssannsynlighet
- feilklassifisering av eksponering og endepunkt
- negativ kontroll eller andre sensitivitetsanalyser
- om resultatene er robuste for ukjent konfundering
Tidsrelatert bias
Immortal time-bias oppstår når en pasient må overleve en viss periode for å bli klassifisert som eksponert, samtidig som denne perioden feilaktig regnes til den eksponerte gruppen. Det kan skape en kunstig overlevelsesfordel.
En nyttig måte å gjennomgå en observasjonsstudie av behandling på er å formulere den hypotetiske randomiserte målstudien som analysen forsøker å etterligne. Inklusjonskriterier, behandlingstildeling og start av oppfølging må sammenfalle. Manglende synkronisering kan skape immortal time-bias og seleksjonsbias selv om konfundering for øvrig er godt håndtert [17].
Systematiske oversikter og metaanalyser
Er oversikten virkelig systematisk?
PRISMA 2020 krever blant annet redegjørelse for søkestrategier, utvalg, risiko for bias, syntesemetoder, heterogenitet, sensitivitetsanalyser og kunnskapsgrunnlagets pålitelighet [3]. PRISMA vurderer rapportering, ikke metodologisk kvalitet.
AMSTAR 2 kan brukes til kritisk vurdering av systematiske oversikter. Særlig viktige domener er forhåndsregistrert protokoll, tilstrekkelig litteratursøk, begrunnelse for ekskluderte studier, vurdering av risiko for bias, egnet metaanalyse og hensyn til publikasjonsskjevhet. AMSTAR 2 skal ikke reduseres til en enkel totalsum, fordi en kritisk svakhet kan skjules av mange mindre godt gjennomførte elementer [18].
Tolk forest plot
Hver studies punktestimat og konfidensintervall skal leses før det sammenveide resultatet. Spør:
- Peker effektene i samme retning?
- Overlapper intervallene?
- Dominerer én enkelt stor studie?
- Er små studier mer gunstige?
- Er intervensjoner, populasjoner og endepunkter tilstrekkelig like?
- Er den sammenveide effekten klinisk forståelig?
En fixed effect-modell antar en felles underliggende effekt for alle studier. En random effects-modell tillater at den sanne effekten varierer mellom studier. Random effects løser ikke klinisk ulikhet og kan gi relativt større vekt til små studier.
Heterogenitet
Cochrans Q tester om variasjonen er større enn forventet ut fra tilfeldigheter, men har lav styrke ved få studier. estimerer andelen observert variasjon som tilskrives forskjeller mellom studier snarere enn utvalgsvariasjon. Verdien skal ikke tolkes mekanisk. Klinisk betydning avhenger av effektmål, presisjon, antall studier og variasjonens retning.
Tau i annen beskriver variansen mellom sanne studieeffekter på analysens skala. Et prediksjonsintervall estimerer innenfor hvilket intervall effekten i en ny sammenlignbar studie kan ligge. Ved betydelig heterogenitet er prediksjonsintervallet ofte mer klinisk informativt enn konfidensintervallet rundt gjennomsnittseffekten.
Småstudieeffekter og publikasjonsskjevhet
Asymmetri i funnel plot kan skyldes publikasjonsskjevhet, metodologiske svakheter, klinisk heterogenitet eller tilfeldigheter. Fravær av asymmetri utelukker ikke publikasjonsskjevhet, særlig når få studier inngår. AMSTAR 2 angir at funnel plot normalt krever minst omkring ti studier for en meningsfull vurdering [18].
I en metaepidemiologisk analyse av intensivmedisinske studier rapporterte små studier større gunstige effekter enn store studier. Små studier hadde også dårligere rapportert sekvensgenerering, skjult allokering, blinding og intention-to-treat-analyse [19]. Et sammenveid positivt resultat som i sin helhet drives av små studier, bør derfor betraktes som usikkert inntil det er bekreftet i større, godt gjennomførte studier.
Fra studie til pasient
Intern validitet kommer før ekstern validitet. Et sterkt skjevt resultat blir ikke klinisk nyttig bare fordi pasientene ligner den aktuelle pasienten. Når den interne validiteten er akseptabel, bør følgende sammenlignes:
| Studieegenskap | Klinisk spørsmål |
|---|---|
| Alder og skrøpelighet | Er pasienten eldre, skrøpeligere eller mer multimorbid? |
| Sykdomsgrad | Er utgangsrisikoen sammenlignbar? |
| Komorbiditet | Ble vanlige samtidige sykdommer ekskludert? |
| Samtidig behandling | Tilsvarer kontrollgruppen dagens standardbehandling? |
| Behandlingsintensitet | Kan dose, monitorering og etterlevelse oppnås? |
| Endepunkt | Er det viktig for pasienten? |
| Oppfølging | Er den tilstrekkelig for forventet nytte og skade? |
| Behandlingssetting | Kan resultatene overføres til svensk helsetjeneste? |
Nasjonale behandlingsbegrensninger, refusjonsordninger og organisatoriske forutsetninger kan avvike fra internasjonale studier. Slike forskjeller må kontrolleres mot gjeldende svenske anbefalinger og produktinformasjon før resultatet omsettes i klinisk praksis.
En klinisk nyttig konklusjon kan formuleres slik:
Hos pasienter som ligner den studerte populasjonen, reduserte behandlingen det primære pasientviktige endepunktet relativt, men den absolutte effekten var avhengig av utgangsrisikoen. Konfidensintervallet var forenlig med mellom X og Y færre hendelser per 1 000 behandlede i løpet av Z år. Risikoen for bias var lav eller moderat, men overførbarheten var begrenset av kort oppfølging og få skrøpelige pasienter.
En slik formulering er mer informativ enn at behandlingen var effektiv, positiv eller statistisk signifikant.
Sjekkliste ved journal club eller klinisk beslutning
- Er spørsmålet relevant og tydelig definert?
- Er studiedesignet egnet for spørsmålet?
- Hva var det forhåndsdefinerte primære endepunktet?
- Er endepunktet pasientviktig?
- Var randomisering, skjult allokering og blinding adekvate?
- Hvordan ble frafall, overkrysning og manglende data håndtert?
- Stemmer artikkel, protokoll, register og analyseplan overens?
- Hvor stor er effekten relativt og absolutt?
- Hvor bredt er konfidensintervallet?
- Utelukker intervallet både ingen effekt og klinisk viktig effekt?
- Er multiple endepunkter, subgrupper eller tidspunkter analysert?
- Drives et sammensatt endepunkt av mindre viktige komponenter?
- Er sikkerhetsdataene tilstrekkelige?
- Er resultatet samstemt med andre studier?
- Foreligger heterogenitet, småstudieeffekter eller publikasjonsskjevhet?
- Er finansiering og forfatterinteresser transparente?
- Ligner studiepopulasjonen den aktuelle pasienten?
- Hvordan endres den absolutte nytten ved pasientens utgangsrisiko?
- Er behandlingens byrde og skaderisiko akseptable?
- Hvor høy er påliteligheten i det samlede kunnskapsgrunnlaget?
Kilder
- Moher D et al. CONSORT 2010 explanation and elaboration: updated guidelines for reporting parallel group randomised trials. International Journal of Surgery 2012. PMID: 22036893
- Vandenbroucke JP et al. Strengthening the Reporting of Observational Studies in Epidemiology (STROBE): explanation and elaboration. PLoS Medicine 2007. PMID: 17941715
- Page MJ et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ 2021. PMID: 33782057
- Balshem H et al. GRADE guidelines: 3. Rating the quality of evidence. Journal of Clinical Epidemiology 2011. PMID: 21208779
- Page MJ et al. Empirical Evidence of Study Design Biases in Randomized Trials: Systematic Review of Meta-Epidemiological Studies. PLoS One 2016. PMID: 27398997
- Khan MS et al. Fragility Index in Cardiovascular Randomized Controlled Trials. Circulation: Cardiovascular Quality and Outcomes 2019. PMID: 31822121
- Lundh A et al. Industry sponsorship and research outcome. Cochrane Database of Systematic Reviews 2017. PMID: 28207928
- Austin PC, Fine JP. Accounting for competing risks in randomized controlled trials: a review and recommendations for improvement. Statistics in Medicine 2017. PMID: 28102550
- Ito C et al. Misleading Reporting (Spin) in Noninferiority Randomized Clinical Trials in Oncology With Statistically Not Significant Results: A Systematic Review. JAMA Network Open 2021. PMID: 34874407
- McCoy CE. Understanding the Use of Composite Endpoints in Clinical Trials. Western Journal of Emergency Medicine 2018. PMID: 30013696
- Hodkinson A et al. Reporting of harms outcomes: a comparison of journal publications with unpublished clinical study reports of orlistat trials. Trials 2016. PMID: 27103582
- Schiller P et al. Quality of reporting of clinical non-inferiority and equivalence randomised trials: update and extension. Trials 2012. PMID: 23157733
- Fischer JE et al. A readers' guide to the interpretation of diagnostic test properties: clinical example of sepsis. Intensive Care Medicine 2003. PMID: 12734652
- Cohen JF et al. STARD 2015 guidelines for reporting diagnostic accuracy studies: explanation and elaboration. BMJ Open 2016. PMID: 28137831
- Whiting PF et al. QUADAS-2: a revised tool for the quality assessment of diagnostic accuracy studies. Annals of Internal Medicine 2011. PMID: 22007046
- Collins GS et al. Transparent reporting of a multivariable prediction model for individual prognosis or diagnosis (TRIPOD): the TRIPOD statement. BMJ 2015. PMID: 25569120
- Hernán MA et al. Specifying a target trial prevents immortal time bias and other self-inflicted injuries in observational analyses. Journal of Clinical Epidemiology 2016. PMID: 27237061
- Shea BJ et al. AMSTAR 2: a critical appraisal tool for systematic reviews that include randomised or non-randomised studies of healthcare interventions, or both. BMJ 2017. PMID: 28935701
- Zhang Z et al. Small studies may overestimate the effect sizes in critical care meta-analyses: a meta-epidemiological study. Critical Care 2013. PMID: 23302257