Sammendrag
En systematisk oversikt bruker forhåndsdefinerte, transparente og reproduserbare metoder for å identifisere, velge ut, vurdere og sammenstille forskning som besvarer et avgrenset spørsmål. En metaanalyse er den statistiske sammenstillingen av resultater fra minst to studier. Begrepene er derfor ikke synonyme. En systematisk oversikt kan mangle metaanalyse, og en statistisk sammenstilling er ikke automatisk systematisk.
Ved klinisk bruk bør oversikten vurderes i følgende rekkefølge: Er spørsmålet relevant for den aktuelle pasienten? Er søket tilstrekkelig bredt og oppdatert? Er studier valgt ut og data hentet ut på en pålitelig måte? Er risikoen for bias i primærstudiene vurdert? Er studiene tilstrekkelig like til å kunne slås sammen? Hvor store er de relative og absolutte effektene? Hvor presist er estimatet? Foreligger det klinisk betydningsfull heterogenitet, småstudieeffekter eller selektiv rapportering? Til slutt skal evidensens pålitelighet vurderes for hvert viktige utfall.
PRISMA 2020 er en rapporteringsstandard med 27 hovedpunkter. Den gjør rapporteringen mer transparent, men er ikke et instrument for å vurdere metodologisk kvalitet [1,2]. Til kritisk vurdering av intervensjonsoversikter kan AMSTAR 2 brukes, mens ROBIS er rettet mot risikoen for bias i selve oversikten [3,4]. Evidensens pålitelighet bør ikke likestilles med statistisk signifikans. GRADE skiller mellom høy, moderat, lav og svært lav pålitelighet og tar hensyn til risiko for bias, inkonsistens, indirekthet, manglende presisjon og publikasjonsskjevhet [5,6].
En klinisk anbefaling følger ikke direkte av en metaanalyse. Beslutningen må også ta hensyn til absolutt nytte, skadevirkninger, pasientens verdier, gjennomførbarhet, kostnader og hvor godt studiepopulasjonen tilsvarer den aktuelle pasienten.
Grunnleggende begreper
Systematisk oversikt
En systematisk oversikt sammenstiller forskning som besvarer et tydelig formulert spørsmål ved hjelp av eksplisitte metoder. Sentrale komponenter er:
- En forhåndsdefinert problemstilling og inklusjonskriterier.
- En protokoll som fastsettes før resultatene er kjent.
- Et bredt og reproduserbart litteratursøk.
- Systematisk utvelgelse av studier.
- Strukturert datauttrekk.
- Vurdering av risiko for bias i de inkluderte studiene.
- En planlagt kvalitativ eller statistisk syntese.
- Vurdering av evidensens pålitelighet.
- Transparent redegjørelse for metoder, avvik og resultater.
PRISMA 2020 definerer en systematisk oversikt ut fra de eksplisitte og systematiske metodene, ikke ut fra om det er gjennomført en statistisk sammenstilling [1]. At en artikkel kalles systematisk oversikt, er derfor ikke i seg selv et kvalitetsbevis.
Metaanalyse
En metaanalyse kombinerer effektmål og tilhørende usikkerhet fra minst to studier til et samlet estimat. Studier med høyere statistisk presisjon får vanligvis større vekt. Metaanalysen kan øke presisjonen, synliggjøre variasjon mellom studier og muliggjøre analyse av effektmodifikatorer.
Samtidig kan en metaanalyse gi en misvisende presisjon dersom den kombinerer studier som skiller seg vesentlig med hensyn til populasjon, intervensjon, sammenligning, utfall, oppfølging eller risiko for bias. Et presist samlet estimat kan være systematisk feil dersom de inkluderte studiene er systematisk feil.
Beslektede oversiktstyper
| Oversiktstype | Hovedformål | Viktig begrensning |
|---|---|---|
| Systematisk oversikt | Besvare et avgrenset spørsmål med systematiske metoder | Kvaliteten avhenger av søk, utvelgelse, primærstudier og syntese |
| Systematisk oversikt med parvis metaanalyse | Sammenstille to alternativer, for eksempel behandling mot placebo | Krever tilstrekkelig klinisk og metodologisk sammenlignbarhet |
| Nettverksmetaanalyse | Sammenligne flere behandlinger med direkte og indirekte evidens | Krever transitivitet og rimelig samsvar mellom direkte og indirekte evidens |
| Metaanalyse av individdata | Analysere data for hver enkelt deltaker | Ressurskrevende og sårbar for hvilke forskergrupper som deler data |
| Levende systematisk oversikt | Oppdateres fortløpende når ny evidens publiseres | Krever langsiktig organisering, oppdateringsregler og versjonskontroll |
| Hurtigoversikt | Besvare et spørsmål på kort tid med forenklede metoder | Snarveier kan øke risikoen for at relevante studier blir oversett |
| Scoping review | Kartlegge omfang, begreper og kunnskapshull | Er vanligvis ikke utformet for å gi et sikkert effektestimat |
| Oversikt over oversikter | Sammenstille flere systematiske oversikter | Overlappende primærstudier kan telles flere ganger |
Fra klinisk spørsmål til protokoll
Formuler spørsmålet før søket
For intervensjonsspørsmål brukes vanligvis PICO:
- P, populasjon eller klinisk tilstand
- I, intervensjon
- C, sammenligning
- O, utfall
Spørsmålet bør også presisere studiedesign, behandlingskontekst og relevant oppfølgingstid. Et spørsmål om effekten av et legemiddel hos voksne med en bestemt diagnose er utilstrekkelig avgrenset dersom dose, sammenligningsbehandling, sykdomsgrad og tidspunkt for utfall er avgjørende for tolkningen.
Utfallsvariabler bør prioriteres etter pasientrelevans. Mortalitet, symptomer, funksjonsevne, livskvalitet og alvorlige skadevirkninger er ofte viktigere enn laboratoriemål eller andre surrogatendepunkter. Et statistisk sensitivt surrogatendepunkt kan gi et mer imponerende resultat enn et pasientrelevant utfall, uten å vise at pasienten lever lenger eller har det bedre.
For diagnostiske spørsmål må man spesifisere målpopulasjon, indekstest, referansestandard, terskelverdi og tiltenkt klinisk rolle, for eksempel triage, tilleggstest eller erstatningstest. Prognostiske spørsmål krever blant annet et tydelig startpunkt, prognostisk faktor, utfall og tidshorisont.
Protokoll og registrering
Protokollen bør angi:
- problemstilling og inklusjonskriterier
- informasjonskilder og overordnet søkestrategi
- primære og sekundære utfall
- hvordan flere måletidspunkter og måleskalaer skal prioriteres
- prosess for studieutvelgelse og datauttrekk
- instrument for vurdering av risiko for bias
- planlagte effektmål og metaanalytiske modeller
- håndtering av manglende data og nullhendelser
- planlagte subgruppe-, sensitivitets- og metaregresjonsanalyser
- metode for vurdering av evidensens pålitelighet
Prospektiv registrering i for eksempel PROSPERO gir en datert redegjørelse for planlagte metoder og kan synliggjøre endringer i etterkant. Registrering kan også redusere ikke-planlagt duplisering av oversikter [7]. Registrering innebærer derimot ikke at protokollen har gjennomgått en fullstendig metodologisk vurdering.
Legitime protokollendringer kan være nødvendige. De skal dateres, begrunnes og rapporteres. Endringer etter at forskerne har sett resultatene, er særlig sensitive, for eksempel bytte av primært utfall, endret oppfølgingstid eller nye subgrupper.
flowchart TD
A["Avgrens klinisk spørsmål<br>og pasientrelevante utfall"] --> B["Skriv protokoll<br>og analyseplan"]
B --> C["Registrer protokollen<br>før studieutvelgelse"]
C --> D["Gjennomfør bredt<br>reproduserbart søk"]
D --> E["Velg studier og hent ut data<br>med uavhengig kontroll"]
E --> F["Vurder risiko for bias<br>for hvert viktige utfall"]
F --> G["Vurder klinisk og<br>metodologisk sammenlignbarhet"]
G -->|"Tilstrekkelig"| H["Gjennomfør planlagt<br>statistisk syntese"]
G -->|"Utilstrekkelig"| I["Strukturert syntese<br>uten metaanalyse"]
H --> J["Vurder heterogenitet<br>presisjon og rapporteringsskjevhet"]
I --> J
J --> K["Grader evidensens<br>pålitelighet"]
K --> L["Tolk absolutte effekter<br>og klinisk anvendbarhet"]Litteratursøk og studieutvelgelse
Informasjonskilder
Ingen enkelt database inneholder all relevant medisinsk forskning. Et søk kan derfor måtte omfatte:
- MEDLINE eller PubMed
- Embase
- Cochrane Central Register of Controlled Trials
- fagspesifikke databaser
- regionale databaser
- ClinicalTrials.gov og WHOs studieregister
- regulatoriske dokumenter
- avhandlinger og konferanseabstrakter
- referanselister og siteringssøk
- kontakt med forskere eller produsenter
PRISMA-S inneholder 16 punkter for reproduserbar rapportering av litteratursøk. Database, søkeplattform, dato, fullstendig søkestreng, filtre, begrensninger og supplerende søkemetoder bør rapporteres [8]. Et søk i MEDLINE via Ovid er ikke teknisk identisk med et søk i MEDLINE via en annen plattform.
Søkestrategien bør kombinere emneord og fritekstord. Unødvendige språk-, dato- og publikasjonsbegrensninger kan ekskludere relevant evidens. Dersom begrensninger brukes, skal de begrunnes ut fra problemstillingen, ikke bare ut fra bekvemmelighet.
En informasjonsspesialist kan bidra til å forbedre både sensitivitet og reproduserbarhet. PRESS er en egen retningslinje for fagfellevurdering av elektroniske søkestrategier [9].
Publisert og upublisert evidens
Tidsskriftartikler alene gir ikke alltid et fullstendig bilde. Studier med statistisk signifikante eller kommersielt gunstige resultater kan ha større sannsynlighet for å bli publisert. Resultatene kan også bli rapportert mer fullstendig enn negative eller inkonklusive utfall.
Studieregistre, regulatoriske dokumenter og kontakt med utprøvere kan identifisere:
- avsluttede, men upubliserte studier
- forhåndsregistrerte primære utfall
- utfall som er utelatt i tidsskriftartikkelen
- lengre oppfølging
- ytterligere skadevirkninger
- flere publikasjoner fra samme studie
En vanlig feil er å telle flere publikasjoner fra samme studie som separate studier. Protokoll, hovedrapport, sekundæranalyse og langtidsoppfølging må knyttes til en felles studie-ID.
Studieutvelgelse og datauttrekk
Utvelgelsen skjer vanligvis i to trinn:
- Gjennomgang av tittel og sammendrag.
- Fulltekstgjennomgang av potensielt relevante rapporter.
Minst to personer bør uavhengig av hverandre vurdere fulltekstene. En tilsvarende dobbel prosess, eller uttrekk etterfulgt av grundig uavhengig kontroll, bør brukes for sentrale data. Grunnene til eksklusjon på fulltekstnivå skal dokumenteres.
Datauttrekket må omfatte mer enn antall deltakere og effektmål. Viktige variabler er blant annet:
- rekrutteringssetting og tidsperiode
- inklusjons- og eksklusjonskriterier
- sykdomsgrad og komorbiditet
- intervensjonsdose og behandlingsvarighet
- sammenligningsbehandling
- etterlevelse og behandlingsbytte
- definisjon og målemetode for hvert utfall
- oppfølgingstid
- frafall og analyseprinsipp
- finansiering og interessekonflikter
- opplysninger som kreves for vurdering av risiko for bias
Vurdering av risiko for bias
Risiko for bias er ikke det samme som rapporteringskvalitet
En velskrevet studie kan ha høy risiko for bias, og en mangelfullt rapportert studie kan i enkelte henseender være korrekt gjennomført. Dersom nødvendig informasjon mangler, er det likevel ofte ikke mulig å gjøre en sikker vurdering.
For randomiserte studier vurderer RoB 2 fem hovedområder: randomiseringsprosessen, avvik fra tiltenkt intervensjon, manglende utfallsdata, måling av utfall og seleksjon av rapportert resultat [10]. Vurderingen er utfallsspesifikk. En ublindet studie kan for eksempel ha lavere risiko for bias for totalmortalitet enn for selvrapportert smerte.
For studier av diagnostisk nøyaktighet omfatter QUADAS-2 pasientseleksjon, indekstest, referansestandard samt flyt og tidsforløp. De tre første områdene vurderes også med hensyn til anvendbarhet [11]. For ikke-randomiserte intervensjonsstudier kreves særlig oppmerksomhet på konfundering, seleksjon og klassifisering av intervensjoner.
Instrumenter på ulike nivåer
| Vurderingsobjekt | Egnet instrument | Hva instrumentet besvarer |
|---|---|---|
| Randomisert studie | RoB 2 | Kan studiens estimat være systematisk skjevt? |
| Diagnostisk studie | QUADAS-2 | Foreligger det risiko for bias eller problemer med anvendbarhet? |
| Systematisk intervensjonsoversikt | AMSTAR 2 | Er oversikten gjennomført med metodologisk pålitelige metoder? |
| Systematisk oversikt | ROBIS | Foreligger det risiko for bias i oversiktens prosess, resultater eller konklusjoner? |
| Samlet evidensgrunnlag for et utfall | GRADE | Hvor stor tillit bør vi ha til effektestimatet? |
| Rapportering av systematisk oversikt | PRISMA 2020 | Er metoder og resultater rapportert fullstendig og transparent? |
AMSTAR 2 inneholder 16 punkter og er beregnet på intervensjonsoversikter med randomiserte eller ikke-randomiserte studier. Verktøyet vektlegger sju kritiske områder: protokoll, litteratursøk, begrunnelse for eksklusjoner, risiko for bias i primærstudier, statistiske metoder, hensyn til bias ved tolkning samt publikasjonsskjevhet. Punktene skal ikke summeres til en enkel numerisk kvalitetsskår [3].
ROBIS vurderer fire områder i oversiktsprosessen: inklusjonskriterier, identifisering og utvelgelse av studier, datainnsamling og studievurdering samt syntese og resultater. Deretter gjøres en samlet vurdering av risikoen for bias i oversiktens konklusjoner [4].
Statistisk syntese
Velg effektmål etter utfall og spørsmål
Vanlige effektmål er:
| Utfallstype | Effektmål | Klinisk tolkning |
|---|---|---|
| Dikotomt utfall | Relativ risiko, RR | Risiko i intervensjonsgruppen delt på risiko i kontrollgruppen |
| Dikotomt utfall | Oddsratio, OR | Forholdet mellom odds, kan feiltolkes som RR når utfallet er vanlig |
| Dikotomt utfall | Risikodifferanse, RD | Absolutt forskjell i risiko |
| Tid til hendelse | Hasardratio, HR | Relativ momentan hendelsesrate i løpet av oppfølgingen |
| Kontinuerlig utfall, samme skala | Gjennomsnittsforskjell, MD | Forskjell i skalaens opprinnelige enhet |
| Kontinuerlig utfall, ulike skalaer | Standardisert gjennomsnittsforskjell, SMD | Forskjell uttrykt i standardavvik |
| Diagnostisk utfall | Sensitivitet og spesifisitet | Testens evne til å identifisere henholdsvis syke og ikke-syke |
Relative effektmål må suppleres med absolutte effekter. Dersom RR er 0,75, blir den absolutte risikoreduksjonen 2,5 prosentpoeng når basisrisikoen er 10 prosent, men bare 0,25 prosentpoeng når basisrisikoen er 1 prosent. Samme relative effekt kan derfor ha helt ulik klinisk betydning.
Number needed to treat, NNT, kan beregnes som den inverse verdien av den absolutte risikoreduksjonen når tidsperiode, populasjon og sammenligning er tydelig angitt. NNT er ikke en uforanderlig egenskap ved behandlingen. Det varierer med basisrisiko, oppfølgingstid og effektmål.
Fixed effect og random effects
En fixed effect-modell antar at studiene estimerer den samme felles sanne effekten, og at observerte forskjeller hovedsakelig skyldes tilfeldig usikkerhet. En random effects-modell antar at de sanne effektene varierer mellom studiene, og estimerer gjennomsnittet av en fordeling av effekter.
Valget kan ikke gjøres bare ved først å teste for heterogenitet. Klinisk kunnskap om populasjoner, behandlinger og kontekster skal styre modellvalget. Random effects løser ikke problemet med uhensiktsmessig sammenstilling. Modellen kan dessuten gi relativt større vekt til små studier, noe som er problematisk dersom små studier er mer selektivt publisert eller har høyere risiko for bias.
Med få studier blir estimatet av variasjonen mellom studiene usikkert. Konfidensintervallet rundt den samlede effekten kan da bli for smalt med enkelte standardmetoder. Derfor bør metodevalg og sensitivitetsanalyser rapporteres tydelig.
Heterogenitet
Heterogenitet kan være:
- klinisk, for eksempel ulik sykdomsgrad, alder eller intervensjon
- metodologisk, for eksempel ulikt design, risiko for bias eller målemetode
- statistisk, det observerte mønsteret av varierende effektestimater
I² anslår hvor stor andel av den observerte variasjonen som er forenlig med variasjon mellom studier, snarere enn bare utvalgsusikkerhet [12]. Ofte brukes følgende omtrentlige tolkningsramme:
| I² | Mulig tolkning |
|---|---|
| 0 til 40 prosent | Kan være uvesentlig |
| 30 til 60 prosent | Kan være moderat |
| 50 til 90 prosent | Kan være betydelig |
| 75 til 100 prosent | Kan være svært betydelig |
Intervallene overlapper med vilje. I² skal ikke tolkes mekanisk. En høy I² kan oppstå når store, presise studier viser små, men konsistente forskjeller. En lav I² kan forekomme når få små studier er for upresise til å avdekke reell variasjon.
Tau² beskriver variansen mellom sanne studieeffekter, men ligger på en skala som kan være vanskelig å tolke klinisk. Et prediksjonsintervall viser i stedet innenfor hvilket intervall den sanne effekten i en ny, sammenlignbar studie kan forventes å ligge. I en metodestudie av signifikante random effects-metaanalyser med heterogenitet krysset 72,4 prosent av prediksjonsintervallene nulleffekten, selv om konfidensintervallet for gjennomsnittseffekten ikke gjorde det [13]. Prediksjonsintervaller er særlig verdifulle når resultatet skal overføres til en ny behandlingssetting, men blir usikre når få studier inngår.
Subgruppeanalyser og metaregresjon
Subgruppeanalyser bør være få, klinisk begrunnede og helst forhåndsdefinerte. Det er feil å konkludere med at behandlingseffekten er forskjellig mellom to grupper bare fordi resultatet er statistisk signifikant i den ene gruppen, men ikke i den andre. Forskjellen mellom gruppene må analyseres med en interaksjonstest.
Troverdigheten øker dersom:
- hypotesen var fastsatt i protokollen
- det foreligger biologisk eller klinisk plausibilitet
- forskjellen er stor
- den er konsistent mellom studier
- interaksjonstesten støtter effektmodifikasjon
- analysen bygger på forskjeller mellom deltakere innen studier, ikke bare på gjennomsnittsforskjeller mellom studier
Metaregresjon er en observasjonsanalyse på studienivå. Den kan generere hypoteser, men er sårbar for få studier, multippel testing, konfundering og økologiske feilslutninger.
Sensitivitetsanalyser
Robustheten bør testes med analyser som for eksempel:
- utelukker studier med høy risiko for bias
- bruker alternative statistiske modeller
- bruker alternative antakelser om manglende data
- skiller justerte og ujusterte observasjonsdata
- utelukker upubliserte studier eller studier som bare er rapportert som abstrakt
- håndterer klynge-, crossover- og flerarmsstudier på alternative måter
- tester effekten av enkeltstående innflytelsesrike studier
Dersom hovedkonklusjonen endres vesentlig, bør dette fremgå tydelig og påvirke evidensgraderingen.
Rapporteringsskjevhet og småstudieeffekter
Et funnel plot viser studienes effektestimater mot et mål på presisjon eller standardfeil. Ved fravær av seleksjon og andre småstudieeffekter forventes en omtrent symmetrisk trakt. Asymmetri kan skyldes:
- selektiv publisering
- selektiv utfallsrapportering
- dårligere metodologisk kvalitet i små studier
- reelle kliniske forskjeller mellom små og store studier
- tilfeldigheter
- uhensiktsmessig effektmål eller statistisk metode
Funnel plot og regresjonsbaserte tester har lav teststyrke når få studier inngår. En vanlig praktisk grense er at slike analyser sjelden er meningsfulle med færre enn ti studier [3,14]. En ikke-signifikant test utelukker ikke publikasjonsskjevhet.
Metoder som trim and fill kan brukes som eksplorative sensitivitetsanalyser, men kan ikke bevise hvor mange studier som mangler, eller gjenopprette den sanne effekten. Vurderingen bør også ta hensyn til studieregistre, protokoller, finansiering, forekomst av små positive studier og forskjeller mellom registrerte og publiserte utfall.
Syntese uten metaanalyse
Metaanalyse bør unnlates når studiene er for ulike, eller når data ikke kan uttrykkes på sammenlignbare måter. Fravær av metaanalyse rettferdiggjør likevel ikke en usystematisk narrativ oppsummering.
SWiM angir ni rapporteringsområder for syntese uten metaanalyse. Disse omfatter gruppering av studier, standardiserte effektmål, valgt syntesemetode, prioritering av resultater, håndtering av heterogenitet, evidensens pålitelighet, presentasjon i tabeller og figurer, oppsummering av resultater samt syntesens begrensninger [15].
En strukturert syntese bør:
- gruppere studier etter klinisk relevante sammenligninger
- angi hvilke studier som bidrar til hver konklusjon
- rapportere retning, størrelse og presisjon, ikke bare P-verdier
- ta hensyn til risiko for bias
- unngå å gi små og store studier samme betydning
- rapportere motstridende resultater
- forklare hvorfor metaanalyse ikke ble gjennomført
Stemmetelling basert på antall statistisk signifikante studier bør unngås. En liten og en stor studie kan da telle likt, samtidig som statistisk signifikans blandes sammen med effektens størrelse.
Nettverksmetaanalyse
Nettverksmetaanalyse kan sammenligne flere intervensjoner i et sammenhengende nettverk. Dersom studier sammenligner A med B og B med C, kan en indirekte sammenligning mellom A og C beregnes. Metoden kan også kombinere det indirekte estimatet med direkte sammenlignende studier.
I tillegg til de vanlige metaanalytiske kravene trengs:
- transitivitet, studier i ulike sammenligninger skal være tilstrekkelig like med hensyn til effektmodifikatorer
- konsistens, direkte og indirekte evidens skal være forenlige
- et sammenhengende evidensnettverk
- hensiktsmessig håndtering av studier med flere behandlingsarmer
- tydelig redegjørelse for usikkerheten i hver sammenligning
PRISMAs utvidelse for nettverksmetaanalyser omfatter særskilte krav til blant annet nettverksgeometri, indirekte sammenligninger og vurdering av inkonsistens [16]. Rangeringer av behandlinger skal tolkes med forsiktighet. En høy rangering kan bygge på få studier, indirekte sammenligninger eller lav evidenspålitelighet.
En stor nettverksmetaanalyse av antidepressiva illustrerer både mulighetene og begrensningene. Analysen omfattet 522 studier og 116 477 deltakere, men 73 prosent av studiene ble vurdert å ha moderat risiko for bias, og evidensens pålitelighet varierte fra moderat til svært lav [17]. Et omfattende nettverk og smale intervaller gjør dermed ikke alle sammenligninger like pålitelige.
Skadevirkninger
Systematiske oversikter er ofte bedre utformet for nytte enn for skade. Randomiserte studier kan være for små eller for korte til å oppdage sjeldne, forsinkede eller kumulative skadevirkninger. Observasjonsstudier og registerdata kan derfor være nødvendige som supplement, selv om de medfører større risiko for konfundering og andre systematiske feil.
For hvert skadeutfall bør oversikten rapportere:
- hvordan skadevirkningen ble definert
- om den ble aktivt etterspurt eller rapportert spontant
- tidsperioden for overvåking
- antall deltakere med hendelsen og antall analyserte
- håndtering av studier med null hendelser
- alvorlighetsgrad og behandlingsavbrudd
- mulig kausalitet
- frafall og selektiv rapportering
PRISMA Harms ble utviklet fordi mangelfull rapportering i primærstudier ofte forsterkes når skadevirkninger sammenstilles i oversikter [18]. Formuleringen om at ingen alvorlige skadevirkninger ble rapportert, betyr ikke nødvendigvis at de ble aktivt etterspurt, eller at de ikke forekom.
Vurdering av evidensens pålitelighet
GRADE vurderer et samlet evidensgrunnlag for hvert utfall, ikke en studie eller artikkel som helhet. Fire nivåer brukes [5]:
| Nivå | Praktisk betydning |
|---|---|
| Høy | Stor tillit til at den sanne effekten ligger nær estimatet |
| Moderat | Den sanne effekten ligger sannsynligvis nær estimatet, men kan avvike betydelig |
| Lav | Begrenset tillit, den sanne effekten kan avvike betydelig |
| Svært lav | Svært liten tillit til effektestimatet |
Randomiserte studier starter normalt på høy pålitelighet og kan graderes ned på grunn av:
- Risiko for bias.
- Inkonsistens.
- Indirekthet.
- Manglende presisjon.
- Publikasjonsskjevhet.
Observasjonsstudier starter normalt på lavt nivå, men kan i enkelte situasjoner graderes opp, for eksempel ved svært stor effekt, dose-respons-sammenheng eller når rimelig gjenværende konfundering sannsynligvis ville redusert den observerte effekten [5].
GRADE skiller evidensens pålitelighet fra anbefalingens styrke. En anbefaling krever i tillegg vurdering av balansen mellom nytte og skade, pasientpreferanser, ressursbruk, likeverd, aksept og gjennomførbarhet [6].
En summary of findings-tabell bør angi:
- utfall og oppfølgingstid
- antall studier og deltakere
- risiko uten intervensjon
- risiko med intervensjon
- relativ effekt
- absolutt effekt
- evidensens pålitelighet
- grunner til nedgradering eller oppgradering
Absolutte effekter er sentrale. I en metaanalyse av PSA-screening tilsvarte en mulig relativ reduksjon i prostatakreftspesifikk mortalitet bare omkring ett færre dødsfall per 1 000 screenede menn over ti år, samtidig som screening førte til ytterligere utredning og behandlingsrelaterte komplikasjoner [19]. Den relative effekten alene ville gitt et ufullstendig bilde.
Kritisk vurdering ved klinisk bruk
En praktisk rekkefølge for vurderingen
| Spørsmål | Tegn som styrker tilliten | Varselsignaler |
|---|---|---|
| Er oversikten relevant? | PICO og oppfølging tilsvarer det kliniske spørsmålet | Bred eller avvikende populasjon, surrogatendepunkter |
| Er den oppdatert? | Nylig avsluttet søk eller levende oppdatering | Raskt forskningsfelt og flere år gammelt søk |
| Fantes det en protokoll? | Prospektiv protokoll og forklarte endringer | Registrering etter datauttrekk eller manglende analyseplan |
| Var søket tilstrekkelig? | Flere relevante databaser, registre og fullstendige søkestrenger | Én database, språkbegrensning uten begrunnelse, bare publiserte artikler |
| Var utvelgelsen robust? | Uavhengig dobbel gjennomgang og rapporterte eksklusjonsgrunner | Én enkelt vurderer eller uklar fulltekstutvelgelse |
| Ble risiko for bias vurdert? | Designspesifikt instrument og utfallsspesifikk vurdering | Numerisk kvalitetsskår uten domenevurdering |
| Var metaanalysen rimelig? | Klinisk sammenlignbare studier og forhåndsdefinert modell | Sammenstilling til tross for åpenbart ulike intervensjoner eller utfall |
| Er effekten klinisk forståelig? | Relative og absolutte effekter med tidshorisont | Bare OR, SMD eller P-verdi |
| Er heterogeniteten håndtert? | Klinisk forklaring, tau², I² og gjerne prediksjonsintervall | Heterogenitet ignoreres eller forklares med mange post hoc-analyser |
| Foreligger rapporteringsskjevhet? | Kontroll mot registre og forsiktig tolkning | Mange små positive studier og ingen upubliserte data |
| Er konklusjonen balansert? | Nytte, skade, presisjon og anvendbarhet veies sammen | Konklusjon basert bare på statistisk signifikans |
Les forest plot systematisk
Ved gjennomgang av et forest plot bør leseren kontrollere:
- Hvilket effektmål som brukes, og hvilken retning som innebærer nytte.
- Hvor mange studier og deltakere som faktisk bidrar.
- Om store og små studier gir lignende resultater.
- Om konfidensintervallene overlapper.
- Om én eller to studier dominerer vekten.
- Om den samlede effekten krysser nulleffekten.
- Om intervallet utelukker både klinisk viktig nytte og skade.
- Om I² og tau² er rapportert.
- Om prediksjonsintervallet krysser nulleffekt eller en klinisk beslutningsterskel.
- Om studier med høy risiko for bias påvirker konklusjonen.
Et konfidensintervall som krysser nulleffekten, betyr ikke at behandlingene er likeverdige. Intervallet kan samtidig omfatte både betydelig nytte og betydelig skade. Den korrekte vurderingen er da at estimatet er upresist.
Statistisk og klinisk betydning
Statistisk signifikans påvirkes av utvalgsstørrelsen. En svært liten effekt kan bli statistisk signifikant i en stor metaanalyse, mens en klinisk viktig effekt kan være ikke-signifikant i et lite grunnlag.
I en Cochrane-oversikt om vannbasert trening ved kne- eller hofteartrose var den standardiserte effekten på smerte minus 0,31. Uttrykt på en skala fra 0 til 100 tilsvarte dette omkring fem poengs forbedring [20]. Omregning til en klinisk kjent skala gjør resultatet mer anvendelig, men den minste klinisk viktige forskjellen må fortsatt tas i betraktning.
En omfattende metaanalyse kan også skjule usikkerhet gjennom heterogenitet. En oversikt om TENS inkluderte 381 randomiserte studier, men bare 26 ble vurdert å ha lav samlet risiko for bias. For sammenligningen med placebo var I² 88 prosent, noe som viser at et stort antall deltakere ikke eliminerer problemer med varierende studieresultater [21].
Oppdatering og forvaltning av oversikter
En systematisk oversikt er oppdatert frem til sin siste søkedato, ikke sin publiseringsdato. Manusvurdering og publisering kan innebære at søket allerede er gammelt når artikkelen blir tilgjengelig.
Levende systematiske oversikter bygger på gjentatte søk og fortløpende oppdatering. De egner seg best når:
- spørsmålet har høy klinisk prioritet
- betydelig usikkerhet gjenstår
- nye studier publiseres jevnlig
- ny evidens kan endre konklusjon eller anbefaling
Metodologisk veiledning for levende oversikter er mer utviklet for gjennomføring og publisering enn for rapportering og kvalitetsvurdering. En kartlegging identifiserte veiledning om gjennomføring i 17 publikasjoner, men om kvalitetsvurdering i bare to [22]. Oppdateringsfrekvens, søkeintervall, utløsende kriterier for ny analyse og tidspunkt for avslutning av levende status bør derfor rapporteres eksplisitt.
For klinikeren innebærer dette at en eldre, men godt utført oversikt ikke automatisk skal forkastes. Først bør man undersøke om nye studier sannsynligvis endrer effektestimatet, skadebildet eller evidensens pålitelighet.
Kilder
- Page MJ et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ 2021. PMID: 33782057
- Page MJ et al. PRISMA 2020 explanation and elaboration: updated guidance and exemplars for reporting systematic reviews. BMJ 2021. PMID: 33781993
- Shea BJ et al. AMSTAR 2: a critical appraisal tool for systematic reviews that include randomised or non-randomised studies of healthcare interventions, or both. BMJ 2017. PMID: 28935701
- Whiting P et al. ROBIS: A new tool to assess risk of bias in systematic reviews was developed. Journal of Clinical Epidemiology 2016. PMID: 26092286
- Balshem H et al. GRADE guidelines: 3. Rating the quality of evidence. Journal of Clinical Epidemiology 2011. PMID: 21208779
- Guyatt G et al. GRADE guidelines: 1. Introduction, GRADE evidence profiles and summary of findings tables. Journal of Clinical Epidemiology 2011. PMID: 21195583
- Booth A et al. The nuts and bolts of PROSPERO: an international prospective register of systematic reviews. Systematic Reviews 2012. PMID: 22587842
- Rethlefsen ML et al. PRISMA-S: an extension to the PRISMA Statement for Reporting Literature Searches in Systematic Reviews. Systematic Reviews 2021. PMID: 33499930
- McGowan J et al. PRESS Peer Review of Electronic Search Strategies: 2015 Guideline Statement. Journal of Clinical Epidemiology 2016. PMID: 27005575
- Sterne JAC et al. RoB 2: a revised tool for assessing risk of bias in randomised trials. BMJ 2019. PMID: 31462531
- Whiting PF et al. QUADAS-2: a revised tool for the quality assessment of diagnostic accuracy studies. Annals of Internal Medicine 2011. PMID: 22007046
- Higgins JPT et al. Measuring inconsistency in meta-analyses. BMJ 2003. PMID: 12958120
- IntHout J et al. Plea for routinely presenting prediction intervals in meta-analysis. BMJ Open 2016. PMID: 27406637
- Sterne JA et al. Recommendations for examining and interpreting funnel plot asymmetry in meta-analyses of randomised controlled trials. BMJ 2011. PMID: 21784880
- Campbell M et al. Synthesis without meta-analysis in systematic reviews: reporting guideline. BMJ 2020. PMID: 31948937
- Hutton B et al. The PRISMA extension statement for reporting of systematic reviews incorporating network meta-analyses of health care interventions: checklist and explanations. Annals of Internal Medicine 2015. PMID: 26030634
- Cipriani A et al. Comparative efficacy and acceptability of 21 antidepressant drugs for the acute treatment of adults with major depressive disorder: a systematic review and network meta-analysis. Lancet 2018. PMID: 29477251
- Zorzela L et al. PRISMA harms checklist: improving harms reporting in systematic reviews. BMJ 2016. PMID: 26830668
- Ilic D et al. Prostate cancer screening with prostate-specific antigen test: a systematic review and meta-analysis. BMJ 2018. PMID: 30185521
- Bartels EM et al. Aquatic exercise for the treatment of knee and hip osteoarthritis. Cochrane Database of Systematic Reviews 2016. PMID: 27007113
- Johnson MI et al. Efficacy and safety of transcutaneous electrical nerve stimulation for acute and chronic pain in adults: a systematic review and meta-analysis of 381 studies. BMJ Open 2022. PMID: 35144946
- Iannizzi C et al. Methods and guidance on conducting, reporting, publishing, and appraising living systematic reviews: a scoping review. Systematic Reviews 2023. PMID: 38098023