Kunnskapsbasert medisin: randomiserte kontrollerte studier

Sammendrag

En randomisert kontrollert studie, RCT, sammenligner intervensjoner ved at deltakere eller grupper fordeles tilfeldig. Korrekt randomisering skaper sammenlignbare grupper i forventning og gjør det mulig å tolke en forskjell i utfall som en kausal behandlingseffekt. Dette forutsetter at allokeringssekvensen er uforutsigbar, at avvik og frafall håndteres korrekt, at utfallene måles uten systematiske forskjeller, og at resultatene ikke velges ut etter hva analysene viser.

Ved kritisk vurdering bør klinikeren først identifisere studiens spørsmål og estimand, altså hvilken behandlingseffekt som faktisk menes. Deretter vurderes randomisering og skjult allokering, blinding, frafall, utfallsmål, analyseprinsipp og selektiv rapportering. Resultatet skal vurderes ut fra effektstørrelse og 95 % konfidensintervall, ikke bare ut fra P-verdi. For binære utfall trengs både relative og absolutte effekter. Til slutt vurderes klinisk betydning, sikkerhet og overførbarhet til den aktuelle pasienten.

CONSORT 2025 angir hva en publisert RCT minst bør rapportere, mens SPIRIT 2025 gjelder studieprotokoller. Sjekklistene forbedrer transparensen, men er ikke instrumenter for å poengsette metodologisk kvalitet [1,2]. Risiko for skjevhet bør i stedet vurderes per utfall med et strukturert verktøy, for eksempel Cochrane RoB 2 [3].

RCT-ens rolle i kunnskapsbasert medisin

Hva randomisering oppnår

I en RCT bestemmes behandlingen av en tilfeldighetsmekanisme. I motsetning til i en observasjonsstudie påvirkes allokeringen derfor ikke systematisk av prognose, behandlerens vurdering eller pasientens preferanse. Randomiseringen balanserer i forventning både kjente og ukjente prognostiske faktorer. Dette er den viktigste grunnen til at en godt gjennomført RCT vanligvis gir sikrere kausal evidens om intervensjonseffekter enn en ikke-randomisert sammenligning.

Randomisering garanterer derimot ikke at gruppene blir identiske. Tilfeldige forskjeller, også klinisk store, kan oppstå, særlig i små studier. Forskjeller ved baseline er derfor ikke i seg selv bevis på mislykket randomisering. Signifikanstesting av baselinevariabler er uhensiktsmessig, fordi alle forskjeller, gitt korrekt randomisering, har oppstått ved tilfeldighet.

En RCT beskytter heller ikke automatisk mot skjevhet etter randomiseringen. Effekten kan forvrenges av for eksempel:

  • kjennskap til kommende allokering før pasienten inkluderes
  • ulike tilleggsbehandlinger eller ulik oppfølging i gruppene
  • frafall som avhenger av både behandling og prognose
  • subjektiv utfallsmåling uten blinding
  • analyse i en annen gruppe enn den deltakeren ble randomisert til
  • selektiv rapportering av utfall, tidspunkter eller analyser

Metaepidemiologisk forskning har vist at mangelfull eller uklart beskrevet sekvensgenerering, skjult allokering og blinding er assosiert med større estimerte behandlingseffekter. Sammenhengen er særlig tydelig for subjektive utfall. Små studier har også en tendens til å rapportere større effekter enn store studier [4].

Hva en RCT kan og ikke kan besvare

RCT egner seg først og fremst for spørsmål om nytte og skade av forebyggende, terapeutiske, diagnostiske eller organisatoriske intervensjoner. Den kan estimere effekt under idealiserte forhold, efficacy, eller effekt i rutinemessig klinisk praksis, effectiveness.

RCT er mindre egnet når:

  • sjeldne eller svært sene skader er hovedspørsmålet
  • eksponeringen ikke kan tildeles på etisk forsvarlig vis
  • lang latenstid gjør studien urimelig stor eller lang
  • prognose, prevalens, etiologi eller diagnostisk nøyaktighet er det egentlige spørsmålet
  • intervensjonen allerede er så etablert at randomisering mot ingen behandling er uetisk

Sikkerhetsdata fra RCT er ofte begrenset av utvalg, oppfølgingstid og utvalgsstørrelse. Fravær av en statistisk sikker forskjell i bivirkninger viser derfor ikke at intervensjonen er trygg. Randomiserte data må ofte suppleres med registre, legemiddelovervåking og andre observasjonsdata.

Fra klinisk spørsmål til studiedesign

Formuler spørsmålet og behandlingseffekten

Studien bør ta utgangspunkt i et eksplisitt klinisk spørsmål:

  • populasjon
  • intervensjon
  • sammenligning
  • utfall
  • relevant tidspunkt
  • helsetjenestekontekst

Det er ikke nok å angi at to behandlinger skal sammenlignes. Protokollen må presisere hvilken effekt som skal estimeres. Et estimand beskriver i praksis:

  1. populasjonen
  2. intervensjonene
  3. utfallet
  4. hvordan hendelser etter randomiseringen skal håndteres
  5. effektmålet på populasjonsnivå

Hendelser etter randomiseringen kan være seponering, behandlingsbytte, tilleggsbehandling, transplantasjon eller død før planlagt måling. Ulike måter å håndtere dem på besvarer ulike kliniske spørsmål. En behandlingsstrategisk effekt kan for eksempel inkludere alle hendelser etter randomiseringen, mens en hypotetisk effekt forsøker å estimere hva som ville ha skjedd dersom behandlingsbytter ikke hadde forekommet.

En detaljert protokoll og en statistisk analyseplan bør være offentlig tilgjengelige. SPIRIT 2025 angir 34 minimumspunkter for protokoller og vektlegger blant annet registrering, primære utfall, skader, analysepopulasjon, frafall, datadeling og pasientmedvirkning [5].

Valg av kontrollgruppe

Kontrollgruppen avgjør hvilket spørsmål studien besvarer.

Kontroll Egnet problemstilling Viktige begrensninger
Placebo eller skinnintervensjon Spesifikk effekt utover forventning, naturlig forløp og kontakt med helsetjenesten Kan være uetisk dersom effektiv behandling holdes tilbake
Ingen intervensjon Total effekt sammenlignet med å avstå Vanskelig å blinde, risiko for forskjeller i oppmerksomhet og tilleggsbehandling
Vanlig behandling Effekt av å innføre intervensjonen i gjeldende praksis Vanlig behandling må beskrives og kan variere mellom sentre
Aktiv kontroll Sammenligning med etablert behandling Krever ofte større studie, særlig ved non-inferiority
Dose eller strategi Hvilken av flere aktive strategier som er best Forskjeller i etterlevelse og ko-intervensjoner må rapporteres

Placebokontroll er metodologisk verdifull, men ikke alltid klinisk relevant. En aktiv kontroll kan i større grad støtte behandlingsvalg, men resultatet forutsetter at kontrollbehandlingen gis på adekvat måte og har forventet effekt i den aktuelle konteksten.

Valg av utfall

Det primære utfallet bør være klinisk relevant, veldefinert, validert og mulig å måle med tilstrekkelig presisjon. Definisjonen skal omfatte målemetode, tidspunkt, analyseform og hvordan konkurrerende hendelser håndteres.

Pasientviktige utfall, for eksempel overlevelse, symptomer, funksjon og livskvalitet, er som regel mer direkte anvendelige enn laboratorieverdier. Surrogatendepunkter kan forkorte studier, men kan være misvisende dersom sammenhengen med pasientviktige utfall ikke er validert for samme sykdom, intervensjon og kontekst. Rapportering av studier med surrogatendepunkter bør tydelig begrunne surrogatets biologiske og empiriske validitet [6].

Sammensatte endepunkter øker ofte antallet hendelser, men kan skjule at effekten hovedsakelig drives av en mindre viktig og hyppig komponent. Vurder derfor:

  • om komponentene har lignende klinisk betydning
  • om forventet hyppighet er sammenlignbar
  • om behandlingseffekten rimeligvis er lik
  • om hver komponent rapporteres separat

Flere primære utfall, tidspunkter og analysemetoder skaper multiplisitet. Dersom hver test utføres på 5 %-nivå, øker risikoen for minst ett falskt positivt funn. Strategien for å kontrollere type 1-feil bør være forhåndsdefinert, for eksempel hierarkisk testing eller justert signifikansnivå.

Utvalgsstørrelse og målforskjell

Utvalgsberegningen bør baseres på det primære utfallet og en klinisk relevant målforskjell, ikke på den største effekten som gjør studien økonomisk gjennomførbar. Den krever vanligvis antakelser om:

  • signifikansnivå, ofte tosidig 5 prosent
  • statistisk styrke, ofte 80 eller 90 prosent
  • klinisk relevant målforskjell
  • kontrollgruppens hendelsesrisiko eller utfallenes standardavvik
  • frafall
  • allokeringsforhold
  • korrelasjon ved gjentatte målinger eller klyngedesign

Dersom målforskjellen som skal kunne påvises halveres, trenger en toarmet studie med kontinuerlig, normalfordelt utfall omtrent fire ganger så mange deltakere, gitt at øvrige antakelser er uendret. Valget av målforskjell har derfor både vitenskapelige og etiske konsekvenser [7].

En liten studie kan gi et korrekt, men svært upresist resultat. At et resultat ikke er statistisk signifikant, betyr ikke at behandlingene er likeverdige. Konfidensintervallet viser hvilke klinisk viktige effekter som fortsatt er forenlige med dataene.

Randomisering, allokering og blinding

Generering av randomiseringssekvens

En korrekt sekvens kan lages med datagenererte tilfeldige tall. Systematisk veksling, fødselsdato, journalnummer eller ukedag er ikke randomisering, fordi neste allokering kan forutsies.

Vanlige metoder er:

  • enkel randomisering
  • blokkrandomisering for omtrent like store grupper
  • stratifisert randomisering for balanse innenfor et fåtall viktige prognostiske faktorer
  • minimering, vanligvis med et tilfeldighetselement, ved flere balanseringsfaktorer

Små og faste blokker kan gjøre kommende allokering forutsigbar. Blokkstørrelser bør derfor ofte varieres og skjules for rekrutterende personell.

Skjult allokering

Skjult allokering, allocation concealment, innebærer at neste behandling ikke kan forutses før deltakeren er endelig inkludert. Dette er noe annet enn blinding, som gjelder kjennskap til behandling etter allokeringen.

Robuste metoder er for eksempel:

  • sentral nettbasert randomisering
  • sentral telefonrandomisering
  • apotekstyrt allokering
  • fortløpende nummererte, ugjennomsiktige, forseglede konvolutter med manipulasjonsbeskyttelse, dersom prosessen gjennomføres strengt

Formuleringer som "deltakerne ble randomisert" eller "forseglede konvolutter ble brukt" er utilstrekkelige. Rapporten bør beskrive sekvensgenerering, hvem som laget sekvensen, hvem som inkluderte deltakerne og hvordan allokeringen ble holdt skjult. Svakheter i dette trinnet kan gjøre det mulig å påvirke hvilke pasienter som får hvilken behandling, og dermed oppheve randomiseringen [4].

Blinding

Blinding reduserer risikoen for at kjennskap til behandling påvirker atferd, ko-intervensjoner, rapportering, måling eller analyse. Rapporten bør angi hvem som var blindet:

  • deltakere
  • behandlende personell
  • øvrig helsepersonell
  • utfallsbedømmere
  • datagranskere og endepunktskomité
  • statistikere

Begrepene enkeltblind og dobbeltblind er tvetydige og bør unngås.

Blinding er særlig viktig for subjektive utfall som smerte, funksjon og kliniske vurderinger. Ved objektive utfall som totalmortalitet er risikoen for måleskjevhet mindre, men kjennskap til behandling kan fortsatt påvirke tilleggsbehandling og oppfølging.

Dersom deltakere eller behandlere ikke kan blindes, bør studien vurdere:

  • blindet utfallsvurdering
  • standardiserte ko-intervensjoner
  • objektive eller sentralt vurderte utfall
  • forhåndsdefinerte kriterier for behandlingsbytte
  • blindet statistisk analyse når dette er mulig

Vanlige studiedesign

Design Styrke Særlig risiko eller analysespørsmål
Individuell parallellgruppe Enkel tolkning, vanligvis robust Kontaminering mellom deltakere, frafall
Klyngerandomisert Egnet for organisasjons- og gruppeintervensjoner Intraklyngekorrelasjon, rekruttering etter allokering
Crossover-studie Hver deltaker er sin egen kontroll Vedvarende behandlingseffekt og periodeeffekt
Faktoriell Kan teste flere intervensjoner effektivt Interaksjon mellom intervensjonene
Pragmatisk Høy relevans for rutinemessig klinisk praksis Varierende etterlevelse, ko-intervensjoner og implementering
Non-inferiority Sammenligner ny behandling med effektiv standard Valg av margin, analysepopulasjon og assay sensitivity
Adaptiv studie eller plattformstudie Kan modifisere studien etter forhåndsdefinerte regler Multiplisitet, samtidige kontrollgrupper og endringer over tid
Pilot- og gjennomførbarhetsstudie Tester om en definitiv RCT kan gjennomføres Skal normalt ikke brukes til konklusjoner om behandlingseffekt

Klyngerandomisering

Ved klyngerandomisering allokeres for eksempel legekontorer, sykehus eller kommuner i stedet for individer. Designet brukes når intervensjonen retter seg mot en organisasjon, eller når individuell randomisering ville gi betydelig kontaminering.

Deltakere innenfor samme klynge er korrelerte. Det effektive informasjonsinnholdet er derfor mindre enn ved like mange uavhengige individer. Utvalgsberegning og analyse må ta hensyn til intraklyngekorrelasjonen. I en gjennomgang av 300 klyngestudier rapporterte bare 55 prosent en utvalgsberegning, og 35 prosent oppga et mål på korrelasjon innenfor klynger [8].

Spesiell seleksjonsskjevhet kan oppstå dersom individer identifiseres etter at klyngens allokering er blitt kjent. I en systematisk gjennomgang av klyngestudier var omtrent en fjerdedel potensielt påvirket av rekrutteringsprosedyren [9]. Inklusjonskriterier og rekruttering bør derfor om mulig fastsettes før randomisering eller utføres av personer uten kjennskap til allokeringen. CONSORT har en egen utvidelse for klyngerandomiserte studier [10].

Crossover-studier

I en crossover-studie får hver deltaker flere intervensjoner i randomisert rekkefølge. Designet kan være effektivt ved stabile kroniske tilstander, raskt reversibel behandlingseffekt og utfall som kan måles gjentatte ganger.

Det er uegnet ved kurativ behandling, irreversible utfall, raskt progredierende sykdom eller langvarig behandlingseffekt. Periode- og sekvenseffekter må tas hensyn til. En utvaskingsperiode (washout) kan redusere carryover, men garanterer ikke at den elimineres.

Klynger kan også randomiseres til ulike behandlingssekvenser over tid. Dette kan øke den statistiske effektiviteten, men krever analyse av korrelasjon innenfor klynger, periodeeffekter og carryover på både individ- og klyngenivå [11].

Pragmatisk eller eksplanatorisk innretning

Pragmatisk og eksplanatorisk er endepunkter på et kontinuum. En eksplanatorisk studie spør først og fremst om intervensjonen virker under kontrollerte forhold. En pragmatisk studie spør om den virker når den innføres i vanlig klinisk praksis.

Pragmatisk innretning omfatter ofte bredere inklusjonskriterier, vanlig behandling som kontroll, fleksibel behandling, rutinemessige ko-intervensjoner og pasientviktige utfall. Begrepet pragmatisk innebærer likevel ikke lavere metodekrav. Randomisering, allokering, utfallsmåling og analyse må fortsatt være robuste.

En systematisk gjennomgang av 57 pragmatiske smertestudier fant at intervensjonenes fleksibilitet og utfallenes kliniske relevans ofte var god, mens rekrutteringen og den ekstra oppfølgingen som studien krevde, var mindre representative for rutinemessig klinisk praksis [12].

Adaptive studier og plattformstudier

En adaptiv studie kan etter forhåndsdefinerte regler endre for eksempel utvalgsstørrelse, randomiseringsforhold eller hvilke behandlingsarmer som videreføres. En plattformstudie kan legge til og avslutte behandlinger innenfor en løpende protokoll.

Disse designene kan utnytte ressurser effektivt, men stiller særlige krav til:

  • simuleringsbasert planlegging
  • kontroll av type 1-feil
  • uavhengig datamonitorering
  • tydelige stoppregler
  • sammenlignbarhet mellom samtidige grupper
  • håndtering av endringer over tid i populasjon og behandling
  • transparens rundt alle adaptasjoner

En ikke-samtidig kontrollgruppe kan være misvisende dersom prognose, diagnostikk eller standardbehandling endres over tid. Analysen må derfor skille randomisert samtidig sammenligning fra sammenligning med historiske eller ikke-samtidige kontroller.

Pilot- og gjennomførbarhetsstudier

Hovedspørsmålet i en pilotstudie er om en fremtidig definitiv studie kan og bør gjennomføres, og i så fall hvordan. Relevante utfall er rekruttering, retensjon, aksept, etterlevelse, datainnsamling og forhåndsdefinerte kriterier for videre utvikling.

Pilotstudier er normalt for små til pålitelig hypotesetesting av klinisk effekt. Manglende statistisk signifikans viser ikke manglende effekt, og et nominelt signifikant funn har ofte lav reproduserbarhet. CONSORT-utvidelsen for pilotstudier fraråder derfor formell hypotesetesting av effekt når studien ikke er dimensjonert for dette [13].

Analyse av randomiserte studier

Intention-to-treat og analyse etter randomisert gruppe

Grunnprinsippet i en superiority-studie er at deltakerne analyseres i den gruppen de ble randomisert til, uavhengig av etterlevelse, behandlingsbytte eller feilaktig gitt behandling. Dette bevarer randomiseringens prognostiske balanse og estimerer ofte effekten av å bli allokert til en behandlingsstrategi.

Betegnelsen intention-to-treat brukes inkonsekvent. Rapporten bør derfor angi nøyaktig:

  • hvilke randomiserte deltakere som ble inkludert
  • hvilken gruppe de ble analysert i
  • hvordan manglende utfall ble håndtert
  • om noen deltakere ble ekskludert, og hvorfor

En per protokoll-analyse inkluderer bare deltakere som har oppfylt visse protokollkrav. Den kan være klinisk relevant, men er ikke lenger beskyttet av randomiseringen. Etterlevelse kan avhenge av prognose, bivirkninger og tidlig behandlingsrespons. Per protokoll-analysen blir derfor en ikke-randomisert sammenligning med mindre avanserte kausale metoder benyttes.

Manglende utfallsdata

Frafall skaper først og fremst problemer når sannsynligheten for at et utfall mangler, er relatert til det faktiske utfallet, behandlingen eller begge. Frafallsandelen alene er derfor ikke nok til å vurdere skjevhet.

Vanlige antakelser er:

  • MCAR, frafallet er helt uavhengig av observerte og uobserverte data
  • MAR, frafallet kan forklares av observerte data
  • MNAR, frafallet avhenger også av uobserverte verdier

Komplett kasus-analyse krever ofte MCAR eller andre sterke betingelser. Multippel imputasjon kan være rimelig under MAR dersom imputasjonsmodellen inkluderer behandlingsgruppe, prognostiske variabler og faktorer som predikerer frafall og utfall. Ingen statistisk metode kan uten antakelser gjenopprette informasjon som aldri er blitt observert.

En metodologisk oversikt identifiserte 101 arbeider om frafall. De fleste omhandlet metoder under MAR eller MNAR, mens mange publiserte RCT fortsatt bruker metoder som i praksis krever den sterkere MCAR-antakelsen [14]. Hovedanalysen bør derfor suppleres med sensitivitetsanalyser under klinisk rimelige MNAR-scenarier.

Justerte analyser

Justering for sterke prognostiske baselinevariabler kan øke presisjonen. Variablene og modellene bør være forhåndsdefinerte. Justering for variabler som har oppstått etter randomisering, for eksempel etterlevelse eller behandlingsrespons, kan introdusere skjevhet og endre spørsmålet analysen besvarer.

Ved kontinuerlige utfall er justering for baselineverdien ofte mer effektivt enn analyse av endring fra baseline. Ved stratifisert randomisering bør stratifiseringsfaktorene vanligvis tas hensyn til i analysen.

Subgruppeanalyser

En subgruppeeffekt innebærer at behandlingseffekten er forskjellig mellom grupper, ikke at effekten er signifikant i én gruppe og ikke-signifikant i en annen. Den relevante analysen er en interaksjonstest.

Troverdigheten øker dersom:

  • hypotesen og effektens retning var spesifisert på forhånd
  • bare et fåtall subgrupper ble testet
  • inndelingen bygger på baselinevariabler
  • interaksjonen er statistisk overbevisende
  • samme mønster ses i beslektede utfall og andre studier
  • det finnes en sterk biologisk eller klinisk forklaring

Subgruppeanalyser har ofte lav statistisk styrke, samtidig som mange analyser gir høy risiko for falskt positive funn. I en gjennomgang av RCT ved pulmonal hypertensjon brukte bare 37 prosent interaksjonstest. De fleste påstander om subgruppeeffekter oppfylte høyst fire av ti troverdighetskriterier [15].

Superiority, non-inferiority og ekvivalens

Superiority

En superiority-studie tester om en intervensjon er bedre enn kontrollen. Dersom konfidensintervallet inkluderer nulleffekt, kan man ikke konkludere med at behandlingene er likeverdige. Et ikke-signifikant resultat kan skyldes reell likhet, utilstrekkelig presisjon, dårlig etterlevelse eller stort frafall.

Non-inferiority

En non-inferiority-studie tester om den nye behandlingen ikke er uakseptabelt dårligere enn en etablert behandling. Marginen må fastsettes før studien og angi det største effekttapet som kan aksepteres. Den bør begrunnes både klinisk og ut fra tidligere evidens om kontrollbehandlingens effekt [16].

Den nye behandlingen bør tilby en annen fordel, for eksempel:

  • færre alvorlige bivirkninger
  • enklere administrasjon
  • lavere kostnad
  • bedre tilgjengelighet
  • mindre invasiv behandling

Dårlig etterlevelse, behandlingsbytte og uspesifikk utfallsmåling kan gjøre gruppene mer like og dermed kunstig favorisere konklusjonen non-inferiority. Både analyse etter randomisert gruppe og per protokoll-analyse bør normalt rapporteres, med samsvarende konklusjoner.

En systematisk gjennomgang av 823 non-inferiority-studier fant at marginen var angitt i om lag 95 prosent, men begrunnet i bare 57 prosent av studiene fra 2019. Færre enn halvparten brukte både intention-to-treat-lignende analyse og per protokoll-analyse, og mer enn halvparten var åpne studier [17].

Ekvivalens

En ekvivalensstudie tester om behandlingseffekten ligger innenfor et forhåndsdefinert intervall på begge sider av nulleffekt. Ekvivalens kan derfor ikke påvises med en ikke-signifikant superiority-test. Hele konfidensintervallet må ligge innenfor begge ekvivalensgrensene.

Tolkning av resultater

Effektmål

For et binært utfall kan følgende beregnes:

  • risiko i intervensjonsgruppen, EER
  • risiko i kontrollgruppen, CER
  • risikoratio, RR = EER / CER
  • absolutt risikoforskjell, RD = EER minus CER
  • relativ risikoreduksjon = 1 minus RR, når risikoen reduseres
  • number needed to treat, NNT = 1 / absolutt risikoreduksjon

NNT skal rundes opp til nærmeste heltall og må oppgis sammen med utfall, tidsperiode, kontrollrisiko og konfidensintervall. NNT er ikke en konstant egenskap ved legemiddelet. Samme relative effekt gir større absolutt nytte og lavere NNT ved høyere baselinerisiko.

Oddsratio kan gi et overdrevet inntrykk sammenlignet med en risikoratio når utfallet er vanlig. Hasardratio beskriver en relativ momentan hendelsesintensitet og er ikke direkte ensbetydende med risikoratio eller forskjell i medianoverlevelse. Proporsjonalitetsantakelsen bør være rimelig.

For kontinuerlige utfall bør gjennomsnittsforskjellen tolkes opp mot skalaens klinisk viktige forskjell. Standardisert gjennomsnittsforskjell gjør det lettere å sammenligne ulike skalaer, men uttrykkes i standardavvik og er mindre intuitiv.

P-verdi og konfidensintervall

P-verdien er sannsynligheten, under den statistiske modellen og nullhypotesen, for å få et resultat minst like ekstremt som det observerte. Den er ikke sannsynligheten for at nullhypotesen er sann, og angir verken effektens størrelse eller kliniske betydning.

Et 95 % konfidensintervall viser både effektens retning og presisjon. Ved vurdering bør man spørre:

  1. Inkluderer intervallet nulleffekt?
  2. Inkluderer det en klinisk viktig nytte?
  3. Inkluderer det en klinisk viktig skade?
  4. Er intervallet smalt nok til å fatte beslutninger?

Dikotomisering ved P = 0,05 er ofte misvisende. Resultater med P = 0,049 og P = 0,051 er ikke prinsipielt forskjellige. Fokus bør ligge på estimat, presisjon, studiekvalitet og samsvar med øvrig evidens.

Rapporteringen er ofte dårligere enn anbefalt. I en gjennomgang av 88 kirurgiske RCT rapporterte 68 prosent bare P-verdi og ikke 95 % konfidensintervall for nytte. Bare 6 prosent rapporterte NNT, og ingen rapporterte number needed to harm [18].

Nytte og skade

Alle relevante utfall må veies sammen. En moderat reduksjon i et vanlig, lett utfall kan være mindre betydningsfull enn en liten økning i en sjelden, alvorlig skade.

Vurder:

  • hvordan bivirkninger ble definert og etterspurt
  • om innsamlingen var aktiv eller passiv
  • oppfølgingstid
  • antall deltakere som ble eksponert
  • behandlingsavbrudd på grunn av bivirkninger
  • alvorlige hendelser og mortalitet
  • absolutte risikoer og konfidensintervaller

CONSORT Harms anbefaler transparent rapportering av hvordan skader ble definert, samlet inn, kodet og analysert [19]. En RCT er ofte dimensjonert for effekt, ikke for sjeldne skader, noe som gjør usikkerheten i sikkerhetsutfall stor.

Kritisk vurdering i klinisk praksis

flowchart TD
A["Definer klinisk spørsmål<br>og relevant estimand"] --> B["Sammenlign protokoll, register<br>og publikasjon"]
B --> C["Vurder randomisering<br>og skjult allokering"]
C --> D["Vurder avvik,<br>blinding og ko-intervensjoner"]
D --> E["Vurder frafall<br>og utfallsmåling"]
E --> F["Kontroller analysegruppe,<br>multiplisitet og seleksjon"]
F --> G["Tolk effektstørrelse<br>og 95 % KI"]
G --> H["Vei absolutt nytte<br>mot skade"]
H --> I["Vurder overførbarhet<br>til pasient og klinisk kontekst"]

Trinn 1: Er spørsmålet relevant?

Identifiser populasjon, intervensjon, sammenligning, utfall og tidspunkt. Kontroller om studiens primære spørsmål tilsvarer din kliniske beslutning. En godt gjennomført studie kan være irrelevant dersom kontrollbehandlingen, dosen eller den kliniske konteksten ikke tilsvarer svensk praksis.

Trinn 2: Var metodene forhåndsdefinert?

Finn registreringsnummer, protokoll og statistisk analyseplan. Sammenlign:

  • primært utfall
  • tidspunkt
  • utvalgsstørrelse
  • subgrupper
  • analysepopulasjon
  • stoppregler
  • non-inferiority-margin

Endringer kan være berettigede, men tidspunkt og begrunnelse skal angis. Endringer som er gjort etter tilgang til utfallsdata, har større risiko for å være resultatstyrte.

Trinn 3: Er det risiko for skjevhet?

RoB 2 vurderer fem hovedområder:

  1. randomiseringsprosessen
  2. avvik fra tiltenkte intervensjoner
  3. manglende utfallsdata
  4. måling av utfall
  5. seleksjon av rapportert resultat

Vurderingen skal gjelde et spesifikt resultat, fordi risikoen kan variere mellom for eksempel mortalitet og selvrapportert smerte. RoB 2 gir kategoriene lav risiko, noen bekymringer og høy risiko, ikke en numerisk kvalitetsskår [3].

Trinn 4: Er resultatet klinisk viktig?

Ta utgangspunkt i den forhåndsdefinerte primæranalysen. Finn absolutte hendelsestall, risikoforskjell og konfidensintervall. Vurder om effektens størrelse når en klinisk viktig terskel, og om den rettferdiggjør kostnader, behandlingsbyrde og skader.

Vær på vakt mot spin. I en gjennomgang av 93 kardiovaskulære RCT med ikke-signifikant primært utfall forekom positivt vinklet rapportering i 57 prosent av sammendragene og 67 prosent av hovedtekstene [20]. Vanlige strategier var fokus på signifikante sekundære utfall, subgrupper eller endringer innad i behandlingsgruppen.

Trinn 5: Er resultatet overførbart?

Intern validitet handler om hvorvidt resultatet er troverdig i den studerte populasjonen. Ekstern validitet gjelder om resultatet kan anvendes på andre pasienter og i andre kliniske miljøer.

Vurder særlig:

  • alder og skrøpelighet
  • kjønn og etnisitet
  • komorbiditet og polyfarmasi
  • sykdomsgrad og baselinerisiko
  • tidligere behandling
  • behandlingsnivå og behandlerens kompetanse
  • etterlevelse og tilgang til monitorering
  • intervensjonens faktiske dose og intensitet

En systematisk oversikt over 305 RCT fant en median eksklusjonsandel på 77,1 prosent når studienes kriterier ble anvendt på kliniske populasjoner. Vanlige årsaker var alder, komorbiditet og samtidig legemiddelbruk [21]. Relative effekter kan iblant overføres mellom risikonivåer, men absolutte effekter og skader endres når baselinerisikoen er forskjellig.

Trinn 6: Stemmer resultatet med øvrig evidens?

En enkelt RCT er sjelden avgjørende alene. Vurder studien sammen med:

  • andre RCT
  • systematiske oversikter og metaanalyser
  • biologisk plausibilitet
  • sikkerhetsdata
  • pasientpreferanser
  • ressursbruk og gjennomførbarhet

Store effekter i en liten, tidlig stoppet eller metodologisk svak studie krever særlig forsiktighet. Replikasjon i uavhengige studier og konsistente absolutte effekter styrker påliteligheten.

Rapportering og forskningsintegritet

CONSORT 2025 omfatter en sjekkliste med 30 punkter og deltakerflyt. Nyere elementer gjelder blant annet datadeling, interessekonflikter, pasientmedvirkning, skader, analysegrupper, manglende data og hvordan intervensjonen faktisk ble gjennomført [1]. CONSORT skal brukes sammen med relevante utvidelser for for eksempel klyngestudier, non-inferiority, adaptive design og pilotstudier.

En fullstendig CONSORT-rapport er ikke nødvendigvis en godt gjennomført studie. Sjekklisten angir hva som skal rapporteres, ikke hvilke metodevalg som alltid er korrekte. Omvendt kan en metodologisk robust studie være umulig å vurdere dersom rapporteringen er ufullstendig.

Pålitelig rapportering krever:

  • prospektiv registrering før første randomisering
  • offentlig protokoll og analyseplan
  • rapportering av alle viktige protokollendringer
  • CONSORT-flytdiagram
  • resultater for alle forhåndsdefinerte primære og sekundære utfall
  • absolutte og relative effekter med konfidensintervaller
  • transparent skaderapportering
  • finansiering og interessekonflikter
  • informasjon om tilgang til avidentifiserte data og analysekode

CONSORT 2025 erstatter CONSORT 2010. Eldre publikasjoner må naturligvis vurderes ut fra tilgjengelig informasjon, men ved planlegging, rapportering og vurdering av nye RCT bør 2025-versjonen brukes [1,2].

Kilder

  1. Hopewell S et al. CONSORT 2025 statement: updated guideline for reporting randomised trials. BMJ 2025. PMID: 40228833
  2. Hopewell S et al. CONSORT 2025 explanation and elaboration: updated guideline for reporting randomised trials. BMJ 2025. PMID: 40228832
  3. Sterne JAC et al. RoB 2: a revised tool for assessing risk of bias in randomised trials. BMJ 2019. PMID: 31462531
  4. Wang H et al. Trial-level characteristics associate with treatment effect estimates: a systematic review of meta-epidemiological studies. BMC Medical Research Methodology 2022. PMID: 35705904
  5. Chan AW et al. SPIRIT 2025 statement: updated guideline for protocols of randomised trials. BMJ 2025. PMID: 40294953
  6. Manyara AM et al. Reporting of surrogate endpoints in randomised controlled trial reports (CONSORT-Surrogate): extension checklist with explanation and elaboration. BMJ 2024. PMID: 38981645
  7. Cook JA et al. Choosing the target difference ('effect size') for a randomised controlled trial: DELTA2 guidance protocol. Trials 2017. PMID: 28606102
  8. Rutterford C et al. Reporting and methodological quality of sample size calculations in cluster randomized trials could be improved: a review. Journal of Clinical Epidemiology 2015. PMID: 25523375
  9. Eldridge S et al. Internal and external validity of cluster randomised trials: systematic review of recent trials. BMJ 2008. PMID: 18364360
  10. Campbell MK et al. Consort 2010 statement: extension to cluster randomised trials. BMJ 2012. PMID: 22951546
  11. McKenzie JE et al. Reporting of cluster randomised crossover trials: extension of the CONSORT 2010 statement with explanation and elaboration. BMJ 2025. PMID: 39761979
  12. Hohenschurz-Schmidt D et al. Pragmatic trials of pain therapies: a systematic review of methods. Pain 2022. PMID: 34490854
  13. Eldridge SM et al. CONSORT 2010 statement: extension to randomised pilot and feasibility trials. BMJ 2016. PMID: 27777223
  14. Medcalf E et al. Addressing missing outcome data in randomised controlled trials: A methodological scoping review. Contemporary Clinical Trials 2024. PMID: 38857674
  15. Rodríguez-Ramallo H et al. Subgroup Analysis in Pulmonary Hypertension-Specific Therapy Clinical Trials: A Systematic Review. Journal of Personalized Medicine 2022. PMID: 35743648
  16. Piaggio G et al. Reporting of noninferiority and equivalence randomized trials: extension of the CONSORT 2010 statement. JAMA 2012. PMID: 23268518
  17. Sengul A et al. Non-Inferiority Trials: A Systematic Review on Methodological Quality and Reporting Standards. Journal of General Internal Medicine 2024. PMID: 38954320
  18. Stubenrouch FE et al. Systematic review of reporting benefits and harms of surgical interventions in randomized clinical trials. BJS Open 2020. PMID: 32207574
  19. Junqueira DR et al. CONSORT Harms 2022 statement, explanation, and elaboration: updated guideline for the reporting of harms in randomised trials. BMJ 2023. PMID: 37094878
  20. Khan MS et al. Level and Prevalence of Spin in Published Cardiovascular Randomized Clinical Trial Reports With Statistically Nonsignificant Primary Outcomes: A Systematic Review. JAMA Network Open 2019. PMID: 31050775
  21. He J et al. Exclusion rates in randomized controlled trials of treatments for physical conditions: a systematic review. Trials 2020. PMID: 32102686

Oppdatert 29. september 2026