Sammendrag
Kunnskapsbasert medisin innebærer å forene beste tilgjengelige vitenskapelige kunnskapsgrunnlag med klinisk ekspertise og pasientens verdier, mål og forutsetninger. Det er ikke ensbetydende med å følge en artikkel, en metaanalyse eller en retningslinje mekanisk. Vitenskapelige resultater må først vurderes med hensyn til validitet, effektstørrelse, presisjon, relevans og overførbarhet til den aktuelle pasienten [1].
Arbeidsgangen kan oppsummeres i fem trinn: formuler et besvarbart spørsmål, søk etter beste tilgjengelige kunnskap, vurder kunnskapsgrunnlaget kritisk, anvend resultatet sammen med pasienten og evaluer konsekvensene av beslutningen [2]. Spørsmålet bør struktureres etter klinisk spørsmålstype, vanligvis med PICO: populasjon, intervensjon eller eksponering, sammenligning og utfall. Søk i første omgang etter oppdaterte og metodologisk pålitelige retningslinjer eller systematiske oversikter. Gå videre til primærstudier dersom oversikter mangler, er for gamle eller ikke svarer til spørsmålet.
Kritisk vurdering skal skille mellom tre spørsmål:
- Er resultatet tilstrekkelig troverdig?
- Hvor stor og presis er effekten?
- Er resultatet relevant for denne pasienten og denne beslutningen?
Relative effekter bør suppleres med absolutte tall, for eksempel absolutt risikoreduksjon og number needed to treat, NNT. En lav p-verdi beviser verken at effekten er stor, klinisk viktig eller fri for systematiske feil. For diagnostiske tester må testresultatet tolkes ut fra sannsynligheten før testen. For retningslinjer må styrken i anbefalingen skilles fra kunnskapsgrunnlagets pålitelighet. Til slutt skal beslutningen følges opp med pasientrelevante utfall og revurderes når pasientens tilstand, mål eller kunnskapsstatus endres.
Grunnprinsipper
Hva kunnskapsbasert medisin er
Kunnskapsbasert medisin ble utviklet som en måte å gjøre kliniske beslutninger mer eksplisitte, reproduserbare og transparente på. Den klassiske definisjonen vektlegger samvittighetsfull og skjønnsom bruk av beste aktuelle evidens i beslutninger om enkeltpasienter. Klinisk erfaring trengs for å identifisere problemet, anslå grunnrisiko, tolke usikkerhet og avgjøre om resultatene er overførbare. Pasientens preferanser trengs fordi samme mulige nytte og skade kan verdsettes ulikt av ulike personer [1].
Begrepet omfatter både individuelle pasientbeslutninger og beslutninger på gruppenivå, for eksempel behandlingsprogrammer, prioriteringer og utfasing av tiltak med lav nytte. Den individuelle prosessen kan beskrives med fem trinn:
| Trinn | Praktisk betydning | Vanlig feil |
|---|---|---|
| Spørsmål | Omgjør usikkerheten til et strukturert klinisk spørsmål | Spørsmålet blir for bredt eller utfallet for vagt |
| Søk | Identifiser beste tilgjengelige kunnskapskilde | Man velger første treff eller søker bare i én database |
| Vurder | Vurder risiko for bias, effektstørrelse, presisjon og overførbarhet | Man vurderer tidsskriftets omdømme i stedet for studiens metode |
| Anvend | Integrer evidens med klinisk vurdering og pasientens mål | En anbefaling brukes som en regel uten individualisering |
| Evaluer | Følg opp prosess, nytte, skade og beslutningskvalitet | Effekten av beslutningen kontrolleres ikke |
Den femdelte modellen brukes også ved undervisning i og vurdering av kunnskapsbasert medisin. En systematisk oversikt over validerte vurderingsinstrumenter viste at kritisk vurdering ofte måles, mens evnen til å anvende og deretter evaluere beslutningen vurderes betydelig sjeldnere [2]. Dette gjenspeiler et vanlig klinisk problem: stor oppmerksomhet rettes mot artikkellesing, men mindre mot hvordan kunnskapen faktisk endrer beslutninger og pasientutfall.
Hva kunnskapsbasert medisin ikke er
Kunnskapsbasert medisin er ikke:
- en kokebok der samme tiltak brukes for alle
- en metode for å erstatte klinisk erfaring med statistikk
- et krav om at hver beslutning må støttes av en randomisert studie
- det samme som kostnadsminimering
- det samme som å følge en klinisk retningslinje
- en antakelse om at alle publiserte studier er pålitelige
- en antakelse om at en systematisk oversikt alltid har høy kvalitet
- et flertallsvedtak blant eksperter
Fravær av høygradig evidens er ikke evidens for fravær av effekt. Ved sjeldne sykdommer, akutte livstruende tilstander, kirurgiske intervensjoner, langtidsskader og etisk vanskelig studerbare spørsmål kan randomiserte studier være umulige eller uegnede. Da må beslutningen baseres på det beste kunnskapsgrunnlaget som finnes, samtidig som det redegjøres tydelig for usikkerheten.
Evidenshierarkiet avhenger av spørsmålet
Én enkelt generell evidenspyramide er utilstrekkelig. Egnet studiedesign avhenger av hvilket spørsmål som skal besvares. En randomisert studie er vanligvis best for å anslå den kausale effekten av en intervensjon, men ikke for å anslå prevalens, sjeldne sene bivirkninger eller en diagnostisk tests treffsikkerhet.
| Klinisk spørsmål | Vanligvis mest informative studiedesign | Sentrale vurderingsspørsmål |
|---|---|---|
| Behandling eller forebygging | Systematisk oversikt over randomiserte studier, deretter enkeltstående randomisert studie | Randomisering, skjult allokering, frafall, blinding, etterlevelse |
| Diagnostikk | Tverrsnittsstudie eller prospektiv kohort med relevant referansemetode | Pasientutvalg, blindet tolkning, verifiseringsbias, terskelverdi |
| Prognose | Prospektiv kohort, helst med ekstern validering | Representativt startpunkt, frafall, utfallsvurdering, kalibrering |
| Etiologi eller skade | Kohort- eller kasus-kontrollstudie, iblant randomisert studie | Konfundering, dose-respons, tidsrekkefølge, seleksjon, feilklassifisering |
| Prevalens | Representativ tverrsnittsstudie | Utvalgsramme, deltakelse, definisjon og måling |
| Pasienters erfaringer | Kvalitativ studie eller kvalitativ evidenssyntese | Formålstjenlig utvalg, datametning, refleksivitet og analyse |
| Implementering | Pragmatisk randomisert studie, klyngerandomisert studie eller kontrollert tidsserie | Kontekst, gjennomføringsgrad, kontaminering og bærekraft |
Også oversikter har ulike formål. En systematisk oversikt besvarer et avgrenset spørsmål med forhåndsbestemte metoder. En scoping review kartlegger et bredere område og trenger ikke å vurdere effekter. En narrativ oversikt kan gi klinisk forståelse, men er mer avhengig av forfatterens utvalg. En umbrella review sammenstiller eksisterende systematiske oversikter. Disse publikasjonstypene er derfor ikke utskiftbare [3].
Arbeidsgang
flowchart TD
A["Identifiser klinisk usikkerhet"] --> B["Formuler spørsmålet<br>med PICO eller tilsvarende"]
B --> C["Bestem spørsmålstype<br>og relevant studiedesign"]
C --> D["Søk først etter oppdatert<br>retningslinje eller systematisk oversikt"]
D --> E["Vurder aktualitet,<br>metode og relevans"]
E -->|"Tilstrekkelig grunnlag"| F["Kvantifiser nytte,<br>skade og usikkerhet"]
E -->|"Utilstrekkelig grunnlag"| G["Søk etter relevante<br>primærstudier"]
G --> H["Vurder kritisk<br>risiko for bias og presisjon"]
H --> F
F --> I["Vurder overførbarhet,<br>grunnrisiko og gjennomførbarhet"]
I --> J["Diskuter alternativer<br>med pasienten"]
J --> K["Fatt og dokumenter<br>en felles beslutning"]
K --> L["Følg opp utfall,<br>bivirkninger og beslutning"]
L --> M["Revurder ved ny evidens<br>eller endrede forutsetninger"]Trinn 1: Identifiser beslutningen og formuler spørsmålet
Ta utgangspunkt i en reell beslutning, ikke i et generelt kunnskapsområde. Spørsmålet "Hvilken behandling er best ved atrieflimmer?" er for bredt. Et mer anvendelig spørsmål definerer pasientgruppen, alternativene og de utfallene som kan endre beslutningen.
For behandlingsspørsmål brukes vanligvis PICO:
- P, population: diagnose, sykdomsgrad, alder, komorbiditet og behandlingsmiljø
- I, intervention: behandling, diagnostisk strategi eller annet tiltak
- C, comparison: placebo, vanlig behandling, annen aktiv behandling eller ingen tiltak
- O, outcome: pasientrelevante effekter og skader
- T, time: relevant tidshorisont kan legges til når utfallet er tidsavhengig
Eksempel:
Hos personer over 75 år med ikke-valvulært atrieflimmer og høy blødningsrisiko, reduserer direktevirkende orale antikoagulantia sammenlignet med warfarin risikoen for iskemisk hjerneslag uten uakseptabel økning i alvorlig blødning i løpet av to år?
For diagnostiske spørsmål erstattes intervensjonen av indekstest og sammenligningen av referansemetode. For prognosespørsmål defineres startpunkt, prognostisk faktor eller modell, utfall og tidsperiode. For spørsmål om skade defineres eksponering og relevant ueksponert sammenligningsgruppe.
Utfallet bør være viktig for pasienten. Mortalitet, symptomer, funksjon, livskvalitet, sykehusinnleggelse og alvorlige bivirkninger er oftest mer direkte relevante enn laboratorieverdier eller radiologiske surrogater. Et surrogatutfall kan være nyttig dersom koblingen til pasientnytte er godt validert, men en forbedring av en biomarkørverdi skal ikke automatisk tolkes som bedret helse.
Trinn 2: Søk effektivt og reproduserbart
Søket bør tilpasses tidsrammen og beslutningens betydning. Ved et akutt pasientspørsmål kan en validert kunnskapsoppsummering være rimelig. Ved utarbeiding av retningslinje eller behandlingsprogram kreves et dokumentert, reproduserbart og bredere søk.
En praktisk søkerekkefølge er:
- Oppdatert nasjonal eller internasjonal retningslinje.
- Systematisk oversikt eller metaanalyse.
- Nyere randomiserte eller godt gjennomførte observasjonsstudier som er publisert etter oversiktens siste søkedato.
- Enkeltstående primærstudier dersom synteser mangler.
- Ekspertkonsensus når det empiriske grunnlaget er utilstrekkelig.
Kontroller alltid:
- når litteratursøket ble avsluttet
- om populasjon, intervensjon og utfall svarer til spørsmålet
- om dokumentet er erstattet eller oppdatert
- om anbefalingen er tilpasset et annet helsesystem
- om legemidler, diagnostikk eller oppfølging er tilgjengelige i Sverige
Retningslinjer skal ikke aksepteres bare på grunn av avsenderen. I en systematisk gjennomgang av 40 retningslinjer for atopisk dermatitt varierte den metodologiske kvaliteten betydelig. Anvendbarhet og metodologisk stringens var de svakeste områdene, og håndteringen av interessekonflikter var ofte mangelfull [4]. Svenske regulatoriske vilkår, refusjonsbegrensninger og organisatoriske forutsetninger kan dessuten avvike fra internasjonale anbefalinger.
Praktisk PubMed-søk
Begynn med kjernebegrepene fra PICO. Bruk både emneord og fritekst når søket må være fullstendig. Unngå å legge inn alle tenkelige pasientegenskaper direkte, fordi relevante studier da kan bli oversett.
En forenklet struktur for et behandlingsspørsmål er:
(population OR synonym) AND (intervention OR synonym) AND
(randomized controlled trial OR systematic review)Ikke søk rutinemessig på et forventet utfall som "mortality" dersom dette risikerer å utelukke studier der utfallet bare forekommer i fulltekst. Dokumenter database, dato, fullstendig søkestreng og eventuelle filtre når søket skal kunne etterprøves eller gjentas.
Trinn 3: Velg riktig kunnskapskilde
En godt utført systematisk oversikt er ofte mest effektiv, fordi den sammenstiller hele forskningsstatusen. Den er imidlertid bare så pålitelig som metodene og de inkluderte studiene. En metaanalyse er en statistisk metode, ikke et kvalitetsstempel.
GRADE brukes for å vurdere påliteligheten av et samlet kunnskapsgrunnlag for hvert viktig utfall. Vurderingen omfatter blant annet risiko for bias, inkonsistens, indirekthet, manglende presisjon og publikasjonsskjevhet. Evidensen klassifiseres som høy, middels, lav eller svært lav pålitelighet [5].
Systematiske oversikter bør redegjøre for problemstilling, protokoll, søk, utvalg, risiko for bias, syntese og evidensvurdering. PRISMA 2020 inneholder 27 rapporteringspunkter og et flytskjema for dette formålet [6]. PRISMA beskriver rapportering, ikke metodologisk kvalitet. En fullstendig sjekkliste garanterer derfor ikke at oversikten er godt gjennomført. For metodevurdering av intervensjonsoversikter kan AMSTAR 2 brukes. Verktøyet omfatter oversikter over både randomiserte og ikke-randomiserte studier [7].
Kritisk vurdering
Begynn med metode, ikke resultater
Lesingen bør skje i følgende rekkefølge:
- Forskningsspørsmål og studiedesign.
- Populasjon, inklusjonskriterier og behandlingsmiljø.
- Intervensjon eller eksponering og sammenligning.
- Utfall og oppfølgingstid.
- Metoder som begrenser systematiske feil.
- Frafall og manglende data.
- Effektstørrelse og konfidensintervall.
- Finansiering, protokoll, registrering og interessekonflikter.
- Først deretter forfatternes konklusjon.
Sammendrag og diskusjonsavsnitt er utilstrekkelige for en fullstendig kvalitetsvurdering. Kontroller tabeller, figurer, supplement, studieprotokoll og statistisk analyseplan når beslutningen er viktig.
Rapporteringsretningslinjer gjør lesingen enklere. CONSORT gjelder randomiserte parallellgruppestudier [8], STROBE observasjonsstudier [9], STARD studier av diagnostisk treffsikkerhet [10] og TRIPOD diagnostiske eller prognostiske prediksjonsmodeller [11]. Disse retningslinjene bedrer transparensen, men erstatter ikke en vurdering av risiko for bias.
Randomiserte intervensjonsstudier
Randomisering reduserer konfundering ved å fordele både kjente og ukjente prognostiske faktorer mellom gruppene. Fordelen kan gå tapt ved mangelfull allokering, selektivt frafall, overkrysning eller uegnet analyse.
Vurder særlig:
- Var randomiseringssekvensen virkelig tilfeldig?
- Var tildelingen skjult frem til inklusjon?
- Var deltakere, behandlere og utfallsvurderere blindet når det var mulig?
- Ble gruppene behandlet likt bortsett fra intervensjonen?
- Var utfallet forhåndsdefinert, relevant og målt på samme måte?
- Var frafallet lite og jevnt fordelt?
- Ble deltakerne hovedsakelig analysert etter opprinnelig gruppetildeling?
- Ble alle forhåndsdefinerte utfall rapportert?
- Ble studien stoppet før tiden etter en uventet stor effekt?
- Var studien dimensjonert for både nytte og viktige skader?
Intention-to-treat-analyse anslår effekten av å bli tildelt en strategi og bevarer som regel sammenlignbarheten fra randomiseringen. Per-protokoll-analyse anslår effekten blant dem som fulgte protokollen, men kan gjeninnføre konfundering. Begge kan være relevante, men de besvarer ulike spørsmål.
Klyngestudier krever særskilt analyse fordi pasienter innenfor samme behandlingsenhet ikke er statistisk uavhengige. Ved crossover-studier må mulig vedvarende behandlingseffekt og tilstrekkelig utvaskingsperiode vurderes.
Observasjonsstudier
Observasjonsstudier er sentrale for prognose, prevalens, diagnostikk, sjeldne skader og langtidseffekter. De kan også gi verdifull informasjon om behandlingseffekt når randomisering ikke er gjennomførbar. Resultatene deres er imidlertid mer sårbare for seleksjonsbias, informasjonsbias og konfundering [12].
Vanlige problemer er:
| Problem | Eksempel | Konsekvens |
|---|---|---|
| Confounding by indication | Mer alvorlig syke får en bestemt behandling | Behandlingen kan feilaktig fremstå som skadelig |
| Seleksjonsbias | Deltakelse eller oppfølging avhenger av prognose | Sammenligningsgruppene blir systematisk ulike |
| Feilklassifisering | Diagnose eller legemiddeleksponering registreres feil | Sammenhengen svekkes eller forvrenges |
| Immortal time bias | Eksponert status krever overlevelse frem til en senere dato | Behandlingen kan feilaktig fremstå som beskyttende |
| Healthy user bias | Behandlede personer har også annen helsefremmende atferd | Effekten overvurderes |
| Informativ sensurering | Frafall henger sammen med prognose eller behandlingseffekt | Gjenværende deltakere er ikke representative |
| Residual confounding | Viktig variabel mangler eller måles grovt | Justert analyse er fortsatt skjev |
I en kartlegging av metodeproblemer i studier basert på helsedatabaser var konfundering den vanligste hovedkategorien. Confounding by indication, residual confounding, feilklassifisering av utfall og immortal time bias var særlig fremtredende [13].
Regresjonsjustering, matching og propensity score-metoder kan balansere målte faktorer, men kan ikke sikkert eliminere umålte konfundere. Propensity score bør derfor ikke betraktes som en statistisk erstatning for randomisering. Metoden kan supplere randomiserte data og bedre sammenlignbarheten i observasjonsdata, men resultatet avhenger av hvilke variabler som er målt, hvordan modellen er spesifisert, og om behandlingsgruppene har tilstrekkelig overlapp [14].
En stor database eller et svært smalt konfidensintervall løser ikke systematiske feil. Tvert imot kan et smalt konfidensintervall gi en falsk følelse av sikkerhet rundt et skjevt estimat.
Diagnostiske studier
En diagnostisk test bør evalueres i den populasjonen og den kliniske situasjonen der den skal brukes. Kasus-kontroll-lignende studier med tydelig syke pasienter og helt friske kontroller har en tendens til å overvurdere testens treffsikkerhet.
De grunnleggende målene er:
- Sensitivitet: andelen syke som har positiv test.
- Spesifisitet: andelen ikke-syke som har negativ test.
- Positiv likelihood ratio: sensitivitet / (1 - spesifisitet).
- Negativ likelihood ratio: (1 - sensitivitet) / spesifisitet.
- Positiv prediktiv verdi: sannsynligheten for sykdom ved positiv test.
- Negativ prediktiv verdi: sannsynligheten for fravær av sykdom ved negativ test.
Prediktive verdier påvirkes sterkt av sykdomsprevalensen og kan ikke ukritisk overføres mellom primærhelsetjeneste, akuttmottak og spesialistklinikk. Likelihood ratio kan brukes til å oppdatere odds:
Odds før test = sannsynlighet før test / (1 - sannsynlighet før test)
Odds etter test = odds før test × likelihood ratio
Sannsynlighet etter test = odds etter test / (1 + odds etter test)Testing er mest verdifull når resultatet kan flytte sannsynligheten over en klinisk beslutningsterskel. En test er mindre nyttig dersom behandling skal gis uansett resultat, eller dersom ingen mulige resultater ville begrunne behandling. Sensitivitet og spesifisitet endres dessuten når terskelverdien endres. ROC-kurven viser testens diskrimineringsevne over flere terskler, men angir ikke alene hvilken terskelverdi som er klinisk egnet [15].
Systematiske oversikter og metaanalyser
Kontroller om oversikten har:
- en forhåndsregistrert eller datert protokoll
- uttalte inklusjonskriterier
- et tilstrekkelig bredt og oppdatert søk
- uavhengig vurdering av minst to personer
- redegjørelse for ekskluderte fulltekstartikler
- vurdering av risiko for bias per relevant utfall
- en begrunnet syntesemetode
- analyse av klinisk og statistisk heterogenitet
- vurdering av publikasjonsskjevhet når det er mulig
- redegjørelse for absolutte effekter og kunnskapsgrunnlagets pålitelighet
Statistisk heterogenitet skal ikke vurderes bare med I². Også forskjeller i populasjon, dose, intervensjon, oppfølging, definisjoner og risiko for bias må analyseres. Et sammenveid estimat kan være misvisende dersom studiene ikke gjelder samme kliniske spørsmål.
Nettverksmetaanalyse kan sammenligne flere behandlinger gjennom både direkte og indirekte evidens. Metoden krever rimelig transitivitet, det vil si at studienes effektmodifikatorer er tilstrekkelig sammenlignbare for indirekte sammenligninger. Rangering av behandlinger bør ikke leses uten effektstørrelser, konfidensintervaller, inkonsistensanalyse og vurdering av kunnskapsgrunnlagets pålitelighet [16].
Tolkning av effektmål
Relative og absolutte effekter
For et dikotomt utfall gjelder:
Risiko i kontrollgruppen = hendelser i kontrollgruppen / antall i kontrollgruppen
Risiko i intervensjonsgruppen = hendelser i intervensjonsgruppen / antall i intervensjonsgruppen
Relativ risiko, RR = intervensjonsrisiko / kontrollrisiko
Relativ risikoreduksjon = 1 - RR
Absolutt risikoreduksjon, ARR = kontrollrisiko - intervensjonsrisiko
NNT = 1 / ARRDersom risikoen reduseres fra 10 prosent til 8 prosent, er RR 0,80, relativ risikoreduksjon 20 prosent, ARR 2 prosentpoeng og NNT 50 i den studerte perioden. Dersom samme RR gjelder når grunnrisikoen er 1 prosent, blir ARR 0,2 prosentpoeng og NNT 500. Den relative effekten er den samme, men den kliniske nytten er svært forskjellig.
NNT skal alltid angis sammen med:
- utfall
- tidsperiode
- sammenligning
- pasientgruppe eller grunnrisiko
- konfidensintervall når det finnes
For skade brukes tilsvarende absolutt risikoøkning og number needed to harm, NNH. NNT og NNH bør ikke sammenlignes mekanisk dersom utfallene er ulike i alvorlighetsgrad.
Oddsratio kan tilnærme relativ risiko når hendelsen er sjelden, men overvurderer ofte den relative effekten når utfallet er vanlig. Hasardratio beskriver relative hendelsesrater over tid og kan ikke direkte oversettes til en risikoratio uten ytterligere informasjon.
Kontinuerlige utfall
Gjennomsnittsforskjell er lettest å tolke når alle studier bruker samme skala. Standardisert gjennomsnittsforskjell brukes når ulike skalaer måler samme konstrukt, men uttrykkes i standardavvik og er mindre klinisk intuitiv.
Statistisk signifikans skal skilles fra klinisk betydning. En svært stor studie kan påvise en liten forskjell som pasienten ikke merker. Minste klinisk viktige forskjell kan være til hjelp, men verdien avhenger av populasjon, måleinstrument, utgangsnivå og metode. En terskelverdi fra en annen sykdomsgrad eller intervensjon bør ikke brukes uten at relevansen er vurdert [17].
Konfidensintervaller og p-verdier
P-verdien angir hvor uforenlige observerte data er med en spesifisert statistisk nullhypotese, gitt modellens antakelser. Den angir ikke sannsynligheten for at hypotesen er sann, sannsynligheten for at resultatet skyldes tilfeldigheter eller effektens kliniske betydning.
Konfidensintervallet viser både retning og presisjon. Spør:
- Inkluderer intervallet ingen effekt?
- Inkluderer det en klinisk viktig nytte?
- Inkluderer det en klinisk viktig skade?
- Er intervallet så bredt at flere ulike beslutninger fortsatt er rimelige?
Et ikke-signifikant resultat kan skyldes utilstrekkelig presisjon og er ikke automatisk ensbetydende med påvist fravær av effekt. Ekvivalens og non-inferiority krever særskilte forhåndsdefinerte marginer og analyseprinsipper.
Et klinisk eksempel på absolutt effekt
I en metaanalyse av PSA-basert prostatakreftscreening tilsvarte en mulig relativ reduksjon i prostatakreftspesifikk dødelighet i den metodologisk sterkeste studien omtrent ett færre dødsfall per 1 000 screenede menn over ti år. Samtidig økte diagnostikk og behandlingsrelaterte komplikasjoner. Eksemplet viser hvorfor relative effektmål, absolutte tall, tidshorisont og skader må presenteres sammen [18].
Vurdering av kunnskapsgrunnlagets pålitelighet
GRADE vurderer evidens per utfall, ikke per artikkel. En studie kan derfor gi et mer pålitelig grunnlag for mortalitet enn for livskvalitet eller bivirkninger.
| GRADE-domene | Spørsmål ved vurderingen |
|---|---|
| Risiko for bias | Kan studienes gjennomføring systematisk ha forvrengt resultatet? |
| Inkonsistens | Er effektens størrelse eller retning ulik mellom studier uten rimelig forklaring? |
| Indirekthet | Avviker populasjon, intervensjon, sammenligning eller utfall fra beslutningen? |
| Manglende presisjon | Er konfidensintervallet så bredt at ulike kliniske beslutninger er mulige? |
| Publikasjonsskjevhet | Kan negative eller små studier mangle? |
Randomiserte studier starter vanligvis som evidens med høy pålitelighet og kan nedgraderes. Observasjonsstudier starter vanligvis lavere, men kan i visse situasjoner oppgraderes, for eksempel ved svært stor effekt, dose-respons eller når gjenværende konfundering sannsynligvis ville redusere den observerte effekten [5].
En sterk anbefaling kan iblant gis til tross for lav pålitelighet i kunnskapsgrunnlaget, for eksempel når en livstruende skade er plausibel og alternativet er enkelt og trygt. Omvendt kan en betinget anbefaling være rimelig til tross for høy pålitelighet når nytte og skade ligger nær hverandre eller pasienters verdier varierer.
Fra evidens til pasientbeslutning
Overførbarhet
Etter kritisk vurdering skal følgende vurderes:
- Ligner pasienten studiedeltakerne med hensyn til sykdomsgrad, alder og komorbiditet?
- Er pasientens grunnrisiko høyere eller lavere?
- Er intervensjonens dose, intensitet og oppfølging gjennomførbare?
- Har pasienten kontraindikasjoner eller særlig sårbarhet for skade?
- Ble det målt utfall som pasienten verdsetter?
- Er tidshorisonten relevant for forventet levetid og behandlingsmål?
- Finnes det konkurrerende risikoer?
- Hvilke praktiske kostnader, kontroller og behandlingsbyrder kommer i tillegg?
- Samsvarer sammenligningsbehandlingen med dagens svenske helsetjeneste?
Multimorbiditet kan gjøre separate retningslinjer motstridende. En kombinasjon av flere kunnskapsbaserte anbefalinger er ikke automatisk kunnskapsbasert dersom den fører til polyfarmasi, urimelig behandlingsbyrde eller samvirkende bivirkninger. Prioriter da de utfallene som er viktigst for pasienten, og ta hensyn til tid til forventet nytte.
Samvalg
Når det finnes flere rimelige alternativer, bør klinikeren redegjøre for:
- at en beslutning må tas
- hvilke alternativer som finnes, inkludert å avstå
- forventet absolutt nytte og skade
- usikkerheten i estimatene
- praktiske konsekvenser
- hvilke utfall pasienten verdsetter høyest
Beslutningsstøtteverktøy for pasienter kan bedre kunnskap, risikooppfatning og medvirkning. En Cochrane-oversikt med 209 studier og 107 698 deltakere viste at beslutningsstøtte sannsynligvis økte samsvaret mellom informerte verdier og valg. Den bedret også kunnskap og korrekt risikooppfatning uten påvist økning i beslutningsanger [19].
Risikoer bør helst uttrykkes som naturlige frekvenser med samme nevner, for eksempel "8 av 100 sammenlignet med 10 av 100 over fem år". Unngå å presentere nytten som relativ risikoreduksjon og skaden som absolutt risikoøkning. Bruk samme tidshorisont og visuelle format for begge.
Dokumenter gjerne:
- hvilken beslutning som ble tatt
- hvilke alternativer som ble diskutert
- anslått nytte og skade
- pasientens viktigste mål
- gjenværende usikkerhet
- planlagt oppfølging og kriterier for revurdering
Oppfølging, implementering og revurdering
Kunnskapsbasert medisin avsluttes ikke når beslutningen er tatt. Evaluer om intervensjonen ble gjennomført, om den ga tilsiktet effekt, og om det oppstod uønskede konsekvenser.
På individnivå bør oppfølgingen omfatte:
- pasientrelevant effekt
- bivirkninger og behandlingsbyrde
- etterlevelse og gjennomførbarhet
- endrede preferanser
- nye kontraindikasjoner eller konkurrerende risikoer
- behov for dosejustering, seponering eller alternativ strategi
På virksomhetsnivå kan man måle etterlevelse av en anbefalt prosess, uønsket variasjon, pasientutfall, likeverdighet, ressursbruk og forekomst av overdiagnostikk eller helsetjenester med lav nytte.
Undervisning alene gir ofte begrenset endring. En Cochrane-oversikt over 215 studier fant at undervisningsmøter sannsynligvis ga en liten forbedring av klinisk praksis og en mindre forbedring av pasientutfall. Effekten varierte og så ut til å kunne forsterkes av flere samvirkende strategier [20]. Implementering kan derfor kreve kombinasjoner av lokale behandlingsforløp, tilbakemelding, påminnelser, ansvarsfordeling og tilgang til beslutningsstøtte.
Elektroniske påminnelser er ingen universalløsning. En systematisk oversikt over 54 randomiserte studier i primærhelsetjenesten fant forbedringer hovedsakelig i dokumentasjon og enkelte pasientsentrerte prosessmål, mens effektene på sikkerhet, effektivitet og kliniske utfall var mindre konsistente [21]. Beslutningsstøtte bør utformes slik at den passer inn i arbeidsflyten, kan overstyres når pasienten avviker fra standardsituasjonen, og ikke bidrar til varslingstretthet.
Kunnskapsstatus bør revurderes når:
- en ny behandling eller diagnostisk metode innføres
- nye sikkerhetssignaler oppstår
- en viktig randomisert studie publiseres
- en systematisk oversikt eller retningslinje oppdateres
- pasientens grunnrisiko eller mål endres
- intervensjonen ikke gir forventet effekt
- behandlingsbyrden overstiger nytten
En velfungerende kunnskapsbasert kultur krever derfor både individuelle ferdigheter og organisatoriske systemer for søk, kritisk vurdering, samvalg, oppfølging og avvikling av ineffektive arbeidsmåter.
Kilder
- Sackett DL et al. Evidence based medicine: what it is and what it isn't. BMJ 1996. PMID: 8555924
- Kumaravel B et al. A systematic review and taxonomy of tools for evaluating evidence-based medicine teaching in medical education. Systematic Reviews 2020. PMID: 32331530
- Grant MJ, Booth A. A typology of reviews: an analysis of 14 review types and associated methodologies. Health Information and Libraries Journal 2009. PMID: 19490148
- Arents BWM et al. Global Guidelines in Dermatology Mapping Project, a systematic review of atopic dermatitis clinical practice guidelines: are they clear, unbiased, trustworthy and evidence based? British Journal of Dermatology 2022. PMID: 34984668
- Guyatt G et al. GRADE guidelines: 1. Introduction, GRADE evidence profiles and summary of findings tables. Journal of Clinical Epidemiology 2011. PMID: 21195583
- Page MJ et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ 2021. PMID: 33782057
- Shea BJ et al. AMSTAR 2: a critical appraisal tool for systematic reviews that include randomised or non-randomised studies of healthcare interventions, or both. BMJ 2017. PMID: 28935701
- Schulz KF et al. CONSORT 2010 statement: updated guidelines for reporting parallel group randomised trials. BMJ 2010. PMID: 20332509
- von Elm E et al. The Strengthening the Reporting of Observational Studies in Epidemiology statement: guidelines for reporting observational studies. Journal of Clinical Epidemiology 2008. PMID: 18313558
- Bossuyt PM et al. STARD 2015: an updated list of essential items for reporting diagnostic accuracy studies. BMJ 2015. PMID: 26511519
- Collins GS et al. Transparent reporting of a multivariable prediction model for individual prognosis or diagnosis: the TRIPOD statement. BMJ 2015. PMID: 25569120
- Hammer GP et al. Avoiding bias in observational studies: part 8 in a series of articles on evaluation of scientific publications. Deutsches Ärzteblatt International 2009. PMID: 19946431
- Prada-Ramallal G et al. Bias in pharmacoepidemiologic studies using secondary health care databases: a scoping review. BMC Medical Research Methodology 2019. PMID: 30871502
- Liau MYQ et al. Can propensity score matching replace randomized controlled trials? World Journal of Methodology 2024. PMID: 38577204
- Kallner A. Bayes' theorem, the ROC diagram and reference values: definition and use in clinical diagnosis. Biochemia Medica 2018. PMID: 29209139
- Christofilos SI et al. Network meta-analyses: methodological prerequisites and clinical usefulness. World Journal of Methodology 2022. PMID: 35721244
- Draak THP et al. The minimum clinically important difference: which direction to take. European Journal of Neurology 2019. PMID: 30793428
- Ilic D et al. Prostate cancer screening with prostate-specific antigen test: a systematic review and meta-analysis. BMJ 2018. PMID: 30185521
- Stacey D et al. Decision aids for people facing health treatment or screening decisions. Cochrane Database of Systematic Reviews 2024. PMID: 38284415
- Forsetlund L et al. Continuing education meetings and workshops: effects on professional practice and healthcare outcomes. Cochrane Database of Systematic Reviews 2021. PMID: 34523128
- Nguyen OT et al. Electronic health record nudges and health care quality and outcomes in primary care: a systematic review. JAMA Network Open 2024. PMID: 39287947