Diagnostiske tester: sensitivitet, spesifisitet og prediktive verdier

Sammendrag

Sensitivitet angir sannsynligheten for positiv test hos personer som har måltilstanden, mens spesifisitet angir sannsynligheten for negativ test hos personer som ikke har den. Positiv og negativ prediktiv verdi svarer på det kliniske spørsmålet: hvor sannsynlig er det at pasienten har, henholdsvis ikke har, tilstanden etter en positiv eller negativ test? Prediktive verdier påvirkes sterkt av pretestsannsynligheten. En positiv test kan derfor ha lav prediktiv verdi ved testing av en lavrisikopopulasjon, selv om sensitivitet og spesifisitet er høye [1,2].

Likelihood ratio er ofte mest nyttig for å overføre et testresultat til den enkelte pasient. Pretestodds multipliseres med testresultatets likelihood ratio for å gi posttestodds. Resultatet omregnes deretter til posttestsannsynlighet etter Bayes' teorem [3,4]. En test bør bare rekvireres dersom resultatet kan føre sannsynligheten over en terskel for behandling eller videre utredning, eller under en terskel der tilstanden kan avskrives.

Sensitivitet og spesifisitet er ikke uforanderlige laboratorieegenskaper. De varierer med valgt beslutningsgrense, sykdommens alvorlighetsgrad, pasientutvalg, klinisk setting, testutførelse og referansestandard. Resultater fra diagnostiske studier må derfor vurderes ut fra både risiko for bias og overførbarhet til egen populasjon. Sikker diagnostisk bruk krever at man vurderer hele paret sensitivitet og spesifisitet, konfidensintervallene, pasientpopulasjonen, referansestandarden, håndteringen av inkonklusive resultater og testens tiltenkte rolle.

Grunnleggende begreper

Måltilstand, indekstest og referansestandard

En diagnostisk nøyaktighetsstudie sammenligner en indekstest, den testen som evalueres, med en referansestandard, den metoden som brukes for å avgjøre om måltilstanden faktisk foreligger. Måltilstanden kan være en sykdom, et stadium, en anatomisk forandring eller en annen klinisk relevant tilstand.

Begrepet diagnostisk test omfatter mer enn laboratorieanalyser. Symptomer, kliniske funn, bildediagnostikk, histopatologi, mikrobiologi, fysiologiske undersøkelser, kliniske skåringssystemer og algoritmer kan alle evalueres som indekstest.

Testens tiltenkte rolle må defineres før nøyaktigheten tolkes:

  • Screeningtest: brukes hos personer uten kjent sykdom.
  • Triagetest: avgjør hvem som trenger en mer ressurskrevende eller invasiv test.
  • Tilleggstest: brukes etter eksisterende utredning for å forbedre klassifikasjonen.
  • Erstatningstest: er ment å erstatte en etablert test.
  • Bekreftende test: brukes først og fremst for å bekrefte en mistenkt diagnose.
  • Utelukkende test: brukes først og fremst for å senke sannsynligheten til et akseptabelt nivå.

Den kliniske rollen avgjør hvilke feil som er mest alvorlige. En triagetest som skal utelukke en farlig tilstand, trenger vanligvis svært høy sensitivitet, mens en test som fører til risikofylt behandling eller kirurgi, ofte trenger høy spesifisitet [5].

Firefeltstabellen

Når både indekstest og referansestandard klassifiseres som positive eller negative, oppstår fire mulige utfall.

Måltilstand foreligger Måltilstand foreligger ikke
Test positiv Sant positiv, SP Falskt positiv, FP
Test negativ Falskt negativ, FN Sant negativ, SN

Sensitivitet og spesifisitet beregnes vertikalt i tabellen, innenfor gruppene med og uten måltilstanden. Prediktive verdier beregnes horisontalt, innenfor gruppene med henholdsvis positiv og negativ test.

Sentrale mål og formler

Mål Formel Klinisk tolkning
Sensitivitet SP / (SP + FN) Andel av dem med tilstanden som tester positivt
Spesifisitet SN / (SN + FP) Andel av dem uten tilstanden som tester negativt
Falskt negativ andel FN / (SP + FN) 1 minus sensitivitet
Falskt positiv andel FP / (SN + FP) 1 minus spesifisitet
Positiv prediktiv verdi, PPV SP / (SP + FP) Sannsynlighet for tilstanden etter positiv test
Negativ prediktiv verdi, NPV SN / (SN + FN) Sannsynlighet for fravær av tilstanden etter negativ test
Positiv likelihood ratio, LR+ Sensitivitet / (1 minus spesifisitet) Hvor mye en positiv test øker oddsen
Negativ likelihood ratio, LR− (1 minus sensitivitet) / spesifisitet Hvor mye en negativ test reduserer oddsen
Total korrekt klassifikasjon (SP + SN) / alle Andel korrekt klassifiserte i den studerte populasjonen
Diagnostisk oddsratio LR+ / LR− Samlet diskriminasjonsmål, men skjuler balansen mellom sensitivitet og spesifisitet

Total korrekt klassifikasjon kan være misvisende. Dersom en tilstand forekommer hos 1 prosent av populasjonen, gir strategien å erklære alle friske 99 prosent korrekt klassifikasjon, til tross for at ikke ett eneste sykdomstilfelle identifiseres. Målet bør derfor ikke erstatte rapportering av sensitivitet og spesifisitet.

Sensitivitet og spesifisitet

Sensitivitet

Sensitiviteten er sannsynligheten for en positiv test gitt at måltilstanden foreligger:

Sensitivitet = P(test positiv | måltilstand foreligger)

En test med 95 prosent sensitivitet gir, i den studerte populasjonen og ved den aktuelle beslutningsgrensen, negativt resultat hos 5 prosent av personene med måltilstanden.

Høy sensitivitet er særlig viktig når:

  • en oversett tilstand kan forårsake alvorlig skade
  • effektiv tidlig behandling finnes
  • testen brukes som første triage før definitiv diagnostikk
  • et negativt resultat skal kunne avslutte eller forenkle utredningen.

Den kliniske konsekvensen av en negativ test avhenger likevel ikke bare av sensitiviteten. Spesifisiteten og pretestsannsynligheten påvirker LR− og dermed den gjenværende posttestsannsynligheten. Huskeregelen om at en negativ høysensitiv test utelukker sykdom, gjelder bare når sensitiviteten er tilstrekkelig høy i den aktuelle populasjonen, og når posttestsannsynligheten faktisk havner under den kliniske utelukkelsesterskelen [1,4].

Spesifisitet

Spesifisiteten er sannsynligheten for en negativ test gitt at måltilstanden ikke foreligger:

Spesifisitet = P(test negativ | måltilstand foreligger ikke)

En test med 90 prosent spesifisitet gir positivt resultat hos 10 prosent av personene uten måltilstanden.

Høy spesifisitet er særlig viktig når:

  • et positivt resultat fører til risikofylt eller kostbar behandling
  • diagnosen har store psykologiske, sosiale eller forsikringsmessige konsekvenser
  • testen brukes for å bekrefte en diagnose etter en sensitiv triagetest
  • falskt positive resultater fører til invasiv videre utredning.

En positiv høyspesifikk test kan gi sterk støtte for diagnosen, men bare dersom den positive likelihood ratio er tilstrekkelig stor og testen brukes i riktig klinisk sammenheng.

Sensitivitet og spesifisitet må rapporteres sammen

Sensitivitet og spesifisitet er et par. En test kan ikke vurderes ved å oppgi bare det ene målet. En laboratorietest med lav beslutningsgrense kan for eksempel ha høy sensitivitet, men lav spesifisitet. Dersom beslutningsgrensen heves, reduseres vanligvis sensitiviteten samtidig som spesifisiteten øker.

Det er derfor utilstrekkelig å beskrive en test som for eksempel 95 prosent korrekt uten å oppgi:

  • valgt beslutningsgrense
  • sensitivitet
  • spesifisitet
  • konfidensintervall
  • pasientpopulasjon
  • referansestandard
  • andel inkonklusive eller manglende resultater.

Diagnostiske mål er dessuten følsomme for studiedesignet. Studier som sammenligner tydelig syke pasienter med friske kontroller, gir ofte høyere nøyaktighet enn studier av konsekutive pasienter med realistisk diagnostisk usikkerhet [2,6].

Prediktive verdier og pretestsannsynlighet

Positiv prediktiv verdi

PPV er sannsynligheten for at måltilstanden foreligger etter en positiv test:

PPV = P(måltilstand foreligger | test positiv)

Dette må ikke forveksles med sensitivitet. Sensitiviteten tar utgangspunkt i personer som allerede er klassifisert som syke. PPV tar utgangspunkt i personer med en positiv test og spør hvor mange av dem som faktisk har tilstanden.

Negativ prediktiv verdi

NPV er sannsynligheten for at måltilstanden ikke foreligger etter en negativ test:

NPV = P(måltilstand foreligger ikke | test negativ)

Også dette er en omvendt betinget sannsynlighet sammenlignet med spesifisiteten. Høy spesifisitet innebærer ikke automatisk høy NPV.

Prevalens og klinisk sannsynlighet

Prediktive verdier avhenger av andelen personer med måltilstanden i den testede populasjonen. Når pretestsannsynligheten øker:

  • øker PPV
  • reduseres NPV.

Når pretestsannsynligheten reduseres:

  • reduseres PPV
  • øker NPV.

Prevalensen i en diagnostisk studie kan brukes som pretestsannsynlighet bare dersom studiepopulasjonen tilsvarer populasjonen der testen skal brukes. For den enkelte pasient bør pretestsannsynligheten baseres på relevant klinisk informasjon, som symptomer, kliniske funn, risikofaktorer, tidligere testresultater og omsorgsnivå [3].

Regneeksempel

Anta en test med:

  • sensitivitet 90 prosent
  • spesifisitet 90 prosent
  • pretestsannsynlighet 10 prosent
  • 1 000 testede personer.
Utfall Antall
Sant positive 90
Falskt negative 10
Sant negative 810
Falskt positive 90

PPV blir:

90 / (90 + 90) = 50 prosent

NPV blir:

810 / (810 + 10) = 98,8 prosent

Til tross for 90 prosent sensitivitet og 90 prosent spesifisitet har bare halvparten av personene med positiv test måltilstanden.

Dersom den samme testen brukes i en populasjon med 1 prosent pretestsannsynlighet, blir det blant 10 000 personer:

  • 90 sant positive
  • 10 falskt negative
  • 990 falskt positive
  • 8 910 sant negative.

PPV blir da:

90 / (90 + 990) = 8,3 prosent

Det positive resultatet er altså oftere falskt enn sant. Eksemplet viser hvorfor bred testing av lavrisikopersoner kan gi mange falskt positive funn selv når testens spesifisitet fremstår som høy.

Likelihood ratio og Bayes' teorem

Likelihood ratio

Likelihood ratio angir hvor mye mer sannsynlig et bestemt testresultat er hos en person med måltilstanden enn hos en person uten den.

For en binær test gjelder:

LR+ = sensitivitet / (1 minus spesifisitet)

LR− = (1 minus sensitivitet) / spesifisitet

LR+ skal være så stor som mulig. LR− skal være så nær null som mulig.

Likelihood ratio Typisk påvirkning av sannsynligheten
LR+ over 10 Stor økning
LR+ 5 til 10 Moderat økning
LR+ 2 til 5 Liten økning
LR+ nær 1 Minimal diagnostisk informasjon
LR− 0,5 til 1 Minimal eller liten reduksjon
LR− 0,2 til 0,5 Liten reduksjon
LR− 0,1 til 0,2 Moderat reduksjon
LR− under 0,1 Stor reduksjon

Grensene er pedagogiske tommelfingerregler, ikke universelle kliniske kriterier. Hvor stor endring som trengs, avhenger av utgangssannsynligheten og hvilke beslutninger testen skal styre.

Fra pretest til posttest

Bayes' teorem kan brukes i tre trinn:

  1. Omregn pretestsannsynlighet til pretestodds.
  2. Multipliser pretestodds med relevant likelihood ratio.
  3. Omregn posttestodds til posttestsannsynlighet.

Formler:

Pretestodds = pretestsannsynlighet / (1 minus pretestsannsynlighet)

Posttestodds = pretestodds × likelihood ratio

Posttestsannsynlighet = posttestodds / (1 + posttestodds)

For testen i det foregående eksemplet:

  • sensitivitet 0,90
  • spesifisitet 0,90
  • LR+ = 0,90 / 0,10 = 9
  • LR− = 0,10 / 0,90 = 0,11.

Ved 10 prosent pretestsannsynlighet er pretestodds 0,10 / 0,90 = 0,111.

Etter positiv test:

  • posttestodds = 0,111 × 9 = 1
  • posttestsannsynlighet = 1 / 2 = 50 prosent.

Etter negativ test:

  • posttestodds = 0,111 × 0,11 = 0,0123
  • posttestsannsynligheten blir cirka 1,2 prosent.

Resultatene tilsvarer PPV og komplementet til NPV i firefeltstabellen. Likelihood ratio er særlig praktisk fordi de samme testegenskapene kan kombineres med ulike pretestsannsynligheter [3,4].

Flernivåtester og intervallspesifikke likelihood ratios

Å dikotomisere kontinuerlige testresultater til positive eller negative fører til tap av informasjon. En verdi langt over beslutningsgrensen gir ofte større økning i sannsynlighet enn en verdi nær grensen. Tilsvarende kan en svært lav verdi redusere sannsynligheten mer enn et knapt negativt resultat.

Når data finnes, bør kontinuerlige eller ordinale tester deles inn i klinisk relevante intervaller, med en likelihood ratio for hvert intervall. Dette er ofte mer informativt enn én enkelt beslutningsgrense og anbefales ved kritisk rapportering av diagnostiske tester [4].

Flere tester etter hverandre

Ved sekvensiell testing blir posttestsannsynligheten etter den første testen pretestsannsynlighet før den neste. Likelihood ratios kan multipliseres bare dersom testresultatene er tilstrekkelig uavhengige gitt sykdomsstatus. Dersom to tester måler det samme biologiske fenomenet, kan feilene deres være korrelerte. En enkel multiplikasjon risikerer da å overdrive evidensen.

I praksis bør man:

  • oppdatere sannsynligheten etter hvert betydningsfullt resultat
  • vurdere om testene måler samme eller ulike fenomener
  • unngå å behandle flere nært beslektede funn som uavhengige bevis
  • bruke validerte diagnostiske algoritmer der slike finnes.

Beslutningsgrenser og ROC-kurver

Valg av beslutningsgrense

For en kontinuerlig test må det velges en grense for hva som skal regnes som positivt. Dersom høyere verdier taler for måltilstanden, fører en senket grense vanligvis til:

  • høyere sensitivitet
  • lavere spesifisitet
  • flere falskt positive resultater
  • færre falskt negative resultater.

En hevet grense gir motsatt effekt.

Den diagnostiske beslutningsgrensen er ikke nødvendigvis det samme som laboratoriets referanseintervall. Et referanseintervall beskriver vanligvis fordelingen i en referansepopulasjon. En klinisk beslutningsgrense velges for å skille mellom handlingsalternativer og må valideres for dette formålet [1].

ROC-kurven

En ROC-kurve viser sensitivitet på den vertikale aksen mot falskt positiv andel, det vil si 1 minus spesifisitet, på den horisontale aksen for alle mulige beslutningsgrenser [5].

Kurven kan brukes til å:

  • beskrive avveiningen mellom sensitivitet og spesifisitet
  • sammenligne testens diskriminasjon ved ulike grenser
  • identifisere mulige beslutningsgrenser
  • sammenligne tester, forutsatt at sammenligningen er korrekt utformet.

Arealet under ROC-kurven

AUC kan tolkes som sannsynligheten for at en tilfeldig valgt person med måltilstanden får en mer avvikende testverdi enn en tilfeldig valgt person uten tilstanden. En AUC på 0,5 tilsvarer ingen diskriminasjon, mens 1,0 tilsvarer perfekt rangering [5].

AUC har viktige begrensninger:

  • Den angir ikke sensitivitet eller spesifisitet ved den klinisk brukte grensen.
  • Den vekter deler av ROC-kurven som kan være klinisk irrelevante.
  • To tester kan ha samme AUC, men helt ulik ytelse i det relevante området.
  • AUC sier ikke noe direkte om kalibrering, prediktive verdier eller klinisk nytte.
  • En høy AUC garanterer ikke at det finnes en brukbar beslutningsterskel.

Studier av ROC-analyser har vist hyppige problemer med manglende konfidensintervaller, utilstrekkelige sammenligninger mellom tester og feilaktig analyse av parede data [6]. Beslutningsgrensen bør helst være forhåndsdefinert ut fra kliniske konsekvenser eller ekstern evidens. Dersom den velges i det samme datamaterialet for å maksimere for eksempel summen av sensitivitet og spesifisitet, blir resultatet optimistisk og krever ekstern validering [7].

Fra testegenskaper til klinisk beslutning

Testterskel og behandlingsterskel

Diagnostisk håndtering kan ses som tre sannsynlighetsområder:

  1. Under testterskelen er måltilstanden så usannsynlig at videre testing ikke er indisert.
  2. Mellom testterskelen og behandlingsterskelen kan en test endre håndteringen.
  3. Over behandlingsterskelen er sannsynligheten så høy at behandling eller annet målrettet tiltak kan være indisert uten ytterligere testing, forutsatt at risikoen ved tiltaket er akseptabel.

En test er mest verdifull når pretestsannsynligheten ligger mellom tersklene, og når et positivt eller negativt resultat kan flytte pasienten over en av dem.

flowchart TD
A["Vurder klinisk<br>pretestsannsynlighet"] --> B["Ligger sannsynligheten innenfor<br>et område der testen<br>kan endre håndteringen?"]
B -->|"Nei, svært lav"| C["Avstå fra testing<br>og vurder annen forklaring"]
B -->|"Nei, svært høy"| D["Vurder behandling eller<br>definitiv diagnostikk"]
B -->|"Ja"| E["Velg test ut fra klinisk rolle,<br>LR, risiko og tilgjengelighet"]
E --> F["Tolk resultatet med<br>Bayes' teorem"]
F --> G["Posttestsannsynlighet under<br>utelukkelsesterskelen"]
F --> H["Posttestsannsynlighet mellom<br>tersklene"]
F --> I["Posttestsannsynlighet over<br>tiltaksterskelen"]
G --> J["Avslutt eller endre retning<br>på utredningen"]
H --> K["Suppler med uavhengig<br>test eller oppfølging"]
I --> L["Bekreft ved behov og<br>start målrettet tiltak"]

Diagnostisk nøyaktighet er ikke det samme som klinisk nytte

En nøyaktig test forbedrer ikke automatisk pasientutfall. Nytten avhenger av:

  • om resultatet endrer kliniske beslutninger
  • om påfølgende behandling er effektiv
  • hvor raskt svaret foreligger
  • kostnader og ressursbehov
  • komplikasjoner ved prøvetaking eller videre utredning
  • konsekvenser av falskt positive og falskt negative resultater
  • pasientens verdier.

STARD 2015 understreker at diagnostiske studier skal angi testens tiltenkte bruk, kliniske rolle og mulige konsekvenser for pasientene [7,8]. Et konkret eksempel er hurtigtest ved sår hals. Randomiserte studier viste at testbasert håndtering reduserte andelen antibiotikaforskrivninger med cirka 25 prosentpoeng, men evidensen for komplikasjoner og andre pasientnære utfall var usikker [20]. Nøyaktighetsdata må altså suppleres med studier av hvordan testen påvirker behandlingsforløp og helse.

Beslutningskurveanalyse kan anslå nettogevinsten av en teststrategi ved ulike kliniske sannsynlighetsterskler. Metoden veier sant positive resultater mot falskt positive ut fra konsekvensene ved den valgte terskelen. Den kan vise at en modell med høyere AUC likevel har lavere klinisk nytte på grunn av mangelfull kalibrering eller uhensiktsmessige beslutninger [19].

Tolkning i ulike kliniske situasjoner

Screening og lav pretestsannsynlighet

Ved screening er de fleste som testes friske. Selv en liten falskt positiv andel kan derfor gi flere falskt positive enn sant positive resultater. Kravene til spesifisitet, bekreftende testing og tydelige oppfølgingsalgoritmer er høye.

Et screeningprogram skal ikke vurderes bare ut fra sensitivitet. Man må også ta hensyn til:

  • absolutt antall falskt positive
  • overdiagnostikk
  • invasive oppfølgingsundersøkelser
  • bekymring og sykdomsstempling
  • ressursforbruk
  • om tidligere diagnostikk forbedrer pasientrelevante utfall.

Akutt farlig tilstand

Ved mistanke om en akutt og farlig tilstand er kostnaden ved et falskt negativt resultat ofte høy. Teststrategien bør derfor prioritere lav LR−. Dersom pretestsannsynligheten er høy, kan en negativ test med moderat LR− være utilstrekkelig for å utelukke tilstanden.

En negativ test må ikke tolkes isolert dersom:

  • prøven ble tatt for tidlig eller for sent i sykdomsforløpet
  • prøvekvaliteten var mangelfull
  • behandlingen kan ha påvirket testen
  • pasienten tilhører en gruppe der sensitiviteten er lavere
  • testen ikke er validert for den aktuelle kliniske presentasjonen.

Bekreftende diagnostikk

Når en positiv test fører til betydelig behandling, kirurgi eller langvarig diagnose, kreves det ofte høy LR+. Noen ganger trengs en ny, metodologisk uavhengig test for å redusere risikoen for at den samme feilkilden forårsaker begge resultatene.

Bildediagnostikk

Bildediagnostiske studier er særlig følsomme for:

  • undersøkerens erfaring
  • teknisk utstyr og protokoller
  • kjennskap til kliniske opplysninger
  • kjennskap til andre bilderesultater
  • uklare eller flere beslutningsgrenser
  • verifikasjon hovedsakelig av testpositive pasienter.

Testens kliniske rolle må angis. En metode kan være tilstrekkelig spesifikk til å lokalisere en forandring før kirurgi, men utilstrekkelig sensitiv til å utelukke sykdommen. I en Cochrane-oversikt over bildediagnostikk ved endometriose varierte nøyaktigheten med anatomisk lokalisasjon og klinisk rolle. Ingen undersøkelsesmetode kunne pålitelig erstatte kirurgisk diagnostikk for all bekkenendometriose, til tross for god ytelse for enkelte avgrensede lesjoner [21].

Kritisk vurdering av diagnostiske studier

Pasientutvalg

Det mest overførbare designet omfatter vanligvis konsekutive eller tilfeldig utvalgte pasienter som i klinisk praksis ville blitt vurdert for testen. En kasus-kontroll-studie der pasienter med avansert, sikker sykdom sammenlignes med friske kontroller, skaper et unaturlig bredt spektrum. Slike studier risikerer å overestimere både sensitivitet og spesifisitet.

Vurder:

  • inklusjons- og eksklusjonskriterier
  • omsorgsnivå og henvisningsveier
  • tidligere testing
  • sykdommens stadium og alvorlighetsgrad
  • relevante differensialdiagnoser i gruppen uten måltilstanden
  • om rekrutteringen var konsekutiv, tilfeldig eller basert på bekvemmelighetsutvalg.

Empiriske metodeoversikter har identifisert variasjon i demografi, sykdomsprevalens, alvorlighetsgrad, verifikasjon, observatør og instrument som viktige årsaker til varierende nøyaktighetsresultater [9,11].

Referansestandard

Referansestandarden trenger ikke være perfekt, men den må klassifisere måltilstanden tilstrekkelig korrekt og uavhengig av indekstesten. En mangelfull referansestandard kan få en god indekstest til å fremstå som dårligere, eller omvendt.

Risikoene omfatter:

  • Inkorporeringsbias: indekstesten inngår i referansediagnosen.
  • Granskingsbias: den som tolker referansestandarden, kjenner til indekstesten.
  • Differensiell verifikasjon: ulike referansestandarder brukes avhengig av indekstestens resultat.
  • Partiell verifikasjon: bare enkelte pasienter, ofte de testpositive, gjennomgår referansestandarden.
  • Endring over tid: måltilstanden endrer seg mellom indekstest og referansestandard.

Dersom ingen akseptert referansestandard finnes, kan man bruke sammensatte kriterier, ekspertpanel, longitudinell oppfølging eller statistiske latente klassemodeller. Hver metode krever eksplisitte antakelser og kan gi ulike resultater [12]. Latente klassemodeller behandler den reelle sykdomsstatusen som en ikke-observert variabel, men resultatene kan være sterkt avhengige av antakelser om testenes innbyrdes avhengighet og om nøyaktigheten er konstant mellom populasjoner [13].

Blinding og tilgjengelig klinisk informasjon

Indekstest og referansestandard bør om mulig tolkes uten kjennskap til hverandres resultater. Samtidig må studien etterligne tiltenkt klinisk bruk. Dersom en radiolog normalt har tilgang til symptomer, tidligere bilder og laboratorieverdier, kan fullstendig blinding gi et mindre realistisk estimat.

Studien skal derfor tydelig angi:

  • hvilken informasjon testtolkeren hadde
  • hvilken informasjon referansebedømmeren hadde
  • om beslutningsgrensene var forhåndsdefinerte
  • tolkerens utdanning og erfaring
  • hvordan uenighet mellom bedømmere ble håndtert.

Flyt, tidsintervall og frafall

Alle inkluderte pasienter bør gjøres rede for. Særlig oppmerksomhet kreves når:

  • referansestandard mangler hos mange deltakere
  • frafallet er ulikt mellom testpositive og testnegative
  • behandlingen ble startet før verifikasjon
  • et langt intervall gjør at tilstanden kan endre seg
  • inkonklusive resultater ekskluderes fra analysen.

Å ekskludere teknisk mislykkede eller vanskelig tolkbare resultater kan gi et overdrevent positivt bilde av testens praktiske ytelse. Andelen slike resultater og den kliniske håndteringen av dem bør rapporteres separat.

QUADAS-2 og STARD

QUADAS-2 vurderer diagnostiske studier innenfor fire domener:

  1. pasientutvalg
  2. indekstest
  3. referansestandard
  4. pasientflyt og tidsforhold.

De tre første vurderes også med hensyn til overførbarhet [10]. STARD 2015 er en rapporteringsretningslinje med 30 sentrale punkter for transparent rapportering av diagnostiske nøyaktighetsstudier [8]. STARD er ikke et kvalitetsstempel, men manglende opplysninger gjør det vanskelig å vurdere bias.

Ved direkte sammenligninger mellom to tester er det best om begge testene utføres på de samme pasientene, eller om pasientene randomiseres mellom teststrategier. Forskjeller mellom separate studier kan ellers skyldes populasjon og gjennomføring snarere enn testene. QUADAS-C supplerer QUADAS-2 for slike sammenligninger [18].

Statistisk usikkerhet og metaanalyse

Konfidensintervall

Alle diagnostiske mål er utvalgsestimater og skal rapporteres med konfidensintervall. Presisjonen for sensitivitet bestemmes først og fremst av antall personer med måltilstanden, mens presisjonen for spesifisitet bestemmes av antall personer uten tilstanden.

Et resultat med 100 prosent sensitivitet i en studie med ti syke pasienter er svært usikkert. Null observerte falskt negative resultater beviser ikke at den sanne sensitiviteten er 100 prosent.

Diagnostiske studier er ofte for små. I en kartlegging av 43 studier var medianen 49 deltakere med måltilstanden, og bare 5 prosent rapporterte en forhåndsberegning av utvalgsstørrelse [14]. I en senere gjennomgang av 89 studier av depresjonsinstrumenter rapporterte bare 3 prosent en brukbar utvalgsberegning, og bare 8 prosent hadde et konfidensintervall for sensitiviteten med en bredde på høyst 10 prosentpoeng [15].

Utvalgsstørrelsen bør planlegges ut fra:

  • laveste akseptable sensitivitet og spesifisitet
  • ønsket bredde på konfidensintervallene
  • forventet prevalens
  • andel inkonklusive resultater og frafall
  • planlagte subgruppeanalyser
  • om flere tester skal sammenlignes [16].

Metaanalyse av diagnostisk nøyaktighet

Sensitivitet og spesifisitet er korrelerte, særlig når studier bruker ulike beslutningsgrenser. De bør derfor ikke metaanalyseres som helt uavhengige utfall. Anbefalte modeller omfatter bivariat modell og hierarkisk sammenfattende ROC-modell. Disse tar hensyn til både variasjon innen studier, variasjon mellom studier og sammenhengen mellom sensitivitet og spesifisitet [17].

Et sammenveid tall skal ikke tolkes uten å vurdere:

  • forskjeller i pasientpopulasjon
  • beslutningsgrenser
  • prøvetaking og analyseteknikk
  • referansestandard
  • behandlingssetting
  • studienes risiko for bias
  • prediksjonsintervall og heterogenitet.

Prediktive verdier bør vanligvis ikke overføres direkte fra en metaanalyse til en lokal populasjon. De kan i stedet beregnes ut fra sammenveid sensitivitet, spesifisitet og en relevant lokal pretestsannsynlighet.

Praktisk sjekkliste

Når et diagnostisk testresultat skal vurderes, kontroller følgende:

  1. Hvilken måltilstand gjelder det? Definisjonen må være klinisk relevant.
  2. Hva er testens rolle? Screening, triage, tillegg, erstatning eller bekreftelse.
  3. Hva er pretestsannsynligheten? Ta utgangspunkt i pasient, omsorgsnivå og tidligere informasjon.
  4. Hvilken beslutningsgrense brukes? Kontroller at den tilsvarer studiens og laboratoriets validering.
  5. Hva er sensitivitet og spesifisitet? Les dem som et par.
  6. Hva er LR+ og LR−? Bruk relevant likelihood ratio for å oppdatere sannsynligheten.
  7. Hvor presist er resultatet? Vurder konfidensintervall og antall personer med og uten måltilstanden.
  8. Ligner studiepopulasjonen pasienten? Ta hensyn til alder, stadium, komorbiditet, symptomer og tidligere testing.
  9. Er referansestandarden troverdig? Se etter partiell, differensiell eller inkorporert verifikasjon.
  10. Hvordan ble inkonklusive resultater og frafall håndtert? Eksklusjon kan overestimere testens ytelse.
  11. Endrer posttestsannsynligheten håndteringen? Hvis ikke, var testen sannsynligvis ikke indisert.
  12. Er teststrategien klinisk nyttig? Nøyaktighet, kostnad, risiko og pasientutfall må veies sammen.

Kilder

  1. Habibzadeh F. Diagnostic tests performance indices: an overview. Biochemia Medica 2025. PMID: 39974192
  2. Eusebi P. Diagnostic accuracy measures. Cerebrovascular Diseases 2013. PMID: 24135733
  3. Bours MJ. Bayes' rule in diagnosis. Journal of Clinical Epidemiology 2021. PMID: 33741123
  4. Fischer JE, Bachmann LM, Jaeschke R. A readers' guide to the interpretation of diagnostic test properties: clinical example of sepsis. Intensive Care Medicine 2003. PMID: 12734652
  5. Hajian-Tilaki K. Receiver Operating Characteristic (ROC) Curve Analysis for Medical Diagnostic Test Evaluation. Caspian Journal of Internal Medicine 2013. PMID: 24009950
  6. Obuchowski NA, Lieber ML, Wians FH Jr. ROC curves in clinical chemistry: uses, misuses, and possible solutions. Clinical Chemistry 2004. PMID: 15142978
  7. Cohen JF, Korevaar DA, Altman DG et al. STARD 2015 guidelines for reporting diagnostic accuracy studies: explanation and elaboration. BMJ Open 2016. PMID: 28137831
  8. Bossuyt PM, Reitsma JB, Bruns DE et al. STARD 2015: an updated list of essential items for reporting diagnostic accuracy studies. BMJ 2015. PMID: 26511519
  9. Whiting P, Rutjes AW, Reitsma JB et al. Sources of variation and bias in studies of diagnostic accuracy: a systematic review. Annals of Internal Medicine 2004. PMID: 14757617
  10. Whiting PF, Rutjes AW, Westwood ME et al. QUADAS-2: a revised tool for the quality assessment of diagnostic accuracy studies. Annals of Internal Medicine 2011. PMID: 22007046
  11. Whiting P, Rutjes AW, Dinnes J et al. Development and validation of methods for assessing the quality of diagnostic accuracy studies. Health Technology Assessment 2004. PMID: 15193208
  12. Rutjes AW, Reitsma JB, Coomarasamy A et al. Evaluation of diagnostic tests when there is no gold standard. A review of methods. Health Technology Assessment 2007. PMID: 18021577
  13. Collins J, Huynh M. Estimation of diagnostic test accuracy without full verification: a review of latent class methods. Statistics in Medicine 2014. PMID: 24910172
  14. Bachmann LM, Puhan MA, ter Riet G et al. Sample sizes of studies on diagnostic accuracy: literature survey. BMJ 2006. PMID: 16627488
  15. Thombs BD, Rice DB. Sample sizes and precision of estimates of sensitivity and specificity from primary studies on the diagnostic accuracy of depression screening tools: a survey of recently published studies. International Journal of Methods in Psychiatric Research 2016. PMID: 27060912
  16. Hajian-Tilaki K. Sample size estimation in diagnostic test studies of biomedical informatics. Journal of Biomedical Informatics 2014. PMID: 24582925
  17. Ma X, Nie L, Cole SR et al. Statistical methods for multivariate meta-analysis of diagnostic tests: an overview and tutorial. Statistical Methods in Medical Research 2016. PMID: 23804970
  18. Yang B, Mallett S, Takwoingi Y et al. QUADAS-C: A Tool for Assessing Risk of Bias in Comparative Diagnostic Accuracy Studies. Annals of Internal Medicine 2021. PMID: 34698503
  19. Van Calster B, Wynants L, Verbeek JFM et al. Reporting and Interpreting Decision Curve Analysis: A Guide for Investigators. European Urology 2018. PMID: 30241973
  20. Cohen JF, Pauchard JY, Hjelm N et al. Efficacy and safety of rapid tests to guide antibiotic prescriptions for sore throat. Cochrane Database of Systematic Reviews 2020. PMID: 32497279
  21. Nisenblat V, Bossuyt PM, Farquhar C et al. Imaging modalities for the non-invasive diagnosis of endometriosis. Cochrane Database of Systematic Reviews 2016. PMID: 26919512

Oppdatert 29. september 2026