Hoeveel respondenten heb je nodig voor je scriptie? Steekproefomvang en poweranalyse

Er bestaat geen vast aantal. De minimale steekproefomvang volgt uit vier keuzes: welke effectgrootte je wilt kunnen aantonen, welk onbetrouwbaarheidsniveau je hanteert, welk onderscheidend vermogen je wilt, en welke toets je gaat uitvoeren. Wie die vier invult, krijgt één getal terug. Wie ze niet invult, gokt — en dat merkt je tweede lezer.

Hieronder de berekening in twee varianten: de poweranalyse voor toetsend onderzoek en de formule voor het schatten van een percentage. Plus de alinea die je erover in je methodehoofdstuk zet.

Waarom kan niemand je één getal geven?

Omdat “genoeg” geen eigenschap is van een aantal, maar van een aantal in combinatie met een vraag. Honderd respondenten zijn ruim voldoende om een groot verschil tussen twee groepen aan te tonen en volstrekt onvoldoende voor een regressiemodel met zes voorspellers.

Er is bovendien geen landelijke norm. De wet zegt niets over steekproefomvang in een scriptie, en opleidingen leggen zelden een getal vast. Wat je wél tegenkomt zijn faculteitsgewoontes — en die zijn een slechtere verantwoording dan een berekening, omdat een gewoonte geen argument is.

Of je überhaupt een steekproef in aantallen nodig hebt, hangt eerst af van je methode. Die keuze zelf behandelen we in het stuk over hoe je kiest tussen een enquête en een interview; dit artikel begint pas nadat die knoop is doorgehakt in het voordeel van kwantitatief werk.

Welke vier knoppen bepalen het antwoord?

Vier parameters die samen één vereiste steekproefomvang opleveren
Vier instellingen erin, één getal eruit. Zolang je er drie invult en de vierde openlaat, bestaat het antwoord niet.
Knop Wat het betekent Gangbare keuze Effect op N
Onbetrouwbaarheidsdrempel α Kans dat je een effect aantoont dat er niet is 0,05 Lagere α → grotere N
Onderscheidend vermogen (power, 1 − β) Kans dat je een bestaand effect ook vindt 0,80 Hogere power → grotere N
Effectgrootte Hoe groot het verschil of verband is dat je wilt kunnen zien Uit eerder onderzoek, niet verzonnen Kleiner effect → veel grotere N
Type toets Twee groepen, variantieanalyse, correlatie, regressie Volgt uit je hoofdvraag Meer voorspellers → grotere N

De waarden 0,05 en 0,80 zijn conventies, geen natuurwetten. Schrijf dat er ook zo bij: “conform de gangbare conventie” is een correcte formulering, “zoals voorgeschreven” niet.

De lastigste knop is de effectgrootte, want die verzin je niet. Je haalt hem uit eerder onderzoek naar hetzelfde of een verwant verschijnsel, of uit een eigen pilot. Pas als er echt geen aanknopingspunt is, val je terug op de conventionele waarde voor een middelgroot effect — met in de tekst de expliciete mededeling dát je dat doet. Cohen beschreef die conventies in A power primer (“Psychological Bulletin” 112(1), p. 155–159, DOI: 10.1037/0033-2909.112.1.155), en zijn eigen waarschuwing hoort erbij: het zijn vuistregels voor het geval er niets beters is.

Hoe reken je het uit in G*Power?

G*Power is gratis software voor poweranalyse van de Heinrich-Heine-Universität Düsseldorf, beschikbaar voor Windows en macOS. Het is het programma dat in Nederlandse scripties in psychologie, gezondheidszorg, onderwijskunde en bedrijfskunde het vaakst wordt aangehaald.

  1. Kies de toetsfamilie (Test family): t-toetsen, F-toetsen, exacte toetsen — passend bij je geplande analyse.
  2. Kies de specifieke toets (Statistical test): twee onafhankelijke groepen, variantieanalyse, correlatie, meervoudige regressie.
  3. Zet het analysetype op A priori: Compute required sample size. Dit is de stap die telt. Een post-hocanalyse berekent de power ná dataverzameling en beantwoordt een andere vraag.
  4. Vul de parameters in: effectgrootte, α, power, en bij groepsvergelijkingen de verhouding tussen de groepsgroottes.
  5. Klik Calculate en lees Total sample size af.

Maak meteen ook de grafiek van power tegen steekproefomvang die het programma kan genereren. Eén afbeelding in je bijlage laat zien dat je het onderzoek hebt gepland in plaats van uitgevoerd en achteraf verantwoord.

Citeer het programma via het bronartikel: Faul, F., Erdfelder, E., Lang, A.-G. & Buchner, A. (2007). G*Power 3: A flexible statistical power analysis program for the social, behavioral, and biomedical sciences. “Behavior Research Methods”, 39(2), 175–191, DOI: 10.3758/BF03193146. Voor correlatie- en regressietoetsen hoort daar de aanvulling uit 2009 bij, DOI: 10.3758/BRM.41.4.1149.

En als je alleen een percentage wilt schatten?

Toets je geen hypothese maar schat je een aandeel — bijvoorbeeld welk deel van de studenten van jouw opleiding de bibliotheek gebruikt — dan heb je geen poweranalyse nodig, maar de formule voor steekproefomvang bij een proportie. Daar gaan drie dingen in: het betrouwbaarheidsniveau (meestal 95%), de maximale foutmarge die je accepteert, en de omvang van de populatie.

Drie eigenschappen van die formule zijn de moeite waard vóórdat je gaat rekenen.

De foutmarge daalt met de wortel van N. Halveren van de marge vereist een viermaal zo grote steekproef. Van 400 naar 800 respondenten levert daarom veel minder op dan het gevoel zegt.

Populatiegrootte doet er boven een bepaald punt nauwelijks meer toe. De steekproef die je nodig hebt voor één faculteit en die voor heel Nederland liggen dichter bij elkaar dan iedereen verwacht. Dat volgt rechtstreeks uit de formule.

50% is de veiligste aanname. Bij het schatten van een aandeel geeft de aanname dat de uitkomst rond de helft ligt de grootste vereiste steekproef. Weet je niets vooraf, neem die en noem het conservatief.

Hoeveel mensen moet je uitnodigen om die N te halen?

Van uitnodigingen via geopende en gestarte lijsten naar bruikbare complete antwoorden
Je berekende N staat onderaan de trechter, niet bovenaan. Het aantal uitnodigingen is een planningsgetal en hoort niet in je verantwoording van de steekproefomvang.

Dit is de rekenfout die het vaakst tot paniek in week zeven leidt. Je berekende N is het aantal bruikbare, complete waarnemingen. Daarboven zitten mensen die de uitnodiging niet openen, mensen die beginnen en afhaken, en ingevulde lijsten die je moet verwijderen wegens onvolledigheid of doorklikgedrag.

Reken daarom altijd terug vanaf je N en plan ruimte voor uitval in, in plaats van te hopen dat het meevalt. Welke uitvalpercentages realistisch zijn, hangt volledig af van je kanaal — een lijst die via de opleiding wordt verspreid gedraagt zich anders dan een link in een appgroep. Instellingen die die uitval beperken, zoals verplichte vragen en een voortgangsbalk, staan per tool in onze vergelijking van enquêtetools.

Wat accepteert je begeleider eigenlijk?

Eerlijk antwoord: dat verschilt, en je kunt het uitzoeken in twintig minuten. Vraag het expliciet in hetzelfde gesprek waarin je je methode voorlegt, en kijk daarnaast in afgestudeerde scripties van jouw opleiding als die in de repository staan — daar zie je de feitelijke norm in plaats van het gerucht.

Wat in elk gesprek werkt: een berekend getal is een sterker argument dan een gebruikelijk getal. “De minimaal vereiste omvang bedroeg N bij een middelgroot effect, power 0,80 en α = 0,05” sluit een discussie die “ik heb 100 enquêtes, want dat doet iedereen” juist opent.

Hoe schrijf je de verantwoording in je methodehoofdstuk?

Eén alinea, vier elementen: de gebruikte methode, de ingevulde parameters, het resultaat en de vergelijking met wat je feitelijk hebt gehaald.

De minimaal vereiste steekproefomvang is vooraf bepaald met G*Power 3.1 door middel van een a-priori-poweranalyse voor [toets], met een onbetrouwbaarheidsdrempel van α = 0,05, een onderscheidend vermogen van 0,80 en een effectgrootte van [waarde], ontleend aan [bron: onderzoek X / eigen pilot / conventie voor een middelgroot effect]. Dit resulteerde in een vereiste omvang van N = [getal]. Uiteindelijk zijn [getal] bruikbare responses verzameld, waarmee dit criterium [wel / niet] is gehaald; de consequenties hiervan zijn beschreven in de paragraaf over beperkingen.

Die laatste zinsnede is het belangrijkste deel en wordt het vaakst weggelaten. Heb je minder gehaald dan de berekening vroeg, schrijf dat op en trek de conclusie erbij: een niet-significant resultaat kan dan ook aan te weinig onderscheidend vermogen liggen in plaats van aan de afwezigheid van een effect. Dat is een sterkere scriptie, niet een zwakkere. De hoofdvraag waar dit allemaal aan opgehangen wordt, formuleer je zoals beschreven in het stappenplan voor de probleemstelling en de deelvragen.

En als je interviews doet?

Dan bereken je niets. Bij kwalitatief onderzoek verantwoord je het aantal met verzadiging: het moment waarop nieuwe gesprekken geen nieuwe categorieën meer opleveren. Dat is een andere procedure met een andere onderbouwing, en je mag de twee logica’s niet door elkaar halen in één scriptie. Doe je mixed methods, dan verantwoord je beide delen apart, elk in de eigen conventie.

Wat zijn de vier meest gemaakte fouten?

  • Power achteraf berekenen. Een post-hocanalyse op basis van het gevonden effect voegt geen informatie toe en wordt als verantwoording bekritiseerd. Reken vooraf.
  • Uitgestuurde lijsten tellen als steekproef. Alleen complete, bruikbare responses tellen mee in N.
  • Een N uit een ander onderzoek overnemen. Dat getal hoort bij een andere toets, een andere effectgrootte en een andere populatie.
  • Grootte verwarren met kwaliteit. Duizend respondenten via je eigen netwerk zijn niet beter dan tweehonderd via een aselecte trekking; de manier van trekken bepaalt wat je mag concluderen.

Beperkingen van dit overzicht

De genoemde conventies (α = 0,05 en power 0,80) zijn gangbaar in de sociale en gezondheidswetenschappen en niet universeel; in sommige vakgebieden gelden strengere eisen. We geven bewust geen tabel met kant-en-klare aantallen per toets, omdat elke zo’n tabel een effectgrootte veronderstelt — en dat is precies de keuze die uit jouw literatuur moet komen. Er is ook geen landelijk minimum voor scripties; alle drempels die je hoort zijn opleidingsgewoontes en horen bij je begeleider en in de scriptiehandleiding te worden nagevraagd. Welk programma je vervolgens voor de analyse zelf gebruikt, vergelijken we in het overzicht van statistiekprogramma’s voor je scriptie.

Heb je je N eenmaal binnen, dan begint het echte werk: de cijfers omzetten in een hoofdstuk waarin elke uitspraak terug te voeren is op een tabel. Tesify bewaakt de structuur van je hoofdstukken en houdt terminologie en notatie consistent terwijl je dat doet. Werk je empirische deel uit in Tesify.

Veelgestelde vragen

Hoeveel respondenten heb je nodig voor een scriptie?

Dat volgt uit een berekening, niet uit een norm. Voor toetsend onderzoek doe je een a-priori-poweranalyse met effectgrootte, α en power; voor het schatten van een percentage gebruik je de formule met betrouwbaarheidsniveau, foutmarge en populatiegrootte.

Is 100 respondenten genoeg voor een bachelorscriptie?

Soms ruim, soms veel te weinig. Bij een groot verwacht effect en een vergelijking van twee groepen kan het volstaan; bij een klein effect of een regressie met meerdere voorspellers niet. Reken het uit in plaats van te schatten.

Wat is het verschil tussen een a-priori- en een post-hocanalyse?

Een a-priori-analyse berekent de vereiste steekproefomvang vóór de dataverzameling bij een gekozen power. Een post-hocanalyse berekent de power achteraf op basis van de gevonden data en vervangt de planning niet.

Waar haal je de effectgrootte vandaan?

In deze volgorde: uit eerder onderzoek naar hetzelfde verschijnsel, uit onderzoek naar een verwant verschijnsel, uit een eigen pilot, en pas als laatste uit de conventie voor een middelgroot effect — met vermelding dat je die keuze hebt gemaakt.

Is G*Power gratis?

Ja, het programma wordt kosteloos aangeboden door de Heinrich-Heine-Universität Düsseldorf, in versies voor Windows en macOS.

Telt een half ingevulde vragenlijst mee?

Niet in je N. Beslis vóór de dataverzameling welke mate van onvolledigheid je uitsluit en beschrijf dat criterium in je methodehoofdstuk, zodat het geen keuze achteraf is.

Beïnvloedt de grootte van de populatie de vereiste steekproef?

Bij kleine populaties duidelijk, bij grote nauwelijks. Daardoor liggen de vereiste aantallen voor één opleiding en voor een heel land verrassend dicht bij elkaar.

Wat doe je als je de berekende N niet haalt?

Vermeld het expliciet in de beperkingen: de vereiste N, de behaalde N en de consequentie, namelijk een lager onderscheidend vermogen. Dat is correcte onderzoekspraktijk.

Hoeveel interviews heb je nodig?

Bij kwalitatief onderzoek reken je geen omvang uit maar verantwoord je verzadiging: het punt waarop nieuwe gesprekken geen nieuwe categorieën meer opleveren.

Moet je het programma waarin je hebt gerekend citeren?

Ja, dat is standaard in empirisch werk. Voor G*Power citeer je het bronartikel van Faul en collega’s, bij voorkeur met DOI.