Drie vragen bepalen je toets: wat is het meetniveau van je afhankelijke variabele, hoeveel groepen of condities vergelijk je, en zijn je metingen gepaard of onafhankelijk? Bij een continue uitkomst en twee onafhankelijke groepen is dat een onafhankelijke t-toets, bij drie of meer groepen een eenweg-ANOVA, en bij twee metingen binnen dezelfde personen een gepaarde t-toets.
De rest van dit artikel loopt die drie vragen langs, laat zien welke toetsen in Nederlandse psychologiescripties het vaakst voorkomen, en behandelt de assumpties waar tweede lezers standaard naar kijken. Elke sectie is los te lezen, dus je kunt direct naar je eigen situatie springen.
Waarom bepaalt je onderzoeksvraag de toets, en niet je data?
Studenten openen SPSS, kijken naar hun dataset en gaan dan zoeken welke toets iets significants oplevert. Dat is de verkeerde volgorde en het is bovendien zichtbaar in je verslag: je hypothesen sluiten dan niet aan op je analyses. De toets volgt uit de hypothese die je in je theoretisch kader hebt geformuleerd.
Concreet: een hypothese die zegt dat groep A hoger scoort dan groep B vraagt om een verschiltoets. Een hypothese die zegt dat meer piekeren samengaat met meer slaapproblemen vraagt om een samenhangstoets. Een hypothese die zegt dat het effect van stress op prestatie sterker is bij lage sociale steun vraagt om een moderatieanalyse. Kun je je hypothese niet in een van die drie vormen zetten, dan is je hypothese het probleem, niet je statistiek. Dan is het de moeite waard om terug te gaan naar je probleemstelling en deelvragen voordat je verder analyseert.
Wat is het meetniveau van je afhankelijke variabele?
Dit is de eerste splitsing in elke beslisboom.
- Nominaal (wel of geen diagnose, welke behandelvoorkeur): je zit in de wereld van de chi-kwadraattoets en logistische regressie.
- Ordinaal (een rangorde, een enkel Likert-item): strikt genomen non-parametrische toetsen zoals Mann-Whitney of Spearman.
- Interval of ratio (een somscore van een vragenlijst, een reactietijd, een testscore): t-toetsen, ANOVA, correlatie en lineaire regressie.
De klassieke twijfelvraag in de psychologie is wat je met Likert-schalen doet. Een enkel item is ordinaal. Een somscore of gemiddelde over meerdere items van een gevalideerde schaal wordt in de psychologische literatuur vrijwel altijd als continu behandeld, en dat is verdedigbaar zolang de schaal genoeg items heeft en de verdeling niet extreem scheef is. Schrijf die keuze expliciet op in je methodologie in plaats van hem stilzwijgend te maken.
Hoeveel groepen vergelijk je, en zijn ze gepaard?
Bij een continue afhankelijke variabele geldt dit schema.
| Situatie | Parametrische toets | Non-parametrisch alternatief |
|---|---|---|
| Een groep vergeleken met een norm | Eensteekproef-t-toets | Wilcoxon signed-rank |
| Twee onafhankelijke groepen | Onafhankelijke t-toets | Mann-Whitney U |
| Twee metingen, dezelfde personen | Gepaarde t-toets | Wilcoxon signed-rank |
| Drie of meer onafhankelijke groepen | Eenweg-ANOVA | Kruskal-Wallis |
| Drie of meer metingen, dezelfde personen | Repeated measures ANOVA | Friedman |
| Twee factoren tegelijk | Tweeweg-ANOVA | Geen eenvoudig equivalent |
| Groepen met een storende variabele erbij | ANCOVA | Geen eenvoudig equivalent |
Gepaard betekent dat dezelfde persoon meerdere keren voorkomt in je data: een voormeting en een nameting, of twee condities die iedereen doorloopt. Behandel je gepaarde data als onafhankelijk, dan overschat je de foutenvariantie en mis je effecten die er wel zijn. Dat is een van de weinige statistische fouten die je scriptie inhoudelijk ongeldig maakt.
Welke toets gebruik je bij samenhang in plaats van verschil?
Bij twee continue variabelen gebruik je de Pearson-correlatie, en bij ordinale data of duidelijke schending van normaliteit de Spearman-rangcorrelatie. Wil je een uitkomst voorspellen uit meerdere variabelen tegelijk, dan is meervoudige lineaire regressie de standaard in psychologiescripties. Is je uitkomst dichotoom, bijvoorbeeld wel of geen terugval, dan is het logistische regressie.
Twee analyses die in bachelorscripties Psychologie steeds vaker opduiken, verdienen een waarschuwing. Moderatie test je met een interactieterm in een regressiemodel, waarbij je je predictoren centreert. Mediatie test je met bootstrapping, tegenwoordig meestal via de PROCESS-macro. Beide vragen aanzienlijk meer respondenten dan een simpele groepsvergelijking, dus check dit voordat je je dataverzameling afsluit, niet erna. Reken vooraf uit hoeveel respondenten je nodig hebt met een poweranalyse waarin je uitgaat van het model dat je daadwerkelijk gaat toetsen.
Welke toets hoort bij welk type psychologiescriptie?
De vier onderzoeksopzetten die in Nederlandse psychologiescripties veruit het vaakst voorkomen, leiden vrijwel altijd tot dezelfde analyses.
- Cross-sectionele vragenlijststudie waarin je verbanden tussen een aantal schalen onderzoekt: correlatiematrix als beschrijvende basis, daarna meervoudige lineaire regressie voor je hoofdhypothese.
- Groepsvergelijking tussen bijvoorbeeld studenten en werkenden, of tussen een klinische en een controlegroep: onafhankelijke t-toets bij twee groepen, eenweg-ANOVA met post-hoc-vergelijkingen bij drie of meer.
- Interventie- of trainingsonderzoek met voor- en nameting: gemengde ANOVA met tijd als binnen-proefpersoonfactor en conditie als tussen-proefpersoonfactor, of ANCOVA met de voormeting als covariaat.
- Experiment met manipulatie, bijvoorbeeld twee versies van een instructie: tweeweg-ANOVA als je een tweede factor hebt, plus een manipulatiecheck die je apart toetst en rapporteert.
Herken je je opzet hierin, dan is je analyseplan grotendeels bepaald en kun je je energie steken in de assumpties en de rapportage. Herken je hem niet, dan is dat een goede vraag om aan je begeleider voor te leggen voordat je gaat verzamelen.
Welke assumpties moet je controleren en rapporteren?
Elke parametrische toets heeft voorwaarden. Je hoeft ze niet allemaal uitgebreid te bespreken, maar je moet laten zien dat je ze hebt gecontroleerd.
Normaliteit
Voor t-toetsen en ANOVA gaat het om de verdeling van de residuen, niet van de ruwe variabele. Beoordeel dit met een histogram en een Q-Q-plot, en gebruik Shapiro-Wilk hooguit als aanvulling. Bij grotere steekproeven wordt Shapiro-Wilk namelijk significant bij afwijkingen die praktisch niet uitmaken. Blijkt je verdeling echt problematisch, lees dan wat je doet als je data niet normaal verdeeld zijn voordat je automatisch overstapt op een non-parametrische toets.
Homogeniteit van varianties
Levene’s test hoort standaard bij je t-toets en ANOVA. Is die significant, dan rapporteer je bij een t-toets de Welch-variant. SPSS geeft die regel automatisch, maar studenten kopieren stelselmatig de verkeerde rij uit de output.
Onafhankelijkheid van observaties
Deze assumptie wordt bijna nooit getoetst en bijna altijd geschonden zonder dat iemand het merkt. Heb je meerdere metingen per persoon, of respondenten die in klassen of behandelgroepen genest zijn, dan is een gewone ANOVA niet geschikt en kom je uit bij repeated measures of multilevelanalyse.
Sfericiteit bij repeated measures
Mauchly’s test hoort erbij. Is die significant, rapporteer dan de Greenhouse-Geisser-correctie en vermeld dat je dat hebt gedaan.
Hoe rapporteer je een toets volgens APA 7?
Een resultaat zonder toetsingsgrootheid, vrijheidsgraden, p-waarde en effectgrootte is in een psychologiescriptie onvolledig. De standaardvormen zien er zo uit.
- t-toets: t(58) = 2.41, p = .019, d = 0.63
- ANOVA: F(2, 87) = 4.12, p = .020, partiele eta-kwadraat = .09
- Correlatie: r(98) = .34, p < .001
- Chi-kwadraat: X-kwadraat(1, N = 120) = 5.78, p = .016
- Regressie: B = 0.42, SE = 0.13, beta = .31, p = .002
Rapporteer p-waarden op drie decimalen zonder nul voor de punt, en schrijf bij zeer kleine waarden p < .001 in plaats van p = .000. Vermeld altijd een effectgrootte: significantie zegt alleen iets over de kans op je data onder de nulhypothese, niet over de omvang van je effect. Voor de opmaak van je tabellen en je verwijzingen naar toetsen in de lopende tekst is de complete APA 7-gids je naslagwerk.
Verschilt dit tussen een hbo-scriptie en een wo-thesis?
Ja, en het onderscheid is groter dan studenten verwachten. Bij een hbo-opleiding Toegepaste Psychologie ligt het accent op beschrijvende statistiek, correcte grafieken en een of twee heldere toetsen, met een praktijkgerichte vertaling van je resultaten naar een advies. Bij een wo-bachelor of master Psychologie wordt verwacht dat je je toetskeuze theoretisch verantwoordt, assumpties expliciet controleert, effectgroottes interpreteert tegen benchmarks uit de literatuur en de beperkingen van je model bespreekt. Wat dat precies betekent voor de opbouw van je verslag staat in het overzicht van het verschil tussen een hbo-scriptie en een wo-thesis. De exacte eisen verschillen per opleiding en staan in je OER of scriptiehandleiding, dus controleer die altijd.
Werkt dit ook buiten de psychologie?
De beslisboom is vakonafhankelijk. Wat verschilt, is welke instrumenten je gebruikt om je variabelen te meten en welke effectgroottes in je vakgebied als klein of groot gelden. In de zorg gebruik je bijvoorbeeld andere schalen dan in de psychologie, en zijn er vaak duidelijke afkapwaarden waarmee een continue score alsnog een categorische variabele wordt. Wie in die hoek zit, vindt in het overzicht van gevalideerde meetinstrumenten uit de zorg een vergelijkbare afweging.
Hoe kom je van output naar hoofdstuk?
De analyse draaien is een uur werk. Er een leesbaar resultatenhoofdstuk van maken, met een consistente structuur per deelvraag en tabellen die aan APA voldoen, kost meestal een week. Tesify helpt je die stap te maken: je geeft aan welke toetsen je hebt gedraaid en met welke uitkomsten, en je krijgt een gestructureerde opzet in correct academisch Nederlands die je zelf invult en aanscherpt. Zet je analyses om in een resultatenhoofdstuk met Tesify.
Veelgestelde vragen
Mag ik een Likert-schaal als continu behandelen?
Een somscore of gemiddelde over meerdere items van een gevalideerde schaal wordt in de psychologie doorgaans als continu behandeld en met parametrische toetsen geanalyseerd. Een enkel item is ordinaal en analyseer je non-parametrisch. Verantwoord je keuze in je methodologie.
Wat doe ik als Levene’s test significant is?
Bij een t-toets rapporteer je de Welch-variant, de tweede regel in de SPSS-output, met de aangepaste vrijheidsgraden. Bij een ANOVA gebruik je Welch’s F of Brown-Forsythe. Vermeld expliciet dat je dat hebt gedaan en waarom.
Moet ik altijd een effectgrootte rapporteren?
Ja. APA 7 verwacht bij elke toets een effectgrootte, ook bij een niet-significant resultaat. Gebruik Cohens d bij t-toetsen, partiele eta-kwadraat bij ANOVA, r bij correlaties en R-kwadraat bij regressie.
Wat als mijn resultaat niet significant is?
Dat is geen mislukt onderzoek en zeker geen reden om andere toetsen te blijven proberen. Rapporteer het resultaat, geef de effectgrootte en het betrouwbaarheidsinterval, en bespreek in je discussie of je onderzoek voldoende power had om het verwachte effect te vinden. Scripties worden beoordeeld op de kwaliteit van de uitvoering, niet op de uitkomst.
Hoeveel respondenten heb ik minimaal nodig voor een ANOVA?
Dat hangt af van het effect dat je verwacht, niet van een vuistregel. Voer een poweranalyse uit in G*Power met het model dat je gaat toetsen. Voor een middelgroot effect bij drie groepen kom je al snel op enkele tientallen deelnemers per groep uit.
Wanneer gebruik ik ANCOVA in plaats van ANOVA?
Wanneer je wilt corrigeren voor een continue storende variabele die met je uitkomst samenhangt, bijvoorbeeld de voormeting bij een interventiestudie. ANCOVA stelt wel de extra eis dat het verband tussen covariaat en uitkomst in elke groep vergelijkbaar is.
Wat is het verschil tussen mediatie en moderatie?
Mediatie verklaart waarom een effect optreedt: de predictor werkt via een tussenliggende variabele op de uitkomst. Moderatie verklaart wanneer of voor wie een effect optreedt: de sterkte van het verband hangt af van een derde variabele. Mediatie test je met bootstrapping, moderatie met een interactieterm.
Mag ik SPSS-output rechtstreeks in mijn scriptie plakken?
Nee. Ruwe output hoort hooguit in een bijlage. In je resultatenhoofdstuk maak je zelf tabellen op volgens APA 7: geen verticale lijnen, een genummerd tabelnummer met cursieve titel en alleen de cijfers die je bespreekt.
Welk programma gebruik ik het beste voor deze toetsen?
SPSS is aan de meeste Nederlandse psychologieopleidingen de standaard, maar JASP en jamovi doen dezelfde toetsen gratis en met overzichtelijkere output. Controleer wel eerst of je opleiding een specifiek programma voorschrijft.
Hoeveel toetsen mag ik draaien voordat ik moet corrigeren voor meervoudig toetsen?
Zodra je meerdere toetsen op dezelfde hypothese uitvoert, loopt je kans op een toevalstreffer op. Bij post-hoc-vergelijkingen na een ANOVA gebruik je een correctie zoals Bonferroni of Tukey. Bij een handvol vooraf geformuleerde, van elkaar losstaande hypothesen is corrigeren meestal niet nodig, mits je die hypothesen vooraf hebt opgeschreven.
