Hoe weet je of een assessment digitale vaardigheden echt iets meet?
Wat maakt een assessment betrouwbaar? Een kijkje in de bouw en validatie: van input uit de corporatiepraktijk tot itemanalyse op echte data.
In gesprekken over ons assessment digitale vaardigheden komt regelmatig dezelfde vraag terug: hoe weet je eigenlijk of zo’n meting iets zegt?
Dat is een terechte vraag. Er zijn veel vragenlijsten waarmee je digitale vaardigheden kunt meten, maar de kwaliteit ervan verschilt behoorlijk. Zeker wanneer je de uitkomsten gebruikt om ontwikkelkeuzes te maken, wil je weten waarop die scores zijn gebaseerd.
In dit artikel laat ik daarom zien hoe we het assessment van SAAR Insights hebben opgebouwd, welke analyses we uitvoeren en welke vragen je zelf kunt stellen wanneer je een meetinstrument beoordeelt.
De inhoud moet aansluiten op het werk
Een assessment kan statistisch prima in elkaar zitten en toch de verkeerde dingen meten.
Daarom is bij de ontwikkeling eerst gekeken naar de praktijk binnen woningcorporaties. In werksessies met verschillende corporaties hebben we in kaart gebracht welke digitale vaardigheden medewerkers in hun dagelijkse werk nodig hebben. Dat loopt uiteen van het digitaal afhandelen van een werkbon tot informatie veilig delen, werken met een klantvolgsysteem en het verantwoord gebruiken van AI.
Op basis daarvan zijn zeven inhoudelijke vaardigheidsgebieden ontwikkeld, met per functiegroep een eigen normprofiel. Van een medewerker klantcontact wordt immers iets anders gevraagd dan van een projectleider vastgoed. Daarnaast bevat het assessment een apart onderdeel waarin deelnemers hun eigen digitale vaardigheid inschatten; daarover verderop meer.
In de testpsychologie valt deze eerste stap onder inhoudsvaliditeit: in hoeverre vertegenwoordigen de vragen samen het domein dat je wilt meten? Praktijkkennis van de doelgroep is daarbij belangrijk. Bij een verdere validatie kijk je daarnaast bijvoorbeeld naar bestaande wetenschappelijke kaders, naar inhoudelijke experts en naar de kwaliteit en representativiteit van afzonderlijke vragen.
Daarna begint het analyseren van de meetresultaten
Na de pilotrondes bij de eerste corporaties hebben we de resultaten gebruikt om het instrument te beoordelen en aan te scherpen. Daarbij kijken we naar verschillende aspecten.
Zijn de vragen moeilijk genoeg om verschillen zichtbaar te maken?
De gemiddelde totaalscore ligt in onze huidige dataset rond de 70 procent. Tegelijkertijd is er een behoorlijke spreiding: er zijn deelnemers met zeer lage scores en deelnemers die vrijwel alle vragen goed beantwoorden.
Die spreiding is relevant, omdat een assessment weinig informatie oplevert wanneer bijna iedereen ongeveer dezelfde score haalt.
Alleen naar het gemiddelde kijken is daarvoor overigens niet voldoende. Daarom analyseren we ook afzonderlijke vragen. Hoeveel deelnemers beantwoorden een vraag goed? Maakt een vraag onderscheid tussen mensen die hoog en laag scoren? En zijn er vragen die zo makkelijk of juist zo moeilijk zijn dat ze nauwelijks informatie toevoegen?
Hoe consistent is de totaalscore?
Een van de maten die we daarvoor gebruiken is Cronbachs alfa. Deze maat wordt veel gebruikt om de interne consistentie van een schaal te onderzoeken: meten de vragen samen in voldoende mate hetzelfde?
Voor de totaalscore van ons assessment komt Cronbachs alfa in de huidige dataset uit op 0,92. Dat is hoog. Als vuistregel wordt voor metingen die op individueel niveau worden geïnterpreteerd vaak een betrouwbaarheid van ongeveer 0,90 of hoger aangehouden.
Daar hoort wel een belangrijke kanttekening bij. Een hoge Cronbachs alfa bewijst niet dat een assessment automatisch valide is en de waarde kan bijvoorbeeld ook worden beïnvloed door het aantal vragen. We gebruiken deze analyse daarom als een van meerdere aanwijzingen voor de kwaliteit van de meting.
Hoe verhoudt de gemeten score zich tot de eigen inschatting?
Naast de kennis- en scenariovragen vragen we deelnemers ook hoe zij hun eigen digitale vaardigheid beoordelen.
De samenhang tussen die zelfinschatting en de gemeten totaalscore komt in onze huidige dataset uit op een correlatie van 0,72. Dat is een behoorlijk sterk verband. Ter vergelijking: een klassieke meta-analyse van Mabe en West vond gemiddeld een verband van ongeveer 0,29 tussen zelfbeoordeling en daadwerkelijke prestaties.
Wat zegt dat verband nu concreet? Medewerkers die zichzelf een hoog cijfer geven, halen over het algemeen ook een hoge score op de toetsvragen en wie zichzelf laag inschat, scoort meestal ook lager. Beide metingen wijzen dus dezelfde kant op en dat is een teken dat het assessment daadwerkelijk iets meet wat mensen zelf ook herkennen als hun digitale vaardigheid. Volledig bewijs is het niet; daarom blijven we het instrument ook langs andere metingen leggen, zoals functie-eisen en verschillen tussen groepen.
Waarom dan niet gewoon vragen hoe digitaal vaardig iemand zichzelf vindt?
Omdat een sterk gemiddeld verband nog niets zegt over individuele verschillen.
Dat zien we ook terug in onze eigen resultaten. Met name onder deelnemers met lagere gemeten scores lopen zelfbeeld en testresultaat regelmatig uiteen. Sommige deelnemers die relatief laag scoren, beoordelen hun eigen digitale vaardigheden nog steeds met een 5, 6 of 7.
Dat patroon zagen we ook al bij een eerdere pilotversie van het assessment: ook daar gaven de laagst scorende deelnemers zichzelf een 6 of hoger.
Dat verschijnsel is niet nieuw. Kruger en Dunning beschreven eind jaren negentig dat laag scorende deelnemers in hun experimenten de eigen relatieve prestatie sterk overschatten. Dat onderzoek is later wel genuanceerd: niet elk verschil tussen zelfbeeld en prestatie kan zomaar worden toegeschreven aan het zogenoemde Dunning-Kruger-effect en het patroon is niet voor elke taak hetzelfde.
Voor de praktijk is vooral dit relevant: wanneer je ontwikkelbehoeften alleen ophaalt via zelfevaluatie, mis je een deel van de medewerkers die ondersteuning goed kunnen gebruiken. Door zelfinschatting te combineren met kennis- en scenariovragen krijg je een completer beeld.
Wat we in de pilotfase hebben aangepast
De pilotrondes leverden ook vragen op die niet goed genoeg functioneerden.
Bij veiligheid en privacy waren verschillende vragen bijvoorbeeld erg makkelijk. Een phishingvraag werd door 99 procent van de deelnemers goed beantwoord. Zo’n vraag kan nog steeds nuttig zijn om vast te stellen dat vrijwel iedereen een minimale basis beheerst, maar voor het onderscheiden van vaardigheidsniveaus voegt hij nauwelijks informatie toe.
We hebben daarom per vraag bekeken hoe die presteerde. Een aantal eenvoudige veiligheidsvragen is vervangen door zwaardere. Bij andere vragen zijn antwoordopties aangescherpt omdat het juiste antwoord te makkelijk herkenbaar was. Twee vragen bleken bij nadere analyse eerder iets te zeggen over iemands manier van werken dan over digitale vaardigheid; die zijn vervangen.
Inmiddels staat het assessment. Toch kijken we na elke assessmentronde opnieuw naar de resultaten: zien we nieuwe inzichten of trends, dan gebruiken we die om het instrument verder door te ontwikkelen. Tegelijkertijd wil je ook niet na elke meting het hele instrument omgooien. Een vaste kern van vragen blijft daarom ongewijzigd, zodat resultaten van verschillende meetmomenten vergelijkbaar blijven.
Vijf vragen die je kunt stellen wanneer je een assessment beoordeelt
Gebruik of overweegt jouw organisatie een assessment digitale vaardigheden, van welke aanbieder dan ook? Dan zou ik in elk geval deze vragen stellen.
-
Waarop is de inhoud gebaseerd? Welke vaardigheden worden gemeten, hoe zijn die bepaald en hoe sluiten ze aan bij het werk binnen de organisatie?
-
Hoe is de betrouwbaarheid onderzocht? Vraag hoe die is vastgesteld en wat daaruit kwam. Cronbachs alfa kan daar onderdeel van zijn, maar is niet de enige mogelijke maat.
-
Maakt het assessment voldoende onderscheid? Kijk naar de verdeling van scores en naar de prestaties van afzonderlijke vragen. Een test waarop vrijwel iedereen hoog scoort, geeft weinig informatie over verschillen tussen medewerkers.
-
Welke aanwijzingen zijn er voor validiteit? Waaruit blijkt dat de score daadwerkelijk iets zegt over digitale vaardigheid? Dat kan bijvoorbeeld worden onderzocht door vergelijking met andere metingen, functie-eisen, prestaties of bekende verschillen tussen groepen.
-
Wat gebeurt er met de resultaten van itemanalyses? Worden vragen geëvalueerd en aangepast wanneer blijkt dat ze te makkelijk, dubbelzinnig of onvoldoende onderscheidend zijn?
Wat een assessment wel en niet vertelt
Ook een goed assessment geeft geen volledig antwoord op de vraag waarom iemand digitaal vaardig werkt.
Een medewerker kan prima weten hoe iets moet en een systeem toch niet gebruiken omdat het omslachtig is ingericht. Er kan tijd ontbreken om nieuw gedrag aan te leren. Een leidinggevende kan ander gedrag stimuleren dan de organisatie formeel heeft afgesproken. En iemand kan technisch vaardig zijn en toch weinig vertrouwen hebben in een nieuwe toepassing.
Een assessment digitale vaardigheden brengt dus vooral een deel van het vraagstuk in beeld: wat mensen weten, herkennen en in bepaalde situaties kunnen toepassen. Voor keuzes over ontwikkeling is dat waardevolle informatie. Voor de vraag waarom bepaald gedrag in de praktijk wel of niet ontstaat, heb je aanvullende informatie nodig over onder andere motivatie, werkomgeving, systemen en ondersteuning.
Daarom laten we het in trajecten niet bij de meting alleen. Om te begrijpen waarom scores zijn zoals ze zijn, brengen we ook de ondersteuningsbehoeften van medewerkers in kaart en kijken we naar de werkomgeving: welke systemen gebruiken mensen dagelijks, hoeveel tijd en ruimte is er om iets nieuws te leren en wat wordt er in teams van elkaar verwacht? In verdiepingssessies met leidinggevenden duiden we vervolgens de scores van hun team, zodat de resultaten ook betekenis krijgen voor de eigen afdeling. Vanuit De Changency adviseren we vervolgens over passende vervolgstappen, van gerichte training per functiegroep tot werkafspraken in teams en de rol van leidinggevenden in de dagelijkse begeleiding.
Als je het assessment dat jouw organisatie gebruikt of overweegt langs deze vijf vragen legt, hoeveel kun je er dan met vertrouwen beantwoorden?
Bronnen
- Kruger, J. & Dunning, D. (1999). Unskilled and unaware of it: How difficulties in recognizing one's own incompetence lead to inflated self-assessments. Journal of Personality and Social Psychology, 77(6), 1121-1134.
- Mabe, P.A. & West, S.G. (1982). Validity of self-evaluation of ability: A review and meta-analysis. Journal of Applied Psychology, 67(3), 280-296.
- Gignac, G.E. & Zajenkowski, M. (2020). The Dunning-Kruger effect is (mostly) a statistical artefact. Intelligence, 80, 101449.
Delen of doorpraten?
Stuur dit artikel door naar een collega of praat verder op LinkedIn.
Oprichter van De Changency en SAAR Insights. Helpt woningcorporaties digitale vaardigheden te meten en vertaalt de uitkomsten naar passende interventies, van gerichte training per functiegroep tot advies over de aanpak in teams.
Dit artikel is ook te lezen op De Changency.
Bij dit artikel is AI ingezet als redactionele ondersteuning. De inhoud, de voorbeelden en de eindredactie komen van de auteur.
Verder praten of interesse in een traject?
Benieuwd hoe SAAR jouw organisatie helpt met meten, leren en ontwikkelen?
Plan een kennismaking