Metodo e validazione

La validità non è un bollino.
È un insieme di evidenze.

Come definiamo i costrutti, costruiamo gli strumenti, verifichiamo la qualità della misura e documentiamo ciò che un risultato permette — e non permette — di concludere.

01Il problema

Un punteggio non è una fotografia.
È una stima.

La motivazione, il ragionamento, i comportamenti organizzativi sono costrutti latenti: caratteristiche che non osserviamo direttamente, ma che stimiamo attraverso risposte, scelte o prestazioni. Ogni indicatore porta con sé una parte di informazione sul costrutto e una parte che al costrutto non appartiene.

Nei contesti in cui dalla risposta dipende una decisione importante, la distorsione prevedibile aumenta: presentarsi al meglio è un comportamento razionale, e la ricerca lo documenta da decenni (Birkeland et al., 2006). Uno strumento serio non elimina l'errore: lo stima, lo dichiara e lo tiene sotto controllo per costruzione, a partire dal formato delle domande.

Tre fonti di variabilità
non attribuibile al costrutto

Desiderabilità sociale

La tendenza a rispondere ciò che mette in buona luce. Cresce con la posta in gioco.

Stili di risposta

Acconsentire, usare gli estremi della scala, restare al centro — a prescindere dal contenuto.

Errore di misura

La variabilità che resta anche quando tutto è fatto correttamente. La stimiamo e la dichiariamo.

La psicometria serve a misurare ciò che non si osserva direttamente e a dichiarare quanto possiamo fidarci della stima.

02Perché conta

Il metodo non serve a produrre numeri più sofisticati.
Serve a usarli meglio.

Una misura ben costruita permette di comprendere che cosa rappresenta un punteggio, con quale precisione è stato stimato, rispetto a quale riferimento può essere interpretato e quali conclusioni sarebbe scorretto trarne.

Che cosa misura

Il significato del costrutto e il suo perimetro.

Quanto è preciso

L'errore e la precisione non restano nascosti.

Con chi può essere confrontato

Il risultato dipende dal campione e dalle norme disponibili.

Che cosa permette di concludere

Il risultato sostiene un'interpretazione circoscritta.

Dove bisogna fermarsi

Un punteggio non autorizza qualunque inferenza sulla persona.

03Le due metà del mestiere

Due competenze diverse,
che devono lavorare insieme.

Costruire uno strumento di valutazione richiede che due competenze diverse lavorino insieme. La qualità dipende da entrambe e dal modo in cui vengono integrate.

Prima metà

Il modello di misura

Stimare i modelli: teoria classica dei test e IRT, analisi fattoriali esplorative e confermative, equazioni strutturali, invarianza di misura. Risponde alla domanda: la struttura teorica trova riscontro nei dati?

Seconda metà

La conoscenza dei costrutti

Sapere che cosa vale la pena misurare e che cosa un punteggio autorizza a concludere. Un costrutto è definito anche dalla rete di relazioni con altri costrutti e con i comportamenti osservabili — la rete nomologica (Cronbach & Meehl, 1955) — e verificare che i dati la rispettino è parte costitutiva della validità.

Le due metà si incontrano nel corpus interpretativo: l'insieme documentato delle regole che collegano punteggi, significati, limiti e testi dei report. I testi dei report vengono costruiti a partire da queste regole, non generati liberamente caso per caso.

04Il processo

Come nasce uno strumento,
in otto passaggi.

Questi passaggi guidano la costruzione e la revisione degli strumenti che Kolbrain rende disponibili. La loro applicazione concreta varia in funzione del costrutto, del formato e delle evidenze già disponibili; le decisioni metodologiche rilevanti vengono documentate.

Definizione del costrutto

Serve a stabilire che cosa misuriamo e che cosa resta fuori.

Si parte dalla letteratura: come il costrutto è definito, quali dimensioni lo compongono, con che cosa si lega e da che cosa si distingue. Da qui il dominio di contenuto.

Letteratura · modello teorico · rete nomologica attesa

Scelta del formato di risposta

Serve a raccogliere l'informazione necessaria e a gestire le distorsioni prevedibili.

Scale di accordo dove l'intensità è l'informazione rilevante; formati a scelta forzata dove la posta in gioco spinge a compiacere — con le cautele descritte più avanti.

Likert vs forced choice · disegno dei blocchi

Scrittura degli item

Serve a trasformare il costrutto in indicatori chiari, pertinenti e non ambigui.

Un'idea per frase, niente doppie negazioni, l'italiano del contesto organizzativo. Nei blocchi a scelta forzata, affermazioni bilanciate per desiderabilità.

Item writing · bilanciamento della desiderabilità

Validazione di contenuto

Serve a verificare copertura, pertinenza e chiarezza prima della raccolta dati.

Quando previsto dal progetto di validazione, giudici esperti valutano gli item in modo indipendente. Quelli su cui non c'è convergenza si riscrivono o si scartano.

Panel di esperti · accordo inter-giudice

Pilota e analisi degli item

Serve a individuare item deboli, ridondanti o che funzionano diversamente tra gruppi.

Somministrazione a un campione pilota: distribuzioni, capacità discriminativa e, quando dati e finalità lo consentono, funzionamento differenziale tra gruppi. Gli item deboli si rifanno e il ciclo si ripete.

Analisi degli item · funzionamento differenziale (DIF)

Struttura e modello di misura

Serve a verificare se la struttura teorica trova riscontro nei dati.

L'analisi esplorativa fa emergere la struttura; la confermativa la mette alla prova su dati nuovi, con indici fissati in anticipo. Dove si confrontano gruppi, si verifica l'invarianza di misura.

EFA · CFA · SEM · invarianza di misura

Affidabilità, validità e norme

Serve a stimare precisione, qualità delle inferenze e riferimenti interpretativi.

Affidabilità con più metodi, dalla coerenza interna alla funzione di informazione. Validità per accumulo di evidenze. Quando l'interpretazione richiede un confronto normativo, le norme vengono costruite su campioni coerenti con la popolazione e il contesto di utilizzo: un percentile vale quanto il campione su cui è costruito.

Funzione di informazione · evidenze di validità · campioni di riferimento

Documentazione e manutenzione

Serve a rendere tracciabili decisioni, proprietà, regole, limiti e revisioni.

Per ogni strumento reso disponibile predisponiamo una documentazione tecnica coerente con il suo stato di sviluppo e il contesto d'uso. Fondamenti teorici, procedure, proprietà psicometriche, regole interpretative e limiti vengono documentati e versionati. Norme e parametri non sono considerati definitivi: vengono riesaminati quando nuovi dati, nuovi utilizzi o cambiamenti nella popolazione di riferimento lo richiedono.

Documentazione versionata · riesame di norme e parametri

05Le evidenze

La validità non viene da una sola analisi.
Si costruisce accumulando evidenze.

La validità si costruisce accumulando evidenze. A queste si affiancano verifiche sulla precisione, sull'equità della misura e sulle condizioni necessarie per interpretare correttamente il risultato. Sono piani distinti, e conviene tenerli separati.

Evidenze a sostegno della validità

Le fonti di evidenza previste dagli Standards (AERA, APA & NCME, 2014).

Evidenze a sostegno della validità: la domanda e l'evidenza corrispondente
La domandaL'evidenza
Gli item rappresentano il dominio?Evidenze basate sul contenuto
Le persone comprendono e affrontano gli item come previsto?Evidenze sui processi di risposta
La struttura teorica trova riscontro nei dati?Evidenze sulla struttura interna
Il punteggio si collega ai fenomeni attesi e si distingue da quelli diversi?Relazioni con altre variabili
Quali conseguenze, previste e impreviste, produce l'uso del test?Evidenze basate sulle conseguenze dell'uso

Precisione, comparabilità ed equità della misura

Non dimostrano da sole la validità, ma sono verifiche necessarie per sostenere la precisione, la comparabilità e le interpretazioni proposte.

Precisione, comparabilità ed equità della misura: la domanda e la verifica corrispondente
La domandaLa verifica
Il risultato è sufficientemente preciso?Affidabilità e funzione di informazione
Funziona in modo comparabile tra gruppi?DIF e invarianza di misura

Interpretazione

Gli strumenti che rendono un punteggio leggibile senza forzarlo.

Interpretazione: la domanda e il supporto corrispondente
La domandaIl supporto
Rispetto a quale riferimento viene interpretato?Norme e campioni di riferimento
Quali conclusioni sono autorizzate?Regole interpretative e limiti d'uso

Un punto che cambia il modo di leggere tutta la pagina: la validità riguarda le interpretazioni e gli usi dei punteggi, sostenuti da evidenze raccolte per uno scopo e un contesto definiti (Messick, 1995) (AERA, APA & NCME, 2014). Per questo accanto a ogni strumento dichiariamo che cosa è stato verificato, in quale contesto, e che cosa resta fuori.

Questa pagina adotta il quadro degli Standards, centrato sulle interpretazioni e sugli usi dei punteggi. Nel dibattito scientifico esistono anche concezioni causali della validità, che spostano la domanda sul processo attraverso cui il costrutto produce le risposte osservate (Borsboom et al., 2004). Le due posizioni non coincidono; la seconda richiama comunque l'attenzione sui meccanismi che collegano attributo e risposte.

06I modelli

Gli strumenti statistici,
e le domande a cui rispondono.

I quadri di riferimento con cui costruiamo e validiamo. Sono scienza pubblica: chiunque può studiarli e verificarli.

CTT · Teoria classica dei test

Quanto è affidabile il risultato?

Ogni punteggio osservato è punteggio vero più errore, e l'affidabilità è la quota di variabilità attribuibile al punteggio vero. Da qui gli indici di coerenza interna.

Dettaglio tecnico

Il limite noto della CTT è che le proprietà stimate dipendono dal test nel suo insieme e dal campione su cui sono state calcolate: due ragioni per cui, da sola, oggi non basta (McDonald, 1999).

IRT · Teoria di risposta all'item

Con quale precisione misura ai diversi livelli del tratto?

Modella la probabilità di ogni risposta in funzione del tratto latente della persona e dei parametri del singolo item. Gli item vengono calibrati uno a uno.

Dettaglio tecnico

La funzione di informazione descrive la precisione dello strumento a ciascun livello del tratto, non soltanto in media: si sa dove la misura è più accurata e dove lo è meno, e lo si può dichiarare (Embretson & Reise, 2000).

EFA · CFA · SEM

La struttura teorica trova riscontro nei dati?

L'analisi fattoriale esplorativa lascia emergere la struttura dai dati; la confermativa specifica la struttura attesa e la mette alla prova su dati nuovi.

Dettaglio tecnico

Gli indici di adattamento — CFI, TLI, RMSEA, SRMR — vengono fissati prima dell'analisi. Le equazioni strutturali estendono il quadro alle relazioni tra costrutti al netto dell'errore di misura, e alla verifica dell'invarianza configurale, metrica e scalare prima di qualunque confronto tra gruppi.

TIRT + BIBD · Scelta forzata

Come si ricavano punteggi confrontabili da scelte forzate?

La scelta forzata può ridurre alcune distorsioni tipiche delle scale di accordo, ma la sua efficacia dipende dal disegno, dal contenuto degli item, dallo scoring e dal contesto di utilizzo (Cao & Drasgow, 2019). Con lo scoring classico, inoltre, produce punteggi ipsativi: leggibili dentro la persona, non confrontabili tra persone.

Dettaglio tecnico

Quando il disegno e le assunzioni del modello sono adeguati, i modelli Thurstonian IRT permettono di stimare i tratti latenti evitando i principali problemi dello scoring ipsativo classico e rendendo possibili confronti tra persone (Brown & Maydeu-Olivares, 2011). Il disegno a blocchi incompleti bilanciati (BIBD) controlla la frequenza dei confronti tra dimensioni e contribuisce all'equilibrio informativo e alla stabilità delle stime.

Una distinzione che regge tutta la pagina: i modelli sono scienza pubblica, citata in bibliografia. Item, parametri e regole interpretative dei nostri strumenti seguono invece regole di accesso diverse — la sezione seguente le descrive.

07Trasparenza e protezione

Tre livelli di accesso,
e la ragione di ciascuno.

Trasparenza scientifica non significa pubblicare indiscriminatamente ogni componente. Significa rendere comprensibili e verificabili metodo, evidenze e limiti, proteggendo ciò la cui diffusione comprometterebbe la misura o la proprietà intellettuale.

Livello 1

Pubblico

  • Il processo metodologico e i quadri teorici e statistici adottati.
  • La sintesi delle evidenze e lo stato della validazione.
  • Le caratteristiche essenziali del campione.
  • I limiti d'uso di ciascuno strumento.
  • La bibliografia di riferimento.

Livello 2

Condivisibile in contesti qualificati

  • Alcuni materiali possono essere condivisi, previa valutazione di Kolbrain e, quando necessario, con impegni di riservatezza.
  • Documentazione per audit o due diligence.
  • Collaborazioni scientifiche e valutazioni metodologiche indipendenti.
  • Documenti tecnici necessari nel rapporto contrattuale.

Livello 3

Protetto

  • Gli item e le forme parallele: un item diffuso è un item su cui ci si può preparare, e la misura ne risulta compromessa per tutti. Le linee guida internazionali sulla sicurezza dei test chiedono espressamente di proteggere il materiale (ITC, 2014).
  • I parametri operativi e le regole di scoring.
  • Il corpus interpretativo completo, proprietà intellettuale di Kolbrain.

Sul manuale tecnico, in concreto: una sintesi delle evidenze e dei limiti accompagna ciascuno strumento. L'eventuale accesso a documentazione tecnica più dettagliata viene valutato in relazione alla finalità della richiesta e alla tutela del materiale.

08Standard e responsabilità

Le regole a cui rispondiamo.

Il lavoro psicometrico non si svolge nel vuoto: esistono standard internazionali che dicono come uno strumento va costruito, documentato e usato.

AERA · APA · NCME

Gli Standards for Educational and Psychological Testing (2014): il riferimento internazionale su validità, affidabilità, equità e documentazione.

ITC

Le linee guida della International Test Commission sull'uso corretto dei test (2000) e sulla sicurezza del materiale (2014).

EFPA

Il modello europeo di recensione dei test psicologici, nella versione 2025: la griglia con cui la comunità scientifica ne valuta la qualità.

Responsabilità professionale

  • Uso appropriato degli strumenti, nei contesti per cui sono stati costruiti.
  • Limiti d'uso dichiarati insieme al risultato.
  • Restituzione e tutela di chi risponde.
  • Responsabilità dell'interpretazione e della decisione in capo a chi la assume.

Protezione dei dati: i principi di progettazione

Progettiamo i trattamenti secondo questi principi:

  • Finalità determinate.
  • Minimizzazione: si raccoglie ciò che serve alla misura.
  • Ruoli e responsabilità definiti per ciascun trattamento e per ciascun flusso.
  • Controllo degli accessi.
  • Tracciabilità coerente con il trattamento.

Per conoscere la responsabilità scientifica e le competenze del team, vai a Chi siamo.

09Intelligenza artificiale

L'intelligenza artificiale è uno strumento.
Il criterio resta la qualità della misura.

Dove può aiutarci

  • Analisi esplorative sui dati di ricerca.
  • Supporto al lavoro di ricerca e alla rassegna della letteratura.
  • Efficienza di processi non decisionali.
  • Organizzazione e ricerca nella documentazione.

Nel WMP, allo stato attuale, dove non interviene

  • Non interviene nel calcolo dei punteggi: i risultati derivano da modelli di misura documentati.
  • Non modifica le regole interpretative.
  • Non prende decisioni sulla persona, né produce esiti di tipo assumi/scarta.
  • La decisione resta in capo a chi utilizza lo strumento.

Una tecnologia entra nel processo valutativo quando il suo contributo può essere descritto, verificato, documentato e sottoposto a supervisione. Le evidenze scientifiche sull'uso dell'AI nella valutazione delle persone sono in rapida evoluzione e variano in funzione della tecnologia e dell'applicazione: valutiamo ogni impiego rispetto a validità, equità, stabilità e trasparenza, aggiornando le nostre scelte man mano che le evidenze si consolidano.

Sul quadro regolatorio

L'uso dell'AI nei processi HR richiede valutazioni specifiche sulla tecnologia, sulla funzione svolta e sul contesto d'uso. Documentare il funzionamento dei componenti e mantenere la decisione in capo a una persona sono due elementi del nostro approccio; gli obblighi applicabili dipendono però dalla qualificazione concreta del sistema, e sono trattati nella documentazione dedicata.

10Per approfondire

Riferimenti.

La letteratura da cui questa pagina discende, richiamata nei punti in cui viene usata.

  • AERA, APA & NCME (2014). Standards for Educational and Psychological Testing. American Educational Research Association.
  • Birkeland, S. A., Manson, T. M., Kisamore, J. L., Brannick, M. T., & Smith, M. A. (2006). A meta-analytic investigation of job applicant faking on personality measures. International Journal of Selection and Assessment, 14(4), 317–335. doi:10.1111/j.1468-2389.2006.00354.x
  • Borsboom, D., Mellenbergh, G. J., & van Heerden, J. (2004). The concept of validity. Psychological Review, 111(4), 1061–1071. doi:10.1037/0033-295X.111.4.1061
  • Brown, A., & Maydeu-Olivares, A. (2011). Item response modeling of forced-choice questionnaires. Educational and Psychological Measurement, 71(3), 460–502. doi:10.1177/0013164410375112
  • Cao, M., & Drasgow, F. (2019). Does forcing reduce faking? A meta-analytic review of forced-choice personality measures in high-stakes situations. Journal of Applied Psychology, 104(11), 1347–1368. doi:10.1037/apl0000414
  • Cronbach, L. J., & Meehl, P. E. (1955). Construct validity in psychological tests. Psychological Bulletin, 52(4), 281–302. doi:10.1037/h0040957
  • Embretson, S. E., & Reise, S. P. (2000). Item Response Theory for Psychologists. Lawrence Erlbaum Associates.
  • European Federation of Psychologists' Associations (2025). Model for the Review, Description and Evaluation of Psychological and Educational Tests — Version 2025. efpa.eu/resources
  • International Test Commission (2000). International Guidelines for Test Use. intestcom.org
  • International Test Commission (2014). ITC Guidelines on the Security of Tests, Examinations, and Other Assessments. intestcom.org
  • McDonald, R. P. (1999). Test Theory: A Unified Treatment. Lawrence Erlbaum Associates.
  • Messick, S. (1995). Validity of psychological assessment. American Psychologist, 50(9), 741–749. doi:10.1037/0003-066X.50.9.741

Dal metodo allo strumento

Il WMP è il primo assessment Kolbrain che verrà reso disponibile attraverso Clario. La pagina dedicata ne descrive il costrutto, il formato, gli utilizzi e i limiti.

Vai alla pagina del WMP →