Vai al contenuto

Convalida incrociata

Da Wikipedia, l'enciclopedia libera.
Confronto dell'accuratezza stimata tramite convalida incrociata e percentuale di falsi negativi (sovrastima) per cinque modelli di classificazione. La grandezza delle sfere rappresenta la deviazione standard dell'accuratezza stimata con la convalida incrociata (10-fold)[1].

La convalida incrociata (cross-validation in inglese), detta anche out-of-sample testing, è una famiglia di tecniche statistiche[2][3] di convalida di modelli utili a valutare quanto i risultati di un'analisi statistica possano essere generalizzati su un insieme di dati indipendente. Essa include metodi di resampling e sample splitting che usano porzioni differenti dei dati per addestrare e poi testare un modello in diverse iterate. Viene spesso utilizzata in casi in cui l'obiettivo è la predizione e si vuole stimare empiricamente l'accuratezza di un modello predittivo. Si può usare anche per valutare la qualità di un modello appreso e la stabilità dei suoi parametri.

In un problema di predizione, a un modello viene solitamente fornito un insieme di dati noti su cui viene eseguito l'addestramento (training set) e un insieme di dati sconosciuti (o dati visti per la prima volta) rispetto ai quali il modello viene testato (detto validation set o test set)[4][5]. L'obiettivo della convalida incrociata è quello di testare la capacità del modello di prevedere nuovi dati che non sono stati utilizzati nella sua stima, al fine di segnalare problemi come il sovradattamento o il bias di selezione[6] e di fornire una visione d'insieme su come il modello generalizzerà un insieme di dati indipendente (cioè un insieme di dati sconosciuti, ad esempio provenienti da un problema reale).

Un ciclo di convalida incrociata prevede il partizionamento di un campione di dati in sottoinsiemi complementari, l'esecuzione dell'analisi sul training set e la convalida dell'analisi sull'altro sottoinsieme, il validation set. Per ridurre la variabilità, nella maggior parte dei metodi vengono eseguiti più cicli di validazione incrociata utilizzando partizioni diverse e i risultati della validazione vengono combinati (ad esempio mediati) nei vari cicli per fornire una stima delle prestazioni predittive del modello.

In sintesi, la convalida incrociata combina (media) le misure di valutazione delle predizioni per ottenere una stima più accurata delle prestazioni predittive del modello[7].

Si consideri un modello con uno o più parametri sconosciuti e un insieme di dati a cui il modello può essere adattato (l'insieme di dati di addestramento). Il processo di adattamento ottimizza i parametri del modello per adattarlo il più possibile ai dati di addestramento. Se si estrae un campione indipendente di dati di convalida dalla stessa popolazione dei dati di addestramento, in genere si riscontra che il modello non si adatta ai dati di convalida tanto quanto si adatta ai dati di addestramento. L'entità di questa differenza è probabilmente elevata, specialmente quando la dimensione dell'insieme di dati di addestramento è ridotta o quando il numero di parametri nel modello è elevato. La convalida incrociata è un modo per stimare l'entità di questo effetto.

Esempio: regressione lineare

[modifica | modifica wikitesto]

Nella regressione lineare, si hanno valori di risposta reali e vettori -dimensionali di covariate . Le componenti del vettore sono denotate da . Se si usano i minimi quadrati per adattare una funzione in forma di iperpiano ai dati , allora l'adattamento può essere valutato usando l'errore quadratico medio (MSE). L'MSE per la stima dei valori dei parameteri e sul training set è definito da:

Se il modello è specificato correttamente, è possibile dimostrare, sulla base di ipotesi ragionevoli, che il valore atteso dell'MSE per l'insieme di addestramento è volte il valore atteso dell'MSE per l'insieme di convalida (valore atteso calcolato sulla base della distribuzione dei training set). Pertanto, un modello adattato e un MSE calcolato sul set di addestramento darà luogo a una valutazione ottimistica di quanto il modello possa adattarsi a un insieme di dati indipendente. Tale stima distorta è chiamata stima dell'adattamento in-sample, mentre la stima della convalida incrociata è una stima out-of-sample.

Poiché nella regressione lineare è possibile calcolare direttamente il fattore con cui l'MSE di addestramento sottostima l'MSE di convalida, supponendo che la specifica del modello sia corretta, si può utilizzare la convalida incrociata per verificare se il modello sia sovradattato, nel qual caso l'MSE sull'insieme di convalida supererà sostanzialmente il suo valore previsto. Nel contesto della regressione lineare, la convalida incrociata è utile anche nella scelta di una funzione di costo regolarizzata ottimale.

Si distinguono due tipologie di convalida incrociata: esaustiva e non esaustiva.

Convalida incrociata esaustiva

[modifica | modifica wikitesto]

I metodi di convalida incrociata esaustiva sono metodi che apprendono e testano sulla base di tutti i modi in cui è possibile suddividere il campione originario in un insieme di addestramento e un insieme di convalida.

Validazione incrociata Leave-p-out

[modifica | modifica wikitesto]

La convalida incrociata Leave-p-out (LpO CV) prevede l'utilizzo di osservazioni come insieme di validazione e delle osservazioni rimanenti come insieme di addestramento. Questo processo viene ripetuto in tutti i modi possibili per suddividere il campione originario in un insieme di convalida di osservazioni e un insieme di addestramento[8].

La convalida incrociata LpO richiede l'addestramento e la validazione del modello volte, dove è il numero di osservazioni nel campione originario e dove è il coefficiente binomiale. Per e per anche moderatamente grande, la CV LpO può diventare intrattabile dal punto di vista computazionale. Ad esempio, con e , .

Una variante della validazione incrociata LpO con nota come convalida incrociata leave-pair-out è stata raccomandata come metodo quasi privo di distorsioni per stimare l'area sotto la curva ROC dei classificatori binari[9].

Leave-one-out cross-validation

[modifica | modifica wikitesto]
Illustrazione della convalida incrociata leave-one-out (LOOCV) per osservazioni. Vengono addestrati e testati 8 modelli in totale.

La convalida incrociata leave-one-out (LOOCV) costituisce un caso particolare della leave-p-out in cui . Il processo somiglia a quello del metodo jackknife, tuttavia con la convalida incrociata si cacola una statistica sui campioni esclusi, mentre con il jackknife la statistica viene calcolata solo su quelli conservati.

la convalida incrociata LOO richiede ha un minor costo computazionale rispetto alla LpO in quanto servono solo passate anziché . In ogni modo, passate possono comunque richiedere parecchio tempo di calcolo, nel qual caso altri approcci possono rendersi più appropriati, come la k-fold cross validation[10].

Convalida incrociata non esaustiva

[modifica | modifica wikitesto]

k-fold cross validation

[modifica | modifica wikitesto]
Diagramma esplicativo della k-fold cross-validation

Fra le più utilizzate, avendo a disposizione un buon numero di campioni, la convalida incrociata cosiddetta k-fold consiste nella suddivisione dell'insieme di dati totale in k parti di uguale numerosità e, a ogni passo, la kª parte dell'insieme di dati viene a essere quella di convalida, mentre la restante parte costituisce sempre l'insieme di addestramento. Così si addestra il modello per ognuna delle k parti, evitando quindi problemi di sovradattamento, ma anche di campionamento asimmetrico (e quindi affetto da distorsione) del campione osservato, tipico della suddivisione dei dati in due sole parti (ossia addestramento/convalida). In altre parole, si suddivide il campione osservato in gruppi di egual numerosità, si esclude iterativamente un gruppo alla volta e si cerca di predirlo coi gruppi non esclusi, al fine di verificare la bontà del modello di predizione utilizzato.

Convalida incrociata annidata

[modifica | modifica wikitesto]

Quando la validazione incrociata viene utilizzata sia per la selezione del miglior insieme di iperparametri sia per la stima dell'errore (e la valutazione della capacità di generalizzazione), è necessaria una validazione incrociata annidata. Esistono molte varianti. Se ne possono distinguere almeno due:

  • k*l-fold cross-validation;
  • k-fold cross-validation con insiemi di convalida e test.

Misure di valutazione

[modifica | modifica wikitesto]

L'obiettivo della validazione incrociata è stimare il livello previsto di adattamento di un modello a un insieme di dati indipendente dai dati utilizzati per addestrare il modello. Può essere utilizzata per stimare qualsiasi misura quantitativa di adattamento appropriata per i dati e il modello. Ad esempio, per i problemi di classificazione binaria, ogni caso nell'insieme di validazione viene predetto correttamente o in modo errato. In questa situazione, il tasso di errore di classificazione errata può essere utilizzato per misurare l'adattamento, sebbene possano essere utilizzate anche altre misure derivate dalle informazioni (ad esempio, conteggi, frequenza) contenute in una tabella di contingenza o in una matrice di confusione. Quando il valore previsto è distribuito in modo continuo, è possibile utilizzare l'errore quadratico medio, la sua radice quadrata o la deviazione mediana assoluta per riassumere gli errori.

  1. (EN) S. Madeh Piryonesi e Tamer E. El-Diraby, Data Analytics in Asset Management: Cost-Effective Prediction of the Pavement Condition Index, in Journal of Infrastructure Systems, vol. 26, n. 1, 1º marzo 2020, pp. 04019036, DOI:10.1061/(ASCE)IS.1943-555X.0000512. URL consultato il 28 luglio 2025.
  2. David M. Allen, The Relationship Between Variable Selection and Data Agumentation and a Method for Prediction, in Technometrics, vol. 16, n. 1, 1º febbraio 1974, pp. 125–127, DOI:10.1080/00401706.1974.10489157. URL consultato il 26 luglio 2025.
  3. M. Stone, Cross-Validatory Choice and Assessment of Statistical Predictions, in Journal of the Royal Statistical Society: Series B (Methodological), vol. 36, n. 2, 1º gennaio 1974, pp. 111–133, DOI:10.1111/j.2517-6161.1974.tb00994.x. URL consultato il 26 luglio 2025.
  4. (EN) What is the difference between test set and validation set?, su Cross Validated. URL consultato il 26 luglio 2025.
  5. (EN) Newbie question: Confused about train, validation and test data! | Heaton Research, su www.heatonresearch.com. URL consultato il 26 luglio 2025 (archiviato dall'url originale il 14 marzo 2015).
  6. Gavin C. Cawley e Nicola L. C. Talbot, On Over-fitting in Model Selection and Subsequent Selection Bias in Performance Evaluation, in Journal of Machine Learning Research, vol. 11, n. 70, 2010, pp. 2079–2107. URL consultato il 26 luglio 2025.
  7. (EN) Giovanni Seni e John F. Elder, Ensemble Methods in Data Mining, in Synthesis Lectures on Data Mining and Knowledge Discovery, 2010, DOI:10.2200/s00240ed1v01y200912dmk002. URL consultato il 26 luglio 2025.
  8. Alain Celisse, Optimal cross-validation in density estimation with the $L^{2}$-loss, in The Annals of Statistics, vol. 42, n. 5, 1º ottobre 2014, DOI:10.1214/14-aos1240. URL consultato il 28 luglio 2025.
  9. Antti Airola, Tapio Pahikkala e Willem Waegeman, An experimental comparison of cross-validation techniques for estimating the area under the ROC curve, in Computational Statistics & Data Analysis, vol. 55, n. 4, 1º aprile 2011, pp. 1828–1844, DOI:10.1016/j.csda.2010.11.018. URL consultato il 28 luglio 2025.
  10. (EN) Annette M. Molinaro, Richard Simon e Ruth M. Pfeiffer, Prediction error estimation: a comparison of resampling methods, in Bioinformatics, vol. 21, n. 15, 1º agosto 2005, pp. 3301–3307, DOI:10.1093/bioinformatics/bti499. URL consultato il 28 luglio 2025.
  • E. Alpaydın: Introduction to Machine Learning, 4th edition. ch. 20. The MIT Press. 2020, ISBN 9780262043793
  • I. Witten, E. Frank: Data Mining: Practical Machine Learning Tools and Techniques, Morgan Kaufmann
  • R. Duda, P. Hart, D. Stork: Pattern Classification, Wiley
  • T. Hastie, R. Tibshirani, J. Friedman: The Elements of Statistical Learning, Springer

Voci correlate

[modifica | modifica wikitesto]

Altri progetti

[modifica | modifica wikitesto]

Collegamenti esterni

[modifica | modifica wikitesto]