logo strumenti commercialista

Quando un algoritmo diventa una prova? Il problema non è l’intelligenza artificiale, ma come viene dimostrata

Negli ultimi anni il lessico della consulenza aziendale si è arricchito di espressioni che esercitano un’indubbia capacità di suggestione: algoritmi proprietari, intelligenza artificiale, machine learning, modelli predittivi, sistemi capaci di riconoscere anticipatamente le condizioni che precedono una crisi aziendale. Si tratta, sia chiaro, di tecnologie serie, utilizzate da decenni in ambiti nei quali la capacità di classificare correttamente un fenomeno o stimarne l’evoluzione possiede un valore economico enorme; proprio per questo, però, sarebbe opportuno sottrarle alla retorica commerciale secondo cui la semplice presenza di un algoritmo sofisticato costituirebbe, di per sé, una prova dell’affidabilità del risultato che produce.

Non è così, e sostenerlo non significa affatto essere contrari all’intelligenza artificiale o considerare inattendibili i modelli di machine learning. Significa, al contrario, prendere queste tecnologie sufficientemente sul serio da pretendere per esse gli stessi criteri di verifica che pretenderemmo da qualsiasi altro modello quantitativo destinato a influenzare decisioni economiche rilevanti.

Un algoritmo di machine learning può certamente essere validato, può raggiungere prestazioni predittive eccellenti e può perfino superare modelli statistici tradizionali; ciò che non può accadere, almeno sul piano metodologico, è considerare dimostrata la sua efficacia semplicemente perché qualcuno dichiara che è stato addestrato su un certo numero di imprese e che raggiunge una determinata percentuale di accuratezza. Fra una performance dichiarata e una performance scientificamente verificabile esiste infatti una distanza che può essere colmata soltanto conoscendo come quella performance è stata misurata.

 

Il campione non è un dettaglio

Immaginiamo un modello costruito analizzando i bilanci di alcune centinaia di imprese successivamente fallite, con l’obiettivo di riconoscere configurazioni economiche, patrimoniali e finanziarie che tendono a presentarsi prima dell’insolvenza. Il principio è perfettamente ragionevole: se determinate combinazioni di indicatori ricorrono frequentemente prima di un evento negativo, un algoritmo può essere addestrato a riconoscerle e successivamente utilizzato per classificare imprese delle quali non conosciamo ancora l’esito.

Il punto metodologico, tuttavia, comincia proprio qui, perché sapere quanti fallimenti siano stati analizzati dice molto meno di quanto possa sembrare se non conosciamo anche la popolazione di confronto, i criteri con cui sono state selezionate le imprese sane, la distribuzione settoriale e dimensionale del campione, gli anni ai quali appartengono i bilanci, la definizione dell’evento che il modello dovrebbe prevedere e, soprattutto, la distanza temporale intercorrente fra i dati utilizzati e l’evento osservato.

Un’impresa manifatturiera che entra in liquidazione dopo una lunga crisi finanziaria, una società che cessa l’attività per ragioni estranee alla propria struttura economica e un’azienda coinvolta in un evento straordinario possono produrre formalmente lo stesso esito finale, ma rappresentano fenomeni profondamente diversi dal punto di vista predittivo. Se non sappiamo come questi casi sono stati classificati, esclusi o trattati, il numero delle osservazioni utilizzate durante l’addestramento ci offre un’informazione interessante, ma certamente non sufficiente per giudicare la capacità del modello.

Lo stesso vale per la composizione del campione. Un sistema destinato a valutare le PMI italiane dovrebbe dimostrare di mantenere prestazioni adeguate attraversando imprese molto diverse per settore, dimensione, struttura patrimoniale, intensità di capitale e fase del ciclo economico; diversamente, il rischio è quello di costruire un modello particolarmente bravo a riconoscere le caratteristiche della popolazione sulla quale è stato sviluppato e assai meno efficace quando incontra aziende differenti.

 

Prevedere il passato è molto più facile che prevedere il futuro

La distinzione decisiva, in qualsiasi sistema predittivo, riguarda il rapporto fra i dati utilizzati per costruire il modello e quelli impiegati per verificarlo. Un algoritmo sufficientemente flessibile può adattarsi molto bene alle informazioni che ha già incontrato, fino a riconoscere non soltanto le relazioni strutturali realmente utili alla previsione, ma anche peculiarità casuali del campione utilizzato durante l’addestramento.

È il problema generalmente indicato come overfitting, ma la questione, per chi utilizza professionalmente questi strumenti, è meno informatica di quanto possa sembrare: un modello che descrive magnificamente ciò che è già accaduto non è necessariamente un modello capace di prevedere ciò che accadrà.

Per questo motivo una validazione credibile richiede che le prestazioni vengano misurate su osservazioni che il sistema non abbia utilizzato per apprendere, attraverso procedure statisticamente appropriate e, quando l’obiettivo dichiarato riguarda la previsione futura, possibilmente verificando anche la stabilità delle prestazioni su periodi temporali successivi a quelli impiegati nello sviluppo.

È precisamente in questa fase che si misura la capacità di generalizzazione del modello: non quanto bene riesca a riconoscere il mondo dal quale ha imparato, ma quanto bene riesca a comportarsi quando incontra un mondo che non conosce ancora.

 

Un’accuratezza elevata può nascondere un modello inutile

Esiste poi un secondo problema, particolarmente rilevante quando si comunica al mercato la qualità di un sistema attraverso una singola percentuale di accuratezza. Immaginiamo, per semplicità, una popolazione composta da mille aziende nella quale soltanto cinquanta siano destinate a fallire nel periodo osservato: un modello completamente privo di capacità predittiva potrebbe classificare tutte le mille aziende come sane, sbagliando proprio tutti i cinquanta casi che avremmo voluto individuare e classificando correttamente le altre novecentocinquanta.

Formalmente avrebbe ottenuto un’accuratezza del 95 per cento.

Commercialmente sarebbe un numero magnifico; professionalmente sarebbe un risultato disastroso.

Questo esempio volutamente estremo serve a ricordare perché, soprattutto nei fenomeni relativamente rari, una percentuale aggregata non permette da sola di valutare la qualità di un classificatore. Occorre sapere quanti eventi realmente negativi vengono riconosciuti, quante imprese sane vengono erroneamente segnalate come problematiche, quale rapporto esiste fra veri positivi, falsi positivi, veri negativi e falsi negativi e, soprattutto, quale sia la conseguenza economica delle diverse tipologie di errore.

In finanza aziendale la questione è tutt’altro che accademica, perché classificare come pericolosa un’impresa sostanzialmente sana e non riconoscere un’impresa prossima a una condizione di insolvenza sono entrambi errori, ma non sono necessariamente errori equivalenti. Un modello serio deve quindi essere valutato rispetto allo scopo per il quale viene utilizzato e non semplicemente attraverso il numero più favorevole da inserire in una presentazione commerciale.

 

Il problema non è che l’algoritmo sia proprietario

Occorre essere altrettanto rigorosi sul versante opposto. Pretendere che ogni algoritmo commerciale renda pubblico il proprio codice, i propri coefficienti o l’intero database utilizzato per svilupparlo sarebbe irragionevole: un’impresa ha il diritto di proteggere il proprio know-how e la proprietà intellettuale costruita attraverso investimenti, ricerca e sperimentazione.

La riservatezza dell’algoritmo, tuttavia, non impedisce la verificabilità delle prestazioni dichiarate.

È perfettamente possibile mantenere proprietario un modello e contemporaneamente documentare la metodologia con cui è stato validato, descrivere la struttura dei campioni utilizzati, precisare l’orizzonte temporale della previsione, dichiarare quali metriche siano state adottate e pubblicare i risultati ottenuti su campioni indipendenti o comunque separati da quelli utilizzati per l’addestramento.

Ancora più convincente sarebbe una validazione effettuata da soggetti indipendenti, non perché l’autovalutazione sia necessariamente scorretta, ma perché quando produttore, valutatore e soggetto che comunica commercialmente il risultato coincidono, una verifica esterna aggiunge inevitabilmente forza all’evidenza disponibile.

È quindi importante non confondere la tutela legittima di un algoritmo proprietario con l’impossibilità di verificarne le prestazioni: si può proteggere il primo e documentare rigorosamente le seconde.

 

Il machine learning non è un certificato di qualità

Il vero equivoco nasce probabilmente dall’uso che abbiamo cominciato a fare delle parole “intelligenza artificiale” e “machine learning”, trasformandole progressivamente da descrizioni di una tecnologia in argomenti di autorità. Se un indicatore tradizionale deve spiegare almeno in parte quali grandezze considera e perché, davanti a un algoritmo di machine learning sembra talvolta sufficiente affermare che il sistema ha analizzato migliaia di dati e individuato autonomamente relazioni troppo complesse per essere percepite dall’uomo.

Può essere vero, naturalmente, ma non costituisce ancora una dimostrazione della qualità della previsione.

Un modello complesso non è necessariamente migliore di uno semplice, così come un modello semplice non è necessariamente più affidabile perché possiamo leggerne facilmente la formula; ciò che consente di confrontarli seriamente è la loro capacità di produrre risultati utili e sufficientemente stabili quando vengono applicati a dati diversi da quelli sui quali sono stati costruiti.

In altri termini, non dovremmo chiedere a un algoritmo di raccontarci quanto sia intelligente, ma di mostrarci come è stato esaminato.

 

Dal “come funziona?” Al “come sappiamo che funziona?”

Per un Commercialista, un consulente finanziario o un imprenditore questa distinzione dovrebbe diventare particolarmente importante, perché un indicatore destinato a orientare una decisione aziendale acquista inevitabilmente un’autorità che va oltre il semplice numero visualizzato sullo schermo. Se quel numero viene presentato come predittivo, il professionista dovrebbe conoscere almeno gli elementi necessari per comprendere quale significato attribuirgli e quali conclusioni, invece, non possano essere ragionevolmente tratte.

La domanda professionale più interessante, pertanto, non è necessariamente conoscere ogni riga di codice utilizzata dal modello, né pretendere di ricostruire personalmente l’intero processo matematico che conduce al risultato; è molto più semplicemente domandare quali evidenze consentano di affermare che quel sistema possiede realmente le capacità predittive che gli vengono attribuite.

Qual era il campione iniziale? Qual era la popolazione di controllo? Come sono stati separati i dati di addestramento da quelli di verifica? Quale evento viene considerato esattamente come risultato negativo? Qual è l’orizzonte temporale della previsione? Quali sono sensibilità, specificità e tassi di errore? Le prestazioni rimangono comparabili su aziende appartenenti a settori differenti? Il modello è stato verificato su periodi successivi? Esistono verifiche indipendenti?

Non è necessario che ogni utilizzatore sappia calcolare personalmente queste grandezze, ma è ragionevole pretendere che chi attribuisce pubblicamente a un modello determinate prestazioni sia in grado di documentare come siano state ottenute.

 

La differenza tra una dichiarazione e una dimostrazione

Questa riflessione non conduce affatto alla conclusione che i modelli di machine learning applicati alla previsione della crisi aziendale siano inattendibili; sarebbe un’affermazione tecnicamente insostenibile, perché esistono numerosi ambiti nei quali tecniche di apprendimento automatico vengono studiate, confrontate e validate con metodologie rigorose.

Conduce invece a una conclusione più prudente e, proprio per questo, molto più importante: non possiamo dedurre l’affidabilità di un modello dalla tecnologia utilizzata per costruirlo, dal numero di osservazioni sulle quali è stato addestrato o da una percentuale di accuratezza comunicata senza conoscere il contesto metodologico dal quale quella percentuale deriva.

Se queste informazioni non sono disponibili, non abbiamo alcun motivo scientificamente serio per concludere automaticamente che il modello non funzioni, perché l’assenza di una prova pubblicamente verificabile non costituisce una prova di inefficacia; allo stesso tempo, però, non disponiamo degli elementi necessari per trasformare una prestazione dichiarata in una prestazione indipendentemente verificata.

Ed è esattamente qui che dovrebbe collocarsi il confine tra comunicazione commerciale e valutazione professionale.

L’intelligenza artificiale può certamente aiutarci a prevedere fenomeni che fino a pochi anni fa avremmo affrontato con strumenti molto più rudimentali, e sarebbe assurdo rinunciare a questa possibilità; proprio perché questi strumenti stanno diventando sempre più potenti e influenti, tuttavia, dovremmo smettere di concedere loro una sorta di presunzione automatica di autorevolezza.

In finanza, come nella scienza, la sofisticazione dello strumento non sostituisce la qualità della prova.

E forse, davanti al prossimo indicatore presentato come capace di anticipare il futuro di un’impresa, la domanda più professionale non sarà più “utilizza davvero l’intelligenza artificiale?”, ma una molto meno spettacolare e infinitamente più importante:

“Quali elementi mi permettono di verificare che funzioni davvero?”

“Commercialista Moderno e di Successo”

Edizione 2026, completamente riscritta
  • Scopri i servizi e le specializzazioni più fruttuose al giorno d'oggi
  • Scopri come sfruttare la AI nella consulenza strategica
  • Impara a diventare indispensabile ed insostituibile per il tuo cliente
Libro in PDF di 285 pagine.
Scaricalo ora.
Caricamento in Corso...
Richiesta Inviata con Successo !
Controlla la tua casella e-mail.
Con l'invio del presente modulo dichiaro di aver letto l'informativa privacy ed autorizzo il Titolare a rispondermi per quanto espresso al punto a & b dell'informativa privacy

Categorie

logo strumenti commercialista - bianco
WINtheBANK s.r.l.
Novara
CF/PI 02500460031 - REA/NO 240200
Capitale Sociale: 10'000€
Pec: wtb@pec.it
Commercialista, vuoi scoprire altri articoli su come dialogare al meglio con gli imprenditori ?
Leggi altri articoli sul sito WINtheBANK - La Business School per Commercialisti
Realizzato da Formula Agile