Sei alla tua scrivania nel bel mezzo della mattinata e ricevi un messaggio urgente, seguito pochi istanti dopo da una telefonata. Dall’altra parte della cornetta c’è l’Amministratore Delegato o il legale di fiducia dell’azienda.
Il timbro vocale è inconfondibile, la cadenza è la solita, il respiro e le pause sono esattamente i suoi. Ti ordina di sbloccare immediatamente una transazione milionaria relativa a un’acquisizione riservata, chiedendo la massima discrezione. Senza esitare, scavalchi la procedura standard, accedi al terminale e autorizzi l’uscita dei fondi.
Se in quel momento non ricordi il caso Tecnimont, la conseguenza prevedibile è ancorare i controlli di sicurezza alla fiducia nei sensi, scambiando un’onda sonora familiare per un certificato di autenticazione.
La facilità con cui le frodi basate sulla clonazione vocale aggirano i processi aziendali si spiega incrociando l’euristica dell’autorità (Authority Bias, Cialdini, 1984) con la teoria della verità predefinita (Truth-Default Theory, Levine, 2014). La mente umana è evolutivamente programmata per credere che l’interlocutore stia dicendo il vero, specialmente quando i dati sensoriali di base (in questo caso, il riconoscimento biometrico della voce) confermano l’identità attesa.
Quando il Sistema 1 (Kahneman, 2011) elabora una voce nota, riconosce immediatamente il pattern familiare e disattiva i campanelli d’allarme analitici del Sistema 2. L’errore cognitivo consiste nel trattare la voce come una prova crittografica irripetibile.
Nel momento in cui l’intelligenza artificiale generativa riesce a sintetizzare fedelmente il timbro, l’infezione non colpisce il server aziendale, ma dirotta direttamente il sistema percettivo del dipendente, spingendolo ad abbassare spontaneamente il ponte levatoio.
Oltre a Fideuram, i magistrati della Procura di Milano hanno accertato che la medesima ondata di frodi basate su voice cloning e vishing (phishing vocale) ha preso di mira altri due istituti di credito: Banca Ifis e una Bcc del Milanese.
I tre casi presentano lo stesso modus operandi: messaggi ingannevoli seguiti da telefonate in cui l’intelligenza artificiale riproduce fedelmente la voce di manager di spicco o di legali di fiducia per superare i controlli interni.
L’attaccante non ha sprecato tempo a decifrare password o aggirare firewall: ha “semplicemente” campionato la voce della leadership aziendale (magari da video pubblici o interviste) per impartire ordini a dipendenti addestrati all’ubbidienza. Ma la questione è che la truffa dei deepfake sembra essere diventata tecnicamente più semplice da realizzare.
Per il CISO, questo scenario certifica il collasso del perimetro fiduciario basato sul riconoscimento umano. Se l’infrastruttura permette che un ordine verbale scavalchi i vincoli sistemistici, la formazione sul phishing classico non servirà a nulla contro un audio iperrealistico.
La sterilizzazione del rischio richiede l’integrazione di architetture di processo indipendenti dall’identità percepita:
Al posto del “numero di dipendenti formati sui rischi dell’IA” (una classica metrica di vanità, inefficace di fronte al condizionamento biologico) il KPI comportamentale decisivo diventa il tasso di challenge sulle disposizioni date a voce, meglio ancora se da parte di figure apicali.
Questo indicatore, che è un po’ antipatico, ma può essere implementato nelle simulazioni di phishing, misura quante volte il personale ha avuto la freddezza di bloccare un ordine verbale proveniente dai vertici (veri o presunti) per applicare il protocollo di verifica tecnica indipendente.
La metrica che ho appena proposto è tipica del Cybercognitivismo: l’allenamento emotivo. Tuttavia, l’errore non risiede nel dipendente che crede alle proprie orecchie, bensì in un’organizzazione che fa dipendere l’integrità di decine di milioni di euro dalla capacità dell’apparato uditivo di distinguere un essere umano da una rete neurale.
Il Manuale CISO Security Manager (per la preparazione all’esame CISSP e per la pratica quotidiana)[1] affronta la gestione delle frodi avanzate nei domini dell’Asset Security e dell’Identity and Access Management.
Il modello richiede l’applicazione di controlli tecnici rigorosi per compensare la fisiologica fallibilità della percezione umana, sganciando l’autorizzazione all’azione dal semplice riconoscimento del volto o della voce.
E se il grande capo ti chiama al telefono per chiederti di spostare 24 milioni di euro con la massima urgenza, segui la procedura alla lettera. Potresti scoprire che a chiamarti non è il tuo CEO in crisi mistica, ma uno script Python.