Nei corridoi di Princeton, la mente umana ha ispirato il deep learning
Quando Fei-Fei Li arrivò a Princeton nel gennaio del 2007 come docente assistente, le fu assegnato un ufficio al secondo piano dell’edificio di informatica. Il suo vicino era la linguista Christiane Fellbaum. Apparentemente sembravano operare in ambiti lontani — Li concentrata sulla visione artificiale, Fellbaum su WordNet e la semantica — ma tra loro nacque un’intesa intellettuale che avrebbe cambiato il corso dell’IA.
Li e Fellbaum erano accomunate da un interesse profondo: capire come la mente umana organizza e richiama concetti. Secondo Li, volevano “mappare il modo in cui la mente concettualizza il mondo”. Fellbaum, che aveva dedicato decenni allo sviluppo di WordNet — un database semantico con oltre 145.000 parole inglesi — fu per Li una fonte di ispirazione.
Affascinata dalla struttura concettuale di WordNet, Li decise di applicarne l’ordine alla visione computazionale: il suo progetto ImageNet avrebbe abbinato migliaia di immagini a ciascuna categoria lessicale, costruendo così un enorme dataset visivo. Lo scopo era ambizioso: per ogni categoria (come “gatto”, “albero”, “automobile”) raccogliere immagini annotate che descrivessero oggetti reali, in contesti variabili, consentendo a algoritmi di apprendere come riconoscerli.
All’epoca, nessuno dei tre elementi fondamentali del deep learning — algoritmi neurali robusti, hardware potente e dati ben organizzati — era ancora maturo. Li sosteneva una visione “all’antica scuola”: come un bambino che osserva molte immagini prima di riconoscerle, un sistema di visione artificiale ha bisogno di migliaia di esempi per imparare a generalizzare.
Ma come trasformare quell’idea in realtà, con risorse limitate? A Princeton Li trovò un ambiente fertile: l’università favoriva i giovani docenti nel pensare in grande. E tra i suoi alleati ci fu il ricercatore Kai Li, che aiutò nella gestione dei sistemi e dell’archiviazione dati, e lo studente Jia Deng, poi primo autore del primo lavoro su ImageNet pubblicato nel 2009.
Nel 2010, Li e il suo team completarono il dataset con oltre 14 milioni di immagini annotate. Insieme lanciarono una competizione: chi avesse costruito il miglior modello di riconoscimento visivo su ImageNet avrebbe ottenuto visibilità e confronto pubblico. Nei primi anni non emerse nulla di rivoluzionario, finché nel 2012 un gruppo dell’Università di Toronto vinse con un modello deep learning chiamato **AlexNet**, riproponendo le reti neurali in modo efficace. Quel successo segnò la rivoluzione del deep learning.
Oggi il deep learning è onnipresente: riconoscimento facciale, suggerimenti musicali, assistenti vocali, raccomandazioni sui social—all’interno di ciascuno di questi sistemi c’è una tecnologia che deriva da quella intuizione originaria. Ma il valore di ImageNet non sta solo nella praticità: ha mostrato che, con dati ben strutturati e organizzati, le reti neurali potevano realmente “vedere” e discriminare il mondo.
Tuttavia, la mente umana rimane ancora al centro delle sfide: oggi gli scienziati si interrogano su come modellare l’intelligenza artificiale in modo che rispecchi i processi cognitivi reali e operi per il bene comune. Piuttosto che un punto d’arrivo, ImageNet e WordNet appaiono come pietre miliari di un percorso ancora in corso: l’intelligenza artificiale ha bisogno dell’ispirazione del cervello umano tanto oggi quanto ieri.
Fonte originale: link