La startup francese Kog sta spingendo i confini delle prestazioni dell'intelligenza artificiale con l'obiettivo di migliorare significativamente la velocità dell'inferenza del grande modello linguistico (LLM) utilizzando unità di elaborazione grafica convenzionali (GPU). Gli ultimi sforzi della società si concentrano sull'ottimizzazione delle GPU esistenti del data center, come AMD MI300X e Nvidia H200, per fornire un'elaborazione AI più veloce ed efficiente senza richiedere hardware specializzato.
Kog ha attirato l'attenzione all'inizio di quest'anno dopo aver mostrato un prototipo che ha dimostrato una decodifica a singola richiesta estremamente veloce su GPU standard di livello enterprise. La dimostrazione ha utilizzato un piccolo modello costruito su misura chiamato Laneformer 2B, che ha raggiunto un tasso di token al secondo di 3.000. Tuttavia, la scalabilità di questi risultati a LLM più grandi rimane una sfida. Nonostante ciò, l'amministratore delegato di Kog, Gaël Delalleau, ritiene che i principi sottostanti possano essere applicati a modelli più complessi, sbloccando potenzialmente miglioramenti di prestazioni molto maggiori.
Questi includono professionisti che si affidano a strumenti di IA per flussi di lavoro critici, così come sviluppatori che creano contenuti interattivi come videogiochi e applicazioni mobili. Kog mira a fornire una soluzione che consenta a questi utenti di generare risultati più rapidamente, aumentando così la produttività e la redditività. Delalleau ha sottolineato che mentre l'attuale mercato per l'inferenza AI è ancora in evoluzione, c'è una chiara necessità di migliori prestazioni.
Di conseguenza, Kog ha dato la priorità allo sviluppo di metodi per accelerare la formazione e la distribuzione di modelli più grandi, in linea con le richieste osservate sul campo. L'approccio di Kog è diverso da quello di altre aziende che lavorano su problemi simili. A differenza di ZML, un'altra startup francese che offre software hardware-agnostico per inferenze veloci su diverse architetture di chip, Kog si concentra più profondamente sulle ottimizzazioni specifiche per GPU. Delalleau ha confrontato la strategia della startup con quella del laboratorio Hazy Research dell'Università di Stanford, che enfatizza anche la massimizzazione delle prestazioni della GPU attraverso analisi dettagliate e innovazione software.
Delalleau porta una prospettiva unica al tavolo, plasmata dal suo background accademico e professionale. Dopo aver studiato fisica dello stato solido all'École Polytechnique francese, in seguito ha lavorato nella sicurezza informatica offensiva, comunemente chiamata hacking a cappello bianco. Questa esperienza gli ha instillato una mentalità incentrata sulla comprensione dei sistemi fondamentali e sul loro sfruttamento creativo per raggiungere obiettivi specifici. La sua carriera nella sicurezza informatica, inclusa la partecipazione al concorso DEFCON Capture The Flag (CTF) come quattro volte finalista, gli ha insegnato a fare ingegneria inversa di tecnologie a basso livello, fino al linguaggio di assemblaggio e al codice binario.
Questo set di competenze ha influenzato il modo in cui Kog si avvicina alla sua ricerca e sviluppo, enfatizzando l'esplorazione meticolosa di ogni nuova architettura GPU per estrarre le massime prestazioni. Nonostante il potenziale promettente della tecnologia di Kog, il percorso da percorrere è impegnativo. L'ottimizzazione delle prestazioni per ogni nuova generazione di GPU richiede test e raffinamenti approfonditi, che spesso richiedono diverse settimane o addirittura mesi per dispositivo. Questo processo è sia laborioso che altamente tecnico, riflettendo la profondità dell'esperienza necessaria per spingere i limiti dell'hardware convenzionale. Mentre Kog continua a perfezionare le sue tecniche, le implicazioni più ampie per l'industria dell'IA rimangono da vedere.
Se avrà successo, la startup potrebbe offrire un'alternativa praticabile ai chip AI specializzati che attualmente dominano il mercato, fornendo alle aziende un mezzo più flessibile ed economico per migliorare le loro capacità di IA.
★
Manteniamo le notizie oneste.
ObjectiveNews è finanziato dai lettori e senza pubblicità: ti mostriamo il bias invece di nasconderlo. Sostieni il giornalismo indipendente per 4 €/mese.
Diventa sostenitore