Software Gestionale

Automazione dello scheduling GPU: come AI21 ha tagliato i tempi di attesa da 72 ore a 12 minuti

AI21 Labs ha automatizzato la gestione delle GPU su Google Kubernetes Engine con Kueue, eliminando 20 interventi manuali settimanali e riducendo i tempi di attesa dei job da 72 ore a 12 minuti. La fragmentation è calata dal 15% all'8%.

Rack server in un data center con luci blu e verdi, connessioni di rete astratte tra i server, atmosfera futuristica di infrastruttura automatizzata

La gestione manuale delle risorse GPU su cluster Kubernetes affollati è un problema reale che rallenta i team di sviluppo e spreca ore preziose. La storia di AI21 Labs su Google Cloud è un caso studio illuminante su come l'automazione possa trasformare completamente un flusso di lavoro infrastrutturale.

Prima dell'automazione, il team di AI21 gestiva la capacità GPU tramite negoziati manuali su Slack. Ogni richiesta di risorse per un training multi-nodo diventava una trattativa: i lead tecnici passavano ore a mediare dispute di calcolo, mentre i job ad alta priorità restavano bloccati fino a 72 ore in attesa di capacità contigua sufficiente.

Il problema non era solo la contesa, ma anche la fragmentation: capacità tecnicamente libera ma frammentata in pezzi troppo piccoli per job di grandi dimensioni, un problema di bin-packing che nessuna negoziazione poteva risolvere.

La soluzione è arrivata con Kueue, un batch scheduler open source nativamente integrato con GKE, abbinato ad AI Hypercomputer. Kueue ha permesso di codificare logiche di scheduling automatiche che prima richiedevano intervento umano: ammissione equa tra team, scheduling consapevole della topologia fisica del cluster, e scalatura elastica della capacità quando quella riservata si esaurisce.

I risultati sono stati immediati e misurabili:

  • Interventi manuali ridotti da circa 20 a settimana a zero
  • Tempi di attesa per job ad alta priorità da 72 ore a 12 minuti
  • Fragmentation del cluster dal 15% all'8%
  • Eliminazione completa del problema dei "zombie job"
  • Canale Slack #gpu-resources archiviato

Per i MSP e le PMI che gestiscono carichi di lavoro AI su Kubernetes, il messaggio è chiaro: l'automazione dello scheduling non riduce solo i costi operativi, ma libera il team per attività a maggiore valore come l'iterazione sui modelli e lo sviluppo sperimentale. Il costo totale della flotta riservata non è cambiato — l'ottimizzazione è stata sulla utilizzazione al 100% voluta — ma il dove il tempo delle persone viene impiegato è radicalmente diverso.

La partnership con Google ha inoltre permesso ad AI21 di diventare design partner per il team Kueue, contribuendo con requisiti di produzione reale allo sviluppo del tool, come l'Admission Fair Sharing che riordina la coda di ammissione favorendo team con storico utilizzo inferiore, senza disruptare job già in esecuzione.

Articoli correlati