AI21 Labs ha ottenuto una riduzione dell'83% nei tempi di avvio dei workload AI adottando Google Cloud AI Hypercomputer con orchestrazione GKE e il scheduler open-source Kueue. I job di training ad alta priorità, prima bloccati fino a 72 ore, ora partono in 12 ore. Gli interventi manuali di scheduling sono scesi da circa 20 a settimana a zero.
Il problema: frammentazione GPU e contesa tra team
Prima della soluzione, AI21 negoziava la capacità GPU manualmente via Slack. Con il cluster al massimo dell'utilizzo, ogni richiesta diventava una trattativa. La frammentazione delle risorse — GPU libere sparse in pezzi troppo piccoli per job di grandi dimensioni — causava deadlock e "zombie job", workload parzialmente ammessi senza dove eseguire.
La soluzione: Kueue su GKE con AI Hypercomputer
Kueue si è distinto per semplicità e integrazione nativa con Kubernetes, senza sostituire componenti core. Accoppiato ad AI Hypercomputer, ha permesso di:
- Accodare e pianificare automaticamente ogni workload, dal debug pod al training multi-nodo
- Usare Spot VMs e Dynamic Workload Scheduler per elasticità senza intervento manuale
- Attivare Admission Fair Sharing per equità tra team senza preemption
- Sfruttare Topology Aware Scheduling per rifiutare job che non entrano in un singolo nodo
Risultati e impatto per PMI e MSP
Per chi gestisce infrastrutture AI per conto di clienti, il caso AI21 offre un modello concreto: utilizzo riservato al 100%, costi invariati, ma tempo del team liberato da dispute su risorse a favore dell'innovazione. La frammentazione è scesa dal 15% all'8% e il problema dei job fantasma è eliminato.
Fonte: Google Cloud Blog, 2 ottobre 2026