Intelligenza Artificiale

AI21 riduce dell'83% i tempi di avvio workload AI con Google Cloud AI Hypercomputer

AI21 Labs taglia da 72 a 12 ore l'attesa per job di training su GPU, eliminando interventi manuali di scheduling. La chiave: Kueue su GKE con AI Hypercomputer.

Cluster GPU in un data center cloud con nodi illuminati che elaborano workload di intelligenza artificiale

AI21 Labs ha ottenuto una riduzione dell'83% nei tempi di avvio dei workload AI adottando Google Cloud AI Hypercomputer con orchestrazione GKE e il scheduler open-source Kueue. I job di training ad alta priorità, prima bloccati fino a 72 ore, ora partono in 12 ore. Gli interventi manuali di scheduling sono scesi da circa 20 a settimana a zero.

Il problema: frammentazione GPU e contesa tra team

Prima della soluzione, AI21 negoziava la capacità GPU manualmente via Slack. Con il cluster al massimo dell'utilizzo, ogni richiesta diventava una trattativa. La frammentazione delle risorse — GPU libere sparse in pezzi troppo piccoli per job di grandi dimensioni — causava deadlock e "zombie job", workload parzialmente ammessi senza dove eseguire.

La soluzione: Kueue su GKE con AI Hypercomputer

Kueue si è distinto per semplicità e integrazione nativa con Kubernetes, senza sostituire componenti core. Accoppiato ad AI Hypercomputer, ha permesso di:

  • Accodare e pianificare automaticamente ogni workload, dal debug pod al training multi-nodo
  • Usare Spot VMs e Dynamic Workload Scheduler per elasticità senza intervento manuale
  • Attivare Admission Fair Sharing per equità tra team senza preemption
  • Sfruttare Topology Aware Scheduling per rifiutare job che non entrano in un singolo nodo

Risultati e impatto per PMI e MSP

Per chi gestisce infrastrutture AI per conto di clienti, il caso AI21 offre un modello concreto: utilizzo riservato al 100%, costi invariati, ma tempo del team liberato da dispute su risorse a favore dell'innovazione. La frammentazione è scesa dal 15% all'8% e il problema dei job fantasma è eliminato.

Fonte: Google Cloud Blog, 2 ottobre 2026

#AI

Articoli correlati

Diagramma astratto di un'architettura a due livelli per memoria AI: cache veloce in primo piano e database relazionale sullo sfondo, colori blu e verde tecnologia
Intelligenza Artificiale

Memoria a lungo termine per agenti AI: architettura a due livelli con AlloyDB e Memorystore per Valkey

Google Cloud presenta un'architettura a due livelli per la memoria persistente degli agenti AI: Memorystore per Valkey come buffer di sessione a breve termine e AlloyDB AI per la memoria a lungo termine. L'approccio riduce i costi dei token fino al 70% e accelera i tempi di risposta dell'80%, mantenendo regole e vincoli aziendali intatti nel tempo.