Software Gestionale

Come Yahoo ha ridotto del 85% i fallimenti di provisioning con VM flessibili su Google Cloud

Yahoo ha implementato le VM flessibili su Managed Service for Apache Spark per automatizzare la gestione dei vincoli di capacità. Il risultato: meno interventi manuali e pipeline dati sempre attive.

Server rack in un data center moderno con luci blu illuminate

La gestione automatizzata dell'infrastruttura cloud è una priorità per le aziende che elaborano grandi quantità di dati in tempo reale. Yahoo, colosso globale che connette centinaia di milioni di utenti a piattaforme di finanza, sport e intrattenimento, ha affrontato una sfida comune: le configurazioni a macchina virtuale fissa creano sistemi rigidi che, quando una specifica configurazione incontra vincoli di capacità regionale, possono bloccare il provisioning dei cluster e rallentare le pipeline dati critiche.

Il problema: provisioning rigido e interventi manuali

Nell'ambiente di analytics ad alte prestazioni di Yahoo, i carichi di lavoro devono funzionare in modo continuo e ad alta velocità. Configurare i cluster con un singolo tipo di macchina virtuale fissa in una zona specifica introduce vincoli quando si verificano fluttuazioni di capacità zonale, con un potenziale impatto negativo sul provisioning dei cluster. In passato, gestire queste variazioni richiedeva logiche di retry personalizzate oppure interventi manuali da parte dei team operativi.

La soluzione: VM flessibili e placement automatico tra zone

Yahoo ha adottato le VM flessibili nei cluster di Managed Service for Apache Spark per assorbire automaticamente le fluttuazioni delle risorse. Il sistema definisce una lista ordinata di forme di VM accettabili, permettendo di cercare dinamicamente le zone regionali disponibili e mantenere l'esecuzione delle pipeline senza intervento manuale. Per cercare capacità su un'intera regione, i team hanno abilitato il placement automatico tra zone.

Regole per configurare i cluster flessibili

L'implementazione richiede alcune scelte progettuali chiave:

  • Abilitare il placement automatico tra zone: è necessario passare una regione o una stringa di zona vuota affinché Managed Spark possa cercare capacità disponibile nell'intera regione.
  • Mantenere simmetria tra core e memoria: se il cluster usa autoscaling, tutti i tipi di macchina nell'elenco flessibile devono condividere un rapporto CPU-memoria simile per prevenire degradi delle prestazioni.
  • Allineare le proprietà dei componenti: Managed Spark calcola le proprietà di sistema in base a core e memoria. Quando si combinano forme di macchina diverse, potrebbero essere necessarie sovrascrizioni esplicite delle proprietà per mantenere l'allocazione delle risorse allineata.

I risultati: 85% in meno di fallimenti

I benefici per Yahoo sono stati misurabili fin da subito. Implementando le VM flessibili in Managed Service for Apache Spark, l'azienda ha ridotto i fallimenti di provisioning dei cluster dell'85%, quelli causati da esaurimenti di stock di capacità regionale. Questa configurazione flessibile permette all'infrastruttura dati di gestire automaticamente i vincoli di capacità e fornire le risorse con successo senza richiedere interventi manuali. Il risultato è un'esecuzione continua dei carichi di lavoro e l'eliminazione dei ritardi di elaborazione downstream nelle pipeline dati su larga scala.

Benefici strategici per l'infrastruttura cloud

Adottare uno stack di calcolo flessibile trasforma l'ambiente in un pool dinamico di risorse che si adatta alle esigenze operative. Spostandosi da configurazioni rigide con singolo tipo di macchina verso opzioni flessibili, le organizzazioni garantiscono ai propri carichi di lavoro l'accesso alle risorse di calcolo necessarie, indipendentemente dalle fluttuazioni di offerta. Questo approccio massimizza l'affidabilità e facilita l'ammodernamento dell'hardware, permettendo di dare priorità alle nuove generazioni di VM mantenendo i tipi precedenti come fallback affidabili.

Consigli pratici per MSP e consulenti IT

Per i professionisti IT che gestiscono infrastrutture cloud per i propri clienti, questa caso studio offre indicazioni utili:

  • Auditing dei carichi di lavoro: identificare le applicazioni legate a famiglie di VM specifiche o zone e mappare le alternative hardware disponibili.
  • Standardizzare le policy di risorse: definire famiglie di VM preferite e di fallback per i worker secondari.
  • Abilitare il placement automatico: utilizzare l'impostazione predefinita per abilitare il provisioning flessibile.
  • Allineare la strategia finanziaria: sfruttare i Flexible Committed Use Discounts per mantenere la prevedibilità dei costi quando i carichi di lavoro si spostano dinamicamente su tipi di macchina alternativi.

Questo approccio all'automazione infrastrutturale rappresenta un esempio concreto di come le tecnologie cloud moderne possano ridurre la complessità operativa e migliorare l'affidabilità dei servizi per i clienti finali.

Articoli correlati