Negli ultimi due anni il costo effettivo dell’IA aziendale è cambiato. Non in teoria, ma nella pratica, nelle reali procedure di appalto, quando le organizzazioni cercano di trasformare un proof of concept in un’implementazione in produzione.
All'inizio di questo mese, uno dei nostri team di sviluppo, mentre lavorava alla realizzazione di una piattaforma RAG aziendale, ha cercato di scalare una pipeline RAG sull'attuale infrastruttura cloud standard, ma si è subito scontrato con i limiti di allocazione delle GPU. Questo ci porta ad approfondire il crescente utilizzo di Nerocloud nelle infrastrutture di IA aziendali.
La domanda di IA è evidente. Dalle applicazioni simili a ChatGPT e dagli agenti IA aziendali ai sistemi RAG, alla messa a punto dei modelli e alla visione artificiale su larga scala, le organizzazioni stanno investendo massicciamente nelle capacità di IA. La sfida più grande spesso emerge dietro le quinte. Man mano che questi carichi di lavoro passano dalla fase sperimentale a quella produttiva, molti team si trovano limitati dalla carenza di GPU, dai lunghi tempi di provisioning e dai costi del cloud che continuano a salire. L'implementazione dell'intelligenza artificiale su larga scala non consiste più solo nella creazione di modelli, ma anche nel garantire l'infrastruttura necessaria per supportarli in modo efficiente.
AWS, Azure e Google Cloud non sono stati progettati per questo. Sono stati progettati per tutto, il che significa che non sono stati ottimizzati per nulla in particolare. Per colmare questa lacuna è emersa una nuova categoria di fornitori. Si chiamano NeoClouds e stanno comparendo sempre più spesso nelle liste dei candidati prescelti per le infrastrutture aziendali di alto livello.
Cosa sono i NeoClouds?
NeoCloud è un provider di servizi cloud la cui attività si concentra interamente sul calcolo GPU per l'intelligenza artificiale e i carichi di lavoro ad alte prestazioni. Non si tratta di una linea di prodotti all'interno di una piattaforma più ampia, ma dell'intera azienda.
Si concentrano principalmente su:
- Addestramento dei modelli di intelligenza artificiale
- Inferenza AI su larga scala
- Gestione dell'infrastruttura GPU
- Implementazione di modelli linguistici su larga scala
- Applicazioni di intelligenza artificiale generativa
A differenza degli hyperscaler, che gestiscono ogni tipo di carico di lavoro immaginabile e considerano il noleggio di GPU come uno dei tanti SKU disponibili, i NeoCloud sono progettati appositamente per l'IA. Questa differenza è evidente in ogni livello dello stack.
Caratteristiche principali:
- Infrastruttura incentrata sulla GPU – qui viene data priorità all’hardware più recente, che non viene considerato come un elemento secondario
- Reti ottimizzate tramite intelligenza artificiale – InfiniBand e le interconnessioni ad alta larghezza di banda sono di serie, non aggiornamenti opzionali
- Archiviazione ad alte prestazioni – progettato per alimentare i cluster di GPU, non per soddisfare modelli generali di archiviazione di oggetti
- Accesso più rapido alle GPU di ultima generazione – I fornitori competono sulla novità dell’hardware; questo è il loro principale elemento di differenziazione
- Team di assistenza specializzati nell'intelligenza artificiale – ingegneri che abbiano familiarità con la formazione distribuita, i vLLM e i guasti multi-GPU, non con la gestione generica dei ticket nel cloud
Perché stanno emergendo i NeoClouds
La causa immediata è chiara: la domanda di risorse di calcolo per l'IA ha superato ciò che gli hyperscaler sono in grado di fornire.
I carichi di lavoro che determinano tale domanda includono:
- Assistenti in stile ChatGPT e copiloti aziendali
- Sistemi RAG interrogazione di grandi archivi interni di documenti
- Ottimizzazione del modello su dati proprietari
- Agenti di intelligenza artificiale aziendali esecuzione di flussi di lavoro in più fasi
- Sistemi di visione artificiale nel settore della vendita al dettaglio, della logistica e della produzione
La realizzazione di nuovi data center hyperscale richiede dai tre ai cinque anni. I tempi di adozione dell'intelligenza artificiale si misurano in trimestri. Questo divario non si sta colmando rapidamente.
Di conseguenza, le organizzazioni che gestiscono carichi di lavoro significativi nel campo dell'intelligenza artificiale si trovano regolarmente ad affrontare:
- Tempi di approvvigionamento lunghi – richieste di quote, liste d'attesa e limiti di capacità relativi alle GPU di cui hanno effettivamente bisogno
- Costi imprevedibili – i prezzi delle GPU on-demand, pensati per brevi picchi di calcolo, non reggono in presenza di carichi prolungati di addestramento o inferenza
- Disponibilità limitata – alcune famiglie specifiche di GPU, in particolare quelle di ultima generazione, spesso non sono disponibili su larga scala tramite i canali cloud generici
- Complessità operativa – Le piattaforme generiche richiedono un notevole lavoro di ingegnerizzazione per essere configurate in modo da supportare modelli di rete e di archiviazione specifici per l'intelligenza artificiale
NeoClouds esiste proprio perché questi problemi sono di natura strutturale, non temporanea.
NeoClouds vs fornitori di servizi cloud tradizionali
| Caratteristica | Cloud tradizionale (AWS, Azure, GCP) | NeoClouds |
|---|---|---|
| Obiettivo principale | Carichi di lavoro generici nel cloud | Carichi di lavoro relativi all'intelligenza artificiale e alle GPU |
| Disponibilità delle GPU | Condiviso tra i servizi | GPU-first |
| Velocità di implementazione | Moderato | Più veloce per i carichi di lavoro di intelligenza artificiale |
| Competenze nel campo dell'intelligenza artificiale | Assistenza generale per il cloud | Team specializzati in IA |
| Modello dei costi | Ampia gamma di prezzi per tutti i servizi | Prezzi basati sull'intelligenza artificiale, per singola GPU |
| Aggiornamento dell'hardware | Equilibrato tra le diverse linee di prodotti | Priorità alle GPU più recenti |
| Opzioni sovrane / regionali | Disponibile solo in alcuni mercati | In crescita, soprattutto nel Regno Unito e in Europa |
Il punto fondamentale non è che i NeoCloud siano migliori degli hyperscaler, ma che siano ottimizzati per un tipo di attività diverso. Per l’hosting di applicazioni generiche, le pipeline di dati o le infrastrutture SaaS, gli hyperscaler rimangono la scelta predefinita più sensata. Per carichi di lavoro di IA intensivi in termini di GPU e prolungati, il ragionamento spesso va nella direzione opposta.
I vantaggi di NeoClouds
Accesso più veloce alla GPU
Le organizzazioni possono disporre di GPU ad alte prestazioni senza dover sottostare a sistemi di quota o attendere una capacità che potrebbe non essere disponibile nella regione di loro interesse. Per i team che devono addestrare un modello o lanciare un prodotto, questa differenza in termini di tempo è significativa.
Infrastruttura ottimizzata dall'intelligenza artificiale
L'infrastruttura è stata realizzata appositamente per:
- Addestramento di modelli su larga scala su cluster multi-GPU
- Servizio di inferenza a bassa latenza
- Ottimizzazione dei modelli open source su set di dati proprietari
- Formazione distribuita che richiede una comunicazione rapida tra le GPU
Eseguire carichi di lavoro basati sull'intelligenza artificiale su un'infrastruttura ottimizzata per l'elaborazione generale significa dover aggirare dei vincoli che non dovrebbero esistere.
Una gestione più efficiente per carichi di lavoro costanti
Molte organizzazioni ritengono che NeoClouds sia notevolmente più conveniente rispetto alle tariffe on-demand degli hyperscaler per i carichi di lavoro in esecuzione continua. Il risparmio dipende dall’allineamento delle strutture di impegno ai modelli di utilizzo effettivi: è l’utilizzo della GPU il dato che conta, non la tariffa oraria indicata.
Supporto nativo per l'IA
Team di assistenza che comprendano le modalità di malfunzionamento concrete della formazione distribuita: perché un’elaborazione si blocca al 98% di completamento, come ottimizzare vLLM in termini di throughput rispetto alla latenza, quale topologia InfiniBand influisca sul parallelismo del modello. Tale competenza è raramente disponibile attraverso i canali di assistenza cloud generici.
Tipi di fornitori NeoCloud
NeoCloud ottimizzati dal punto di vista energetico
Esempi: Crusoe, IREN
Incentrato su infrastrutture di intelligenza artificiale sostenibili, collocate in loco insieme a fonti energetiche rinnovabili o inutilizzate. Adatto alle organizzazioni con impegni in materia di emissioni di carbonio o con obblighi di rendicontazione ESG.
NeoClouds: una soluzione pensata per gli sviluppatori
Esempi: DigitalOcean, Hot Aisle
Progettato per garantire un'implementazione rapida e massimizzare la produttività degli sviluppatori. Cicli di provisioning più brevi, API più snelle e un modello di prezzi trasparente. Più adatto ai team che devono rilasciare rapidamente funzionalità di intelligenza artificiale rispetto alle organizzazioni che eseguono sessioni di addestramento su scala di petabyte.
Fornitori di IA incentrati sulla scalabilità
Esempi: CoreWeave, TensorWave
Progettato per l'addestramento e l'inferenza dell'IA su larga scala. CoreWeave è il leader di questa categoria, con un fatturato annuo che supera i $5bn e che annovera tra i propri clienti Microsoft, Meta e OpenAI. Questi fornitori operano su una scala paragonabile a quella degli hyperscaler, pur mantenendo un focus specifico sulle GPU.
Cloud di intelligenza artificiale aziendali e sovrani
Esempi: Core42 (Emirati Arabi Uniti/Europa), IBM
Progettato per la conformità, la governance e i settori regolamentati. Core42 è attualmente l’azienda più attiva in questo ambito: un’azienda sostenuta da G42 che ha recentemente raccolto $550M da HSBC, ha stretto partnership con Red Hat e Microsoft Azure per un’infrastruttura “sovereign-by-design” e serve il settore pubblico, la difesa e i settori regolamentati in tutti gli Emirati Arabi Uniti – con una sede europea ora stabilita a Dublino. La sua piattaforma di controlli sovrani, Insight, offre alle organizzazioni regolamentate controlli tecnici e normativi sulla classificazione dei dati, sulla residenza e sulla governance dei carichi di lavoro dell’IA. Per le organizzazioni che operano in Medio Oriente o nei settori regolamentati europei, Core42 rappresenta un’alternativa sempre più credibile alle offerte sovrane degli hyperscaler. La domanda a cui risponde non è solo “dove si trovano i dati”, ma «chi governa l’intera pipeline di IA, compresi i pesi dei modelli, gli input di inferenza e le tracce di audit».”
Chi dovrebbe prendere in considerazione NeoClouds?
Startup nel settore dell'intelligenza artificiale
- Sviluppo di prodotti nativi per l'IA che richiedono una disponibilità costante delle GPU
- Ottimizzazione dei modelli open source (Llama, Gemma, Mistral) su dati proprietari
- Implementazione su larga scala di agenti di intelligenza artificiale o servizi di inferenza
- Quando i prezzi degli hyperscaler non si adattano all’economia di scala delle fasi iniziali
Aziende SaaS
- Aggiunta di funzionalità di intelligenza artificiale che richiedono un'infrastruttura di inferenza affidabile e scalabile
- Gestione di motori di raccomandazione o sistemi di personalizzazione con elevati requisiti di throughput
- Sviluppare funzionalità di intelligenza artificiale che debbano adattarsi all'utilizzo del prodotto, non ai cicli delle quote cloud
Imprese
- Assistenti IA interni che effettuano ricerche in ampie basi di conoscenza
- Sistemi di gestione delle conoscenze con flussi RAG che coprono diversi anni di documentazione
- Piattaforme di assistenza clienti basate sull'intelligenza artificiale e in tempo reale Agenti vocali basati sull'intelligenza artificiale con requisiti di latenza rigorosi dipendono dall'infrastruttura GPU
- Qualsiasi organizzazione in cui la residenza dei dati, la conformità al GDPR del Regno Unito o le normative specifiche del settore rendano indispensabile un’infrastruttura GPU sovrana
Il punto di vista del nostro CTO:
Come molti dirigenti aziendali hanno constatato, la sfida attuale non consiste più nel decidere se investire nell’intelligenza artificiale, ma nel garantire l’infrastruttura cloud necessaria per supportare in modo efficiente le iniziative di intelligenza artificiale e favorire la crescita aziendale.
Come NeoClouds si inserisce nell'architettura AI aziendale
Uno stack di IA per la produzione basato sull'infrastruttura NeoCloud si presenta in genere così:
Livello delle applicazioni
Assistenti interni basati sull'intelligenza artificiale · Addetti all'assistenza clienti · Copiloti per le vendite e le risorse umane · Strumenti di gestione delle conoscenze
Livello dei modelli
GPT-4o (tramite API) · Llama 3, Gemma, DeepSeek, Qwen (autogestiti) · Modelli proprietari ottimizzati
Livello dei framework
PyTorch / TensorFlow · ONNX · vLLM / Triton
Livello infrastrutturale
Piattaforma GPU NeoCloud · Kubernetes · Reti InfiniBand o RoCE ad alta velocità · Monitoraggio e osservabilità basati sull'intelligenza artificiale
NeoCloud si trova alla base di tale stack, ma non è l’unico componente. L’orchestrazione, il monitoraggio, l’integrazione con i sistemi esistenti e il livello applicativo che si trova al di sopra di tutto ciò richiedono un lavoro di ingegneria distinto dalla scelta dell’infrastruttura stessa, ma almeno altrettanto importante.
Cosa significa questo per le aziende
Gartner stima che entro il 2030 i fornitori di NeoCloud deterranno circa 20% di un mercato del cloud per l'intelligenza artificiale del valore di $267bn. Gli stessi hyperscaler – Microsoft, Meta, Google – stanno già acquistando capacità NeoCloud perché non riescono a costruire data center con la rapidità necessaria a soddisfare la propria domanda.
Per le aziende che stanno valutando iniziative nel campo dell’intelligenza artificiale, la domanda concreta non è “dovremmo utilizzare un NeoCloud?”, bensì “quali carichi di lavoro devono essere gestiti su un’infrastruttura specializzata e di cosa ha bisogno la nostra architettura per supportarli?”.”
Le organizzazioni dovrebbero valutare se le piattaforme NeoCloud offrano vantaggi nei seguenti ambiti:
- Costo – costo totale a livelli di utilizzo realistici, non la tariffa nominale
- Prestazioni – velocità di trasmissione e latenza in condizioni di carico effettivo dell'applicazione
- Scalabilità – una capacità in grado di crescere di pari passo con il carico di lavoro senza vincoli di quota
- Disponibilità delle GPU – in particolare per specifiche famiglie di GPU necessarie su larga scala
- Velocità di implementazione dell'IA – tempo che intercorre tra la fase di progettazione e quella di produzione
Il ruolo di Carmatec si colloca a livello di architettura e integrazione: caratterizzazione dei carichi di lavoro prima della decisione di acquisto, orchestrazione e DevOps per l’esecuzione portabile dei carichi di lavoro, nonché l’ingegneria applicativa (pipeline RAG, servizi di inferenza, framework di agenti) che si colloca al di sopra della parte computazionale. L’infrastruttura costituisce la base. Farla funzionare per risolvere un problema aziendale specifico è la parte più complessa.
Conclusione
NeoClouds rappresenta un cambiamento significativo nel modo in cui viene fornita l'infrastruttura per l'IA. Con l'accelerarsi dell'adozione dell'IA, le organizzazioni guarderanno sempre più oltre i fornitori di cloud tradizionali, orientandosi verso piattaforme progettate specificamente per i carichi di lavoro nativi per l'IA.
Per le aziende che sviluppano applicazioni di intelligenza artificiale, agenti IA, sistemi RAG o piattaforme di inferenza su larga scala, NeoClouds può rappresentare un percorso più rapido ed economico verso la messa in produzione rispetto al dover continuare a fare i conti con i limiti delle infrastrutture cloud generiche.
Se state valutando le opzioni relative all'infrastruttura di intelligenza artificiale per la vostra organizzazione, contatta il nostro team per valutare le vostre esigenze in termini di carico di lavoro prima di scegliere un fornitore.