Economia

Il costo nascosto degli agenti AI: la memoria operativa

Sistemi agentici e memoria operativa nell'intelligenza artificiale

In Breve

Qual è il costo principale degli agenti AI?
Il costo principale è legato alla gestione della memoria operativa, oltre ai costi dei modelli e dei token.
Come influisce la memoria operativa sui costi?
La memoria operativa può aumentare significativamente i costi, specialmente nei sistemi multi-agente.
Quali sono i principi per progettare la memoria degli agenti?
I principi includono capacità di scrittura concorrente, memoria condivisa e separazione tra memoria attiva e storica.

Il costo nascosto degli agenti AI: la memoria operativa

Lo sviluppo di sistemi agentici sta trasformando l’economia dell’intelligenza artificiale. Oltre ai costi legati ai modelli e ai token, è fondamentale considerare come la memoria operativa degli agenti influisca su costi, prestazioni e accuratezza, specialmente quando si scala il sistema.

A differenza delle prime applicazioni aziendali, che si basavano principalmente sul recupero di contesto per rispondere a richieste specifiche, gli agenti AI ora recuperano informazioni in modo dinamico. Aggiornano continuamente il proprio stato, eseguono chiamate a strumenti e trasferiscono contesto, rendendo le interazioni cicliche e persistenti. Ogni attività svolta genera uno stato memorizzato, il che implica che i costi di gestione della memoria possono aumentare significativamente.

Nei progetti di proof-of-concept, i costi possono sembrare inizialmente limitati all’accesso al modello, ai token e al retrieval. Tuttavia, nei sistemi multi-agente, la spesa tende ad aumentare con la complessità dei compiti. Analisi recenti mostrano differenze significative di costo tra progetti testuali e agentici, con i sistemi multi-agente che possono utilizzare un ordine di grandezza di token molto superiore rispetto a semplici chat.

Tra i fattori che contribuiscono all’aumento dei costi ci sono i loop dinamici, le chiamate a strumenti, i retry e i trasferimenti di contesto. Inoltre, è necessario mantenere la provenienza operativa per decisioni e condivisione tra agenti, il che complica ulteriormente la gestione dei costi.

Progettare un sistema di memoria per flotte di agenti richiede una chiara definizione dei livelli di servizio. È essenziale stabilire la velocità di accesso, chi può aggiornare e quali agenti devono condividere lo stato, oltre a determinare per quanto tempo le informazioni devono rimanere immediatamente disponibili. Tre principi emergono come prioritari in questo contesto:

  • Capacità di scrittura concorrente: È fondamentale garantire che il sistema possa crescere con il numero di agenti, evitando colli di bottiglia nelle operazioni di scrittura.
  • Memoria condivisa: Evitare copie ridondanti attraverso una memoria condivisa può ridurre i costi e le incoerenze, semplificando la gestione delle informazioni.
  • Separazione della memoria: È utile separare la memoria attiva, che richiede accesso frequente e rapido, dalla memoria storica, che può essere archiviata su storage meno costoso.

Le decisioni su come conservare le modifiche storiche, che si tratti di versioni complete, delta o snapshot periodici, influenzano direttamente lo spazio, i tempi di ricostruzione e i costi complessivi del sistema. Queste scelte tecniche determinano il modello economico del deployment e dovrebbero essere validate nelle fasi iniziali del progetto.

Anche con la riduzione dei prezzi dei modelli e i miglioramenti nell’inferenza, le implementazioni su larga scala continueranno a generare flussi di dati operativi da scrivere, condividere, proteggere, recuperare e conservare. La sostenibilità economica di tali sistemi dipenderà sia dal numero di agenti coinvolti sia dal volume di memoria mantenuta per ciascun task.

redazione

Autore di Azienda Italia.

Leggi l’articolo successivo