Tecnologia

Hack The Box lancia test per gli agenti AI di cybersecurity

Hack The Box presenta AI Range Enterprise Edition: test in ambienti realistici per valutare gli agenti di cybersecurity e le competenze di chi li supervisiona.

06 ott 2026 4 min lettura A cura di Redazione
Hack The Box lancia test per gli agenti AI di cybersecurity
Condividi

Hack The Box ha presentato AI Range Enterprise Edition, portando ai team di sicurezza delle imprese la propria piattaforma per verificare e misurare l’efficacia degli agenti AI. L’offerta permette alle organizzazioni di valutare se gli agenti siano in grado di svolgere i compiti di cybersecurity assegnati e di decidere quali attività affidare loro. La valutazione è costruita intorno ai ruoli operativi: l’obiettivo è verificare la capacità di eseguire un lavoro specifico nelle condizioni in cui quel lavoro viene richiesto.

Il problema affrontato dall’azienda riguarda il passaggio dai benchmark all’impiego quotidiano. Le imprese valutano normalmente se una persona sappia svolgere il lavoro per cui è stata assunta, mentre gli agenti possono entrare nei team dopo un buon risultato in una prova o in un test del fornitore. Manca così una verifica sulle attività che dovranno gestire con continuità. Inoltre, le prestazioni possono cambiare quando vengono modificati modelli, software e dati in ingresso, oppure quando evolvono le minacce che gli agenti devono affrontare.

La nuova edizione nasce dalla piattaforma AI Range, introdotta nel dicembre 2025 per mettere alla prova gli agenti di sicurezza in ambienti informatici controllati. Da allora, la piattaforma è stata sottoposta a prove intensive da laboratori di intelligenza artificiale, clienti governativi e hyperscaler. L’edizione Enterprise sviluppa questa base attraverso un processo di valutazione per ruolo che i team aziendali possono applicare ai propri agenti, collegando l’esame delle capacità alle mansioni che intendono assegnare.

Gli agenti vengono valutati sui ruoli che devono svolgere in condizioni realistiche.

Al centro del processo c’è Agentic Worker Competence, la metodologia di HTB per verificare se un agente sappia svolgere un determinato ruolo secondo lo standard atteso e in condizioni realistiche. La piattaforma restituisce punteggi per ruolo, esiti di superamento o mancato superamento dei singoli ambienti e una lettura delle prestazioni nel tempo. Per il Chief Product Officer Gerasimos Marketos, il flusso parte dal collegamento dell’agente e dall’assegnazione del ruolo: il sistema registra come affronta autonomamente il compito, dove riesce e dove incontra difficoltà.

HTB aggiunge regolarmente ambienti che riflettono nuove vulnerabilità e modalità di attacco, mantenendo l’integrità del processo di valutazione. Le organizzazioni possono ripetere le prove quando cambiano agenti, modelli, software, insiemi di dati o condizioni operative. Il confronto consente di distinguere un miglioramento da un peggioramento o da una prestazione stabile. I risultati offrono ai responsabili della sicurezza elementi per stabilire quali attività un agente sia pronto ad assumere e dove occorra ancora la supervisione umana.

Le prove ripetute permettono di osservare come cambiano le prestazioni degli agenti.

La valutazione degli agenti si accompagna a quella delle persone che ne dirigono il lavoro. Il CEO Haris Pylarinos sostiene che i responsabili debbano avere fiducia in entrambe le componenti del team: gli agenti devono saper eseguire le mansioni ricevute, mentre i professionisti devono possedere competenza e capacità di giudizio per guidarli, verificarne il lavoro e intervenire. Nella visione dell’azienda, la preparazione alla cybersecurity richiede quindi di sviluppare le capacità umane insieme alla comprensione delle capacità degli agenti.

I ruoli di HTB potenziati dall’AI incorporano queste responsabilità nelle attività già svolte dai professionisti, dal penetration testing alle operazioni di sicurezza. Il ruolo AI-augmented SOC Analyst, in particolare, colloca gli operatori in scenari realistici nei quali utilizzano l’intelligenza artificiale per esaminare gli avvisi, indagare su attività sospette e valutare le azioni raccomandate. L’organizzazione può così sviluppare e misurare le competenze necessarie a usare l’AI durante il lavoro operativo.

La supervisione richiede anche di sapere quando lasciare lavorare autonomamente gli agenti.

La metodologia Agentic Operator Competence Scoring valuta il giudizio alla base del lavoro assistito dall’AI attraverso scenari pratici di cybersecurity. Le prove verificano se i professionisti riconoscano errori nel ragionamento dell’agente, comprendano le basi delle sue raccomandazioni e sappiano quando intervenire. La valutazione considera anche la decisione complementare: lasciare proseguire il lavoro guidato dall’AI quando un intervento non serve. Il controllo umano viene così esaminato anche nella capacità di concedere autonomia sulla base delle decisioni osservate.

Articoli Correlati