Aller au contenu
Categoria: Red Team9 min de lecture

Adversary Emulation avec Caldera et MITRE ATT&CK en Lab d'Entreprise

Por Lucas Andrade ·

Comment Basilisk utilise Caldera, Atomic Red Team et MITRE ATT&CK pour simuler de vraies TTP en lab fermé et mesurer la maturité du SOC sans toucher à la production.

Adversary Emulation avec Caldera et MITRE ATT&CK en Lab d'Entreprise
Dans cet article

Quand un client appelle en disant qu'il a achete l'EDR le plus cher du marche et veut savoir si 'c'est bien', la reponse honnete n'est jamais un rapport PowerPoint. C'est une operation d'adversary emulation avec scenario ecrit, cartographie ATT&CK et metriques froides : combien d'etapes sont passees silencieuses, combien ont declenche une alerte, combien ont mene a une reponse humaine en moins de 60 minutes. Chez Basilisk OffSec nous avons standardise cela autour de Caldera 5.x, Atomic Red Team et d'un lab de domaine Windows a 8 hotes qui reproduit l'environnement du client sans jamais toucher a sa production. Ce texte decrit la stack, le flux et les erreurs que nous avons paye cher pour ne plus refaire.

L'emulation n'est pas un pentest : ce que mesure vraiment l'adversary emulation#

Un pentest chasse les vulnerabilites et prouve l'exploitabilite. L'adversary emulation pose une autre question : si vous reproduisez une menace concrete etape par etape, la defense la voit-elle et l'arrete-t-elle a temps ? Le livrable n'est pas une liste de CVE mais un scorecard de detection par technique. C'est pourquoi le resultat est toujours un tableau de technique ATT&CK, issue (silencieux, alerte, bloque) et temps jusqu'a la reponse. Qui confond cela avec un pentest achete le mauvais produit et finit par mesurer la mauvaise chose.

La valeur vient de la repetabilite. La meme emulation, lancee chaque mois, montre si les nouvelles regles Sigma et le tuning de l'EDR ameliorent vraiment le taux de detection ou si seule la sensation s'est amelioree. Sans ligne de base, toute affirmation de 'plus de securite' est du marketing.

Le lab reproductible : huit hotes, Proxmox et Terraform#

Le lab de base est simple et reproductible : un Windows Server 2022 comme DC, deux Server 2019 (fichiers et SQL), trois Windows 11 Enterprise comme postes avec Defender for Endpoint en mode bloquant, et deux Ubuntu 24.04 avec auditd et un agent Wazuh. Le tout orchestre sur Proxmox via Terraform, avec des snapshots nommes par phase de scenario. Pour batir le cote Windows depuis zero, commencez par Pentest Active Directory : Kerberoasting Pas a Pas dans un Lab GOAD, qui livre deja des ACL volontairement bancales, puis branchez le pivoting decrit dans Pivoting avec Chisel et Ligolo-ng : Reseaux Segmentes en Lab de Pentest pour modeliser une vraie segmentation VLAN. Sans cette segmentation, toute metrique de detection de lateral movement est biaisee d'entree.

Terraform n'est pas decoratif ici. Il garantit que le lab demarre de maniere deterministe depuis le meme etat apres chaque operation, pour que deux passes restent comparables. Les snapshots nommes par phase permettent de revenir a l'instant precis avant le lateral movement chaque fois qu'une question de detection reste ouverte.

Caldera comme cerveau : YAML d'adversaire et cartographie ATT&CK#

Caldera joue le role de cerveau de l'operation. Nous montons le serveur sur un Debian isole, chargeons les plugins 'atomic', 'stockpile' et notre fork interne 'basilisk-ttps' qui regroupe des comportements regionaux comme l'abus d'AnyDesk dans les PME. Chaque adversaire Caldera est un YAML qui cite les techniques ATT&CK par ID : T1059.001 pour PowerShell, T1021.006 pour WinRM, T1003.001 pour le dump LSASS. Nous n'executons jamais d'adversaires tout faits sans relecture ; ils servent de benchmark, mais la vraie valeur vient d'ecrire des scenarios qui reproduisent le modele de menaces du client. Un retail avec TPV expose ne merite pas le meme adversaire qu'une fintech avec Azure AD federe et MFA fort.

Un profil d'adversaire est une sequence ordonnee d'abilities, chacune avec une reference ATT&CK, un executor et une commande de cleanup. Cette ligne de cleanup n'est pas optionnelle : elle garantit que l'hote revient a un etat connu apres la passe, sinon le premier test contamine le second. Nous versionnons chaque YAML dans git et le relisons comme du code de production.

Le cycle d'execution en quatre phases#

L'execution suit un cycle de quatre phases que nous avons appris a respecter. D'abord un initial access simule sur un endpoint controle, generalement base sur le playbook de Initial Access Simule: Macros, LNK et ISO dans un Lab Windows 11 Isole avec un payload signe par une CA interne. Ensuite l'execution et la decouverte appuyees sur des LOLBins, la ou le contenu de Hunting des Living-off-the-Land Binaries sous Windows avec KQL permet a la blue team d'avoir ses requetes KQL pretes avant l'exercice. Puis le lateral movement via SMB et WinRM en exploitant des comptes de service faibles. Enfin les actions sur l'objectif, qui peuvent etre l'exfiltration d'une base SQL ou le chiffrement simule d'un partage.

Chaque phase a un critere d'arret clair : si l'EDR tue le processus en moins de 90 secondes, on note detecte et on prend une autre route. Ce critere dur evite le schema d'auto-illusion le plus courant, ou l'operateur ajuste jusqu'a ce que quelque chose passe puis affirme que la chaine a tourne de bout en bout. Detecte est detecte ; c'est un bon resultat pour le client, pas un echec pour l'equipe.

Cote bleu : instrumentation, telemetrie et les trois metriques#

La partie ennuyeuse mais decisive, c'est l'instrumentation cote bleu. Sans telemetrie comparable, l'adversary emulation se transforme en theatre. Nous deployons Sysmon avec la config d'Olaf Hartong, envoyons vers un Elastic 8.14 et appliquons des regles Sigma converties, un flux que nous avons detaille dans Threat Hunting avec Sigma et Elastic: De l'Indicateur a la Regle de Detection. Chaque evenement genere par Caldera recoit un header custom x-caldera-op-id, ce qui permet de requeter sur Kibana quelle technique a produit quels evenements et en combien de temps l'analyste a reagi.

Les trois metriques que nous remettons toujours : MTTD par technique, taux de detection par tactique ATT&CK, et nombre de nouvelles regles Sigma ecrites en consequence. Sans ces chiffres, le client pense avoir achete un pentest et repart frustre. Avec eux, il obtient une courbe de maturite qu'il peut montrer a la direction et defendre trimestre apres trimestre.

Une passe concrete : de l'ability a la faille de detection#

Une passe typique : Caldera livre un agent Sandcat via un LNK signe, execute T1059.001 (decouverte PowerShell), puis T1003.001 (acces a LSASS via un LOLBin au lieu de Mimikatz pour varier la signature), et pivote via T1021.006 (WinRM) vers le serveur de fichiers. Lors d'une vraie passe client, l'acces a LSASS est passe silencieux parce que la regle Sigma existante ne visait que le nom de processus mimikatz.exe au lieu de l'acces suspect au handle de lsass.exe. Cette faille precise est le produit : une nouvelle regle, basee sur le comportement, qui atterrit dans le rapport.

Pour chaque ability nous enregistrons le timestamp de l'evenement Caldera et celui de la premiere alerte correlee dans Elastic. La difference est le MTTD de cette technique. Agrege par tactique, cela donne le taux de detection que nous suivons trimestre apres trimestre face aux passes precedentes.

Pieges ethiques et operationnels#

Il existe des pieges ethiques et operationnels qu'il faut nommer. L'adversary emulation n'est pas un pretexte pour executer de l'evasion d'EDR sur la production d'autrui ; tout ce qui touche aux direct syscalls ou au patching d'AMSI reste cantonne au lab, et qui veut comprendre pourquoi peut lire Evasion EDR pour la Recherche: Direct Syscalls Expliques sans Romance et Bypass d'AMSI et d'ETW pour la Recherche Defensive: Ce que les Blue Teams Doivent Savoir. Nous ne mutualisons jamais l'infrastructure C2 entre clients ; chaque mission recoit un teamserver Sliver dedie conformement a Construire une Infra C2 avec Sliver en Lab Isole pour la Recherche Defensive.

Chaque operation repose sur une autorisation ecrite avec un scope clair et des regles d'engagement. Une etape destructive, comme le chiffrement simule d'un partage, ne s'execute que contre des donnees dediees au lab et jamais contre la production du client. Cette ligne n'est pas negociable, meme pas pour 'l'essayer vite fait'.

Rapport et la boucle de feedback purple team#

Le rapport final relie chaque TTP a une contre-mesure concrete et alimente la boucle decrite dans Purple Team en Pratique: Construire une Boucle de Feedback Red vs Blue, evitant que l'exercice finisse au cimetiere des PDF. Pour chaque technique non detectee nous livrons la logique de detection proposee, pas seulement le constat qu'une faille existe. C'est la difference entre un rapport qu'on classe et un qui releve de maniere mesurable le taux de detection a la passe suivante.

La boucle se ferme quand les regles proposees dans le rapport sont testees au cycle suivant. C'est precisement pour cela qu'une cadence mensuelle bat un grand test annuel : seule la repetition prouve que la defense a vraiment appris quelque chose.

FAQ : en quoi Caldera differe-t-il d'Atomic Red Team ?#

Atomic Red Team est une bibliotheque de snippets de test unitaires par technique, ideale pour verifier ponctuellement si une detection pour T1003.001 existe. Caldera orchestre ces briques en une chaine coherente avec agent, planification et cleanup, pour qu'une histoire d'attaque complete se deroule. En pratique nous utilisons Atomic pour la validation unitaire rapide et Caldera pour l'operation complete et scriptee. Ils ne rivalisent pas, ils se completent.

FAQ : faut-il un EDR couteux pour que cela en vaille la peine ?#

Non. Tout l'interet de l'emulation est justement de mesurer ce que livre votre telemetrie actuelle. Sysmon plus Elastic plus des regles Sigma converties forment une base de detection entierement gratuite contre laquelle emuler a du sens. Un EDR couteux ameliore souvent les donnees brutes, mais sans logique de detection testee et une blue team entrainee, il reste une archive de logs onereuse.

Conseil pratique : commencer petit, iterer chaque mois#

Conseil pratique : commencez petit. Montez un Caldera, ecrivez un adversaire avec cinq techniques ATT&CK alignees sur votre vrai modele de menaces, executez-le contre trois endpoints monitores et mesurez le MTTD par technique. Repetez mensuellement en changeant une technique a chaque cycle. En six mois vous aurez une courbe de maturite defendable devant la direction, sans acheter aucun nouvel outil couteux, et votre SOC arretera de raler qu'il 'ne se passe jamais rien' pendant les entrainements.

Related posts

Nenhum comentário ainda

Seja o primeiro a comentar.

Deixe seu comentário

Entre com sua conta Canverly para comentar. Você pode usar a mesma conta em qualquer site da rede.

Entrar com Canverly