Saltar al contenido
Categoria: Red Team8 min de lectura

Adversary Emulation con Caldera y MITRE ATT&CK en Laboratorio Corporativo

Por Lucas Andrade ·

Cómo Basilisk usa Caldera, Atomic Red Team y MITRE ATT&CK para simular TTPs reales en un lab cerrado y medir la madurez del SOC sin tocar producción.

Adversary Emulation con Caldera y MITRE ATT&CK en Laboratorio Corporativo

Cuando un cliente llama diciendo que compro el EDR mas caro del mercado y quiere saber si 'esta bien', la respuesta honesta nunca es un informe en PowerPoint. Es una operacion de adversary emulation con guion escrito, ATT&CK mapeado y metricas frias: cuantos pasos pasaron en silencio, cuantos generaron alerta, cuantos terminaron en respuesta humana en menos de 60 minutos. En Basilisk OffSec estandarizamos esto sobre Caldera 5.x, Atomic Red Team y un lab de dominio Windows con 8 hosts que replica el entorno del cliente sin tocar jamas su produccion. Este texto describe la pila, el flujo y los errores que cobramos caro para no repetir.

Emulacion no es pentest: que mide de verdad adversary emulation

Un pentest caza vulnerabilidades y prueba explotabilidad. Adversary emulation hace otra pregunta: si reproduces una amenaza concreta paso a paso, la defensa la ve y la detiene a tiempo? El entregable no es una lista de CVEs sino un scorecard de deteccion por tecnica. Por eso el resultado siempre es una tabla de tecnica ATT&CK, desenlace (silencioso, alertado, bloqueado) y tiempo hasta la respuesta. Quien confunde esto con un pentest compra el producto equivocado y termina midiendo lo que no debe.

El valor viene de la repetibilidad. La misma emulacion, corrida mensualmente, muestra si las nuevas reglas Sigma y el tuning del EDR mejoran de verdad la tasa de deteccion o si solo mejoro la sensacion. Sin una linea base, cualquier afirmacion de 'mas seguridad' es marketing.

El lab reproducible: ocho hosts, Proxmox y Terraform

El lab base es simple y reproducible: un Windows Server 2022 como DC, dos Server 2019 (archivos y SQL), tres Windows 11 Enterprise como estaciones con Defender for Endpoint en modo bloqueo, y dos Ubuntu 24.04 con auditd y Wazuh agent. Todo orquestado en Proxmox via Terraform, con snapshots nombrados por fase del escenario. Para quien arma el escenario Windows desde cero recomendamos partir de Pentest de Active Directory: Kerberoasting Paso a Paso en Lab GOAD, que ya entrega ACLs propositalmente desordenadas, y luego acoplar el pivoting descrito en Pivoting con Chisel y Ligolo-ng: Redes Segmentadas en Lab de Pentest para segmentar VLAN reales. Sin segmentacion realista, cualquier metrica de deteccion de lateral movement queda viciada de origen.

Terraform no es decoracion. Garantiza que el lab arranca de forma deterministica desde el mismo estado despues de cada operacion, para que dos corridas sean comparables. Los snapshots nombrados por fase permiten volver al momento exacto antes del lateral movement cada vez que queda abierta una pregunta de deteccion.

Caldera como cerebro: YAML de adversario y mapeo ATT&CK

Caldera entra como cerebro de la operacion. Levantamos el servidor en un Debian aislado, cargamos los plugins 'atomic', 'stockpile' y nuestro fork interno 'basilisk-ttps' con TTPs latinoamericanas, como abuso de AnyDesk en pymes. Cada adversario en Caldera es un YAML que cita tecnicas ATT&CK por ID: T1059.001 para PowerShell, T1021.006 para WinRM, T1003.001 para dump de LSASS. Nunca ejecutamos adversarios listos sin revision; sirven como benchmark, pero el valor real esta en escribir escenarios que reproduzcan el modelo de amenazas del cliente. Un retail con TPV expuesto no merece el mismo adversary que una fintech con Azure AD federado y MFA fuerte.

Un perfil de adversario es una secuencia ordenada de abilities, cada una con referencia ATT&CK, executor y comando de cleanup. Esa linea de cleanup no es opcional: asegura que el host vuelva a un estado conocido tras la corrida, o el primer test contamina el segundo. Versionamos cada YAML en git y lo revisamos como codigo de produccion.

El ciclo de ejecucion en cuatro fases

La ejecucion sigue un ciclo de cuatro fases que aprendimos a respetar. Primero initial access simulado en endpoint controlado, normalmente siguiendo el playbook de Initial Access Simulado: Macros, LNK e ISO en un Lab Windows 11 Aislado con payload firmado por una CA interna. Segundo, ejecucion y descubrimiento apoyados en LOLBins; aqui el material de Hunting de Living-off-the-Land Binaries en Windows con KQL ayuda al blue team a tener KQL listo antes del ejercicio. Tercero, lateral movement por SMB y WinRM aprovechando cuentas de servicio debiles. Cuarto, acciones sobre el objetivo, que pueden ser exfil de una base SQL o cifrado simulado de un share.

Cada fase tiene criterio de parada claro: si el EDR mata el proceso en menos de 90 segundos, anotamos detectado y probamos otro camino. Ese criterio duro evita el patron de autoengano mas comun, donde el operador ajusta hasta que algo pasa y luego dice que la cadena corrio de punta a punta. Detectado es detectado; es un buen resultado para el cliente, no un fracaso del equipo.

Lado azul: instrumentacion, telemetria y las tres metricas

La parte aburrida pero decisiva es la instrumentacion del lado azul. Sin telemetria comparable, adversary emulation se vuelve teatro. Activamos Sysmon con la config de Olaf Hartong, enviamos a un Elastic 8.14 y aplicamos reglas Sigma convertidas, proceso que detallamos en Threat Hunting con Sigma y Elastic: Del Indicador a la Regla de Deteccion. Marcamos cada evento generado por Caldera con un header custom x-caldera-op-id, lo que permite consultar en Kibana que tecnica genero que eventos y en cuanto tiempo respondio el analista.

Metricas que siempre reportamos: MTTD por tecnica, tasa de deteccion por tactica ATT&CK y numero de reglas Sigma nuevas escritas como consecuencia. Sin esos tres numeros, el cliente cree que compro pentest y queda frustrado. Con ellos recibe una curva de madurez que puede mostrar al directorio y defender a lo largo de los trimestres.

Una corrida concreta: de la ability a la brecha de deteccion

Una corrida tipica: Caldera entrega un agente Sandcat via un LNK firmado, ejecuta T1059.001 (descubrimiento por PowerShell), luego T1003.001 (acceso a LSASS via un LOLBin en lugar de Mimikatz para variar la firma), y pivotea via T1021.006 (WinRM) al servidor de archivos. En una corrida real de cliente el acceso a LSASS paso en silencio porque la regla Sigma existente solo apuntaba al nombre de proceso mimikatz.exe en vez del acceso sospechoso al handle de lsass.exe. Esa brecha exacta es el producto: una regla nueva, basada en comportamiento, que queda escrita en el informe.

Por cada ability registramos el timestamp del evento de Caldera y el del primer alert correlacionado en Elastic. La diferencia es el MTTD de esa tecnica. Agregado por tactica da la tasa de deteccion que seguimos trimestre a trimestre contra las corridas anteriores.

Trampas eticas y operativas

Hay trampas eticas y operativas que vale citar. Adversary emulation no es excusa para ejecutar evasion de EDR en produccion ajena; todo lo que involucra direct syscalls o patching de AMSI queda restringido al lab, y quien quiera entender por que insistimos puede leer Evasion de EDR para Investigacion: Direct Syscalls Explicados sin Romantizar y Bypass de AMSI y ETW para Investigacion Defensiva: Lo que los Blue Teams Deben Saber. Tampoco corremos C2 con infraestructura compartida entre clientes; cada operacion recibe un teamserver Sliver dedicado conforme Construyendo Infra de C2 con Sliver en Lab Aislado para Estudio Defensivo.

Toda operacion se apoya en una autorizacion escrita con scope claro y reglas de enganche. Un paso destructivo, como el cifrado simulado de un share, solo corre contra datos dedicados del lab y nunca contra la produccion del cliente. Esa linea no se negocia, ni siquiera para 'probarlo rapido'.

Reporte y el ciclo de feedback purple team

El informe final amarra siempre cada TTP a una contramedida concreta, alimentando el ciclo descrito en Purple Team en la Practica: Construyendo Ciclo de Feedback Red vs Blue y evitando que el ejercicio termine archivado en un PDF. Para cada tecnica no detectada entregamos la logica de deteccion propuesta, no solo la observacion de que hay una brecha. Esa es la diferencia entre un informe que se archiva y uno que sube de forma medible la tasa de deteccion en la siguiente corrida.

El ciclo se cierra cuando las reglas propuestas en el informe se prueban en el siguiente ciclo. Por eso una cadencia mensual le gana a un gran test anual: solo la repeticion prueba que la defensa aprendio algo de verdad.

FAQ: en que se diferencia Caldera de Atomic Red Team?

Atomic Red Team es una biblioteca de snippets de test unicos por tecnica, ideal para verificar puntualmente si existe deteccion para T1003.001. Caldera orquesta esos bloques en una cadena coherente con agente, planificacion y cleanup, para que corra una historia de ataque completa. En la practica usamos Atomic para validacion unica rapida y Caldera para la operacion completa y guionada. No compiten, se complementan.

FAQ: hace falta un EDR caro para que esto valga la pena?

No. El sentido de la emulacion es justamente medir lo que entrega tu telemetria actual. Sysmon mas Elastic mas reglas Sigma convertidas es una base de deteccion totalmente gratuita contra la que puedes emular con sentido. Un EDR caro suele mejorar los datos crudos, pero sin logica de deteccion probada y un blue team entrenado se queda como un archivo de logs caro.

Takeaway practico: empezar pequeno, iterar mensualmente

Takeaway practico: empeza pequeno. Levanta un Caldera, escribi un adversario con cinco tecnicas ATT&CK alineadas al modelo de amenazas real de tu entorno, corrélo contra tres endpoints monitoreados y medi MTTD por tecnica. Repeti mensualmente cambiando una tecnica por vez. En seis meses vas a tener una curva de madurez defendible ante el directorio, sin comprar ninguna herramienta cara extra, y el SOC va a dejar de quejarse de que 'nunca pasa nada' en los entrenamientos.

Related posts

Nenhum comentário ainda

Seja o primeiro a comentar.

Deixe seu comentário

Entre com sua conta Canverly para comentar. Você pode usar a mesma conta em qualquer site da rede.

Entrar com Canverly