Tecnología real, casos cercanos, protocolos concretos. Cómo funciona desde adentro una voz clonada, cómo suena, cómo se detecta, qué normas aplican y qué hacer cuando el ataque ya ocurrió.
Antes de hablar de tecnología, hay que entender la escala. Estos números hacen que el tema deje de ser abstracto.
Los modelos de IA no "graban e imitan". Extraen los datos biométricos de tu voz — datos que existen en cada audio que publicás — y construyen una representación matemática de quién sos vocalmente. Para siempre.
| Parámetro | Rango Humano Normal | Señal Sintética — Alerta |
|---|---|---|
| Jitter | 0.5 – 2.0 % | < 0.5% (demasiado perfecto) o > 2.5% (calidad baja) |
| Shimmer | 1 – 4 % | < 1% (anormalmente estable) o > 5% (artefactos) |
| HNR | 15 – 25 dB | > 30 dB (exceso de limpieza) o < 5 dB (muy comprimido) |
Desde el audio de referencia hasta el mensaje de WhatsApp que recibe la víctima. Sin tecnicismos innecesarios, con la profundidad que el análisis forense requiere.
Cada paso técnico tiene una implicancia jurídica concreta. Para abogados: la columna derecha es el encuadre normativo aplicable.
3-30 segundos de audio de fuente pública (YouTube, Instagram, podcast). FFmpeg extrae el audio del video. Normalización a WAV 16kHz mono. El atacante no necesita acceso físico al dispositivo de la víctima.
Uso no autorizado de datos biométricos (Ley 25.326, art. 9). El audio de fuente pública NO implica consentimiento para extracción biométrica. Potencial violación art. 1770 CCyC (interferencia en vida privada). Dar una conferencia no habilita usos tecnológicos posteriores no comunicados.
Red neuronal ECAPA-TDNN procesa el audio en ventanas de 25ms. Extrae MFCC y los comprime en un vector de 192 dimensiones — el "ADN vocal". Este vector puede almacenarse y reutilizarse indefinidamente sin el audio original.
Una vez extraído el embedding, la biometría ya fue "robada". Aunque el audio original se elimine, el vector persiste. No existe marco legal argentino que regule específicamente estos vectores. El embedding es en sí una nueva forma de dato biométrico derivado.
El modelo XTTS-v2 recibe (a) el texto a sintetizar y (b) el speaker embedding. Sin reentrenar el modelo, genera un mel-spectrogram. "Zero-shot": el modelo nunca entrenó con esta voz pero la reproduce usando el embedding como condición de síntesis.
XTTS-v2 no implementa watermark (SynthID). No hay trazabilidad técnica por metadatos del modelo. El audio generado es técnicamente indistinguible por inspección casual. La carga de la prueba de la síntesis recae en el perito técnico, no en la víctima.
HiFi-GAN convierte el mel-spectrogram en forma de onda audible (22.050 Hz). Calidad superior a llamada telefónica. Se convierte a .ogg (OPUS) para WhatsApp. La compresión degrada artefactos espectrales.
La compresión OPUS que hace WhatsApp degrada los artefactos sintéticos que permitirían la detección. ISO 27037 exige hash SHA-256 ANTES de abrir el archivo recibido. Sin ese hash, la defensa puede impugnar cualquier análisis posterior.
Cada herramienta listada es real, funcional hoy, y relevante para el análisis forense — ya sea porque el atacante la usa o porque el investigador la necesita.
El vector de ataque más común en Argentina no es la videollamada corporativa de USD 25M. Es la nota de voz de WhatsApp. Y es el que más funciona.
El análisis de evidencia de audio sintético requiere un protocolo documentado y reproducible. Sin protocolo, el análisis no es forense — es opinión.
CertUtil -hashfile audio.ogg SHA256 (Windows) o sha256sum audio.ogg (Linux/Mac). Anotar el hash, fecha y hora. Trabajar solo sobre copia forense. El archivo original no se toca más. Sin este paso, la defensa puede impugnar toda la prueba posterior.
No son burocracia. Son el protocolo que hace admisible el trabajo técnico y defendible la postura organizacional.
El protocolo establecido antes del ataque decide si la víctima sobrevive al ataque. No hay protocolo que funcione si se diseña durante la crisis.
Hacé click en una opción para ver las consecuencias técnicas, forenses y jurídicas de tu elección.
Cada caso es una decisión real bajo presión. El temporizador es intencional. La urgencia que sentís es exactamente la que siente la víctima.
No hay conciencia sin acción. Estas 5 cosas son implementables hoy, cuestan USD 0, y reducen el riesgo de forma medible.
Solo recursos verificados, accesibles y relevantes para el análisis técnico y la formación continua.
Cada pieza tiene un momento de uso. La presentación es para acompañar la exposición en vivo. El kit interactivo y el protocolo son para la práctica de cada participante. El glosario y el cheat-sheet quedan como referencia profesional después del evento.