El escenario actual · Datos verificados 2024-2026
El problema en números reales
Antes de la tecnología, la escala. Estos números hacen que el tema deje de ser abstracto y empiece a ser tu problema.
3 seg
de audio público para clonar una voz funcional. En 2020 hacían falta horas. En 2023: minutos. En 2025: 3 segundos.
ElevenLabs · SecurityToday 2025
+2.000%
crecimiento de fraudes con deepfakes de voz en tres años a nivel global. Curva exponencial, sin desaceleración.
Sumsub Identity Fraud Report 2025
USD 25M
fraude máximo documentado: ARUP Holdings, Hong Kong, enero 2024. Videollamada con "CFO y cuatro directivos" — todos deepfakes.
Reuters · Hong Kong Police 2024
70%
de personas no distingue una voz clonada de alta calidad de una voz humana real al escucharla.
MIT Media Lab · ASVspoof 2024
34.468
denuncias por ciberdelitos en Argentina en 2024. 13,5% por suplantación de identidad. Crecimiento del 38% vs. 2023.
UFECI · fiscales.gob.ar 2025
+400%
aumento del vishing con voz IA en Argentina en 2025 vs. el año anterior. El "cuento del tío" se actualizó.
CERT.ar · ESET Latinoamérica 2025
USD 16.600M
pérdidas totales por cibercrimen en EE.UU. en 2024. BEC + voice AI entre los principales vectores.
FBI IC3 Annual Report 2024
USD 0
costo de acceso a herramientas de clonación de voz de calidad profesional hoy. El atacante no necesita presupuesto.
XTTS-v2 · RVC GitHub 2025
El dato que más incomoda: el 70% que no distingue una voz falsa incluye a abogados, médicos, jueces, periodistas, ingenieros. La capacidad de detectar no es función de la inteligencia ni del nivel educativo: es función de tener las herramientas correctas. En contexto forense, el peritaje técnico reemplaza al oído humano.
"Los datos biométricos son sensibles porque una vez entregados o perdidos son irrecuperables. Una contraseña se cambia. La voz, no."
— Dr. Federico Álvarez Larrondo, Mar del Plata, 2024
Fundamento técnico · Biometría vocal · Ley 25.326
Tu voz tiene una huella digital única
que no sabías que existía
Los modelos de IA no "graban e imitan". Extraen datos biométricos que existen en cada audio que publicás y construyen una representación matemática de quién sos vocalmente. Para siempre.
Coeficientes cepstrales
MFCC
13 a 40 números calculados cada 25 ms de audio. Describen el timbre — lo que hace que tu voz suene como la tuya. El banco de filtros Mel aproxima cómo el oído humano procesa el sonido. Es el feature primario en reconocimiento de locutor.
Frecuencia fundamental
F0 / Pitch
Velocidad de vibración de las cuerdas vocales. Voces masculinas típicas: 85-180 Hz. Femeninas: 165-255 Hz. Varía con emoción, salud, edad y estrés. La IA replica el promedio pero falla en replicar microirregularidades naturales.
Resonancias del tracto
Formantes (F1-F4)
Frecuencias resonantes de boca, faringe y nariz. F1-F2 determinan si se percibe una "a", "e" u "o". Son tan únicos como la geometría exacta de tu tracto vocal. La IA los captura en el speaker embedding.
El ADN matemático
Speaker Embedding
Vector de 192-512 números generado por red neuronal (ECAPA-TDNN o d-vector). Es vos en matemática. Funciona en cualquier idioma. Se crea con 3 segundos de audio limpio. Una vez extraído, irrecuperable.
Ritmo y melodía
Prosodia
Cómo subís y bajás el tono, dónde pausás, cómo enfatizás. Cultural (rioplatense vs. cordobés) y personal. Los modelos replican la prosodia promedio bien, pero fallan en replicar prosodia individual en un estado emocional específico.
Imperfecciones naturales
Jitter · Shimmer · HNR
Jitter: variación ciclo a ciclo del F0 (normal: 0,5-2%). Shimmer: variación de amplitud (2-5%). HNR: relación armónico-ruido (15-25 dB). Las voces sintéticas tienen valores fuera de rango. Medibles con Praat.
Valores de referencia forense
| Parámetro |
Rango humano normal |
Señal sintética — alerta |
| Jitter |
0,5 – 2,0 % |
< 0,2 % (demasiado perfecto) o > 3 % (calidad baja) |
| Shimmer |
2 – 5 % |
< 1 % (anormalmente estable) o > 5 % (artefactos) |
| HNR |
15 – 25 dB |
> 30 dB (exceso de limpieza) o < 5 dB (sobrecomprimido) |
¿Cuánto audio se necesita realmente? Con 3 segundos de audio limpio se obtiene un embedding funcional, similitud perceptual del 70-80%. Con 30 segundos se llega a 85-92%, convincente para la mayoría. Con 5 minutos supera el 95% e indistinguible sin herramientas especializadas. Todo el audio que publicaste en redes en los últimos 5 años equivale a horas de material de entrenamiento.
Marco legal vigente (Ley 25.326, art. 9): la voz es dato biométrico sensible. Publicar contenido en redes sociales NO equivale a consentir su uso para entrenar modelos de IA. El consentimiento para una finalidad (difusión pública) no cubre otras (extracción biométrica, síntesis). Dar una conferencia no habilita usos tecnológicos posteriores no comunicados.
Proceso técnico · Paso a paso
Cómo se clona una voz: técnica y derecho
en cada paso del pipeline
Cada paso tiene una implicancia jurídica concreta. Para abogados: la columna derecha es el encuadre normativo aplicable.
Técnico
3-30 segundos de audio de fuente pública: nota de voz de WhatsApp, video de Instagram/TikTok/YouTube, entrevista en medios, llamada grabada. FFmpeg extrae el audio. Normalización a WAV 16 kHz mono. El atacante no necesita acceso físico al dispositivo.
Jurídico
Uso no autorizado de datos biométricos (Ley 25.326, art. 9). El audio público NO implica consentimiento para extracción biométrica. Potencial violación art. 1770 CCyC (interferencia en vida privada).
Técnico
Reducción de ruido (Audacity o DeepFilter en Python), normalización a -20 LUFS, separación de silencios, conversión a WAV 16 kHz mono. Sin este paso, la calidad del clon baja significativamente.
ffmpeg -i input.mp3 -ar 16000 -ac 1 -af "loudnorm" output.wav
Jurídico
El preprocesamiento ya constituye tratamiento automatizado de datos biométricos. No hay marco argentino específico para herramientas que limpien biometría sin consentimiento, pero la Ley 25.326 alcanza todo tratamiento.
Técnico
Red neuronal (ECAPA-TDNN en XTTS-v2, d-vector en ElevenLabs) procesa el audio en ventanas de 25 ms con overlap de 10 ms. Comprime los MFCC en un vector de 192-512 dimensiones — el "ADN vocal". Puede almacenarse y reutilizarse sin el audio original.
speaker_embedding = encoder.encode(audio_16k)
Jurídico
Una vez extraído el embedding, la biometría ya fue "robada". Aunque el audio original se elimine, el vector persiste. No existe marco legal argentino que regule específicamente estos vectores. El embedding es en sí una nueva forma de dato biométrico derivado.
Técnico
El modelo XTTS-v2 (arquitectura VITS + cross-lingual conditioning) recibe (a) el texto a sintetizar y (b) el speaker embedding. Sin reentrenar, genera un mel-spectrogram. "Zero-shot" = nunca entrenó con esta voz pero la reproduce usando el embedding como condición.
Jurídico
XTTS-v2 no implementa watermark (SynthID). No hay trazabilidad técnica por metadatos. El audio generado es técnicamente indistinguible por inspección casual. La carga de la prueba de síntesis recae en el perito técnico, no en la víctima.
Técnico
HiFi-GAN convierte el mel-spectrogram en forma de onda audible (22.050 Hz o 24.000 Hz). Genera audio 13× más rápido que tiempo real en una GPU modesta. Calidad superior a una llamada telefónica.
Jurídico
El audio resultante puede ser difundido como nota de voz "real" de la víctima. Si se usa para defraudar: art. 173 CP (estafa). Si daña honor o privacidad: art. 1770 CCyC.
Técnico
Compresión OPUS 32 kbps a 24 kHz, formato nativo de WhatsApp. La compresión elimina artefactos de alta frecuencia que delatarían la síntesis. Paradoja: la compresión ayuda al atacante.
ffmpeg -i fake.wav -c:a libopus -b:a 32k -ar 24000 nota_voz.ogg
Jurídico
ISO 27037 exige hash SHA-256 ANTES de abrir el archivo recibido. Sin ese hash, la defensa puede impugnar cualquier análisis posterior. La compresión OPUS reduce drásticamente la precisión de modelos anti-spoofing.
Técnico
En lugar de sintetizar audio pregrabado, RVC convierte la voz del atacante en la de la víctima en tiempo real durante una llamada activa. Latencia 100-300 ms, imperceptible en conversación. Disponible gratis en GitHub. Usado en el CEO fraud de USD 243.000 en Arizona (2024).
Jurídico
El vector de ataque más peligroso porque la víctima cree estar conversando con la persona real. Encuadre: art. 173 CP (estafa por ardid o engaño). Requiere preservación de la grabación completa de la llamada como evidencia.
El caso didáctico del cantante: para clonar la voz de Freddie Mercury o Michael Jackson se toman horas de grabaciones comerciales, se separa voz de música con Demucs, se extraen MFCC y formantes de cada canción, y se entrena un voice conversion model. El proceso evidencia qué datos biométricos contiene el audio: no solo "cómo suena" sino la geometría exacta del tracto vocal — los mismos datos que usa el sistema de identificación biométrica del Aeropuerto de Ezeiza.
Identidad digital · Casos cercanos
WhatsApp: el vector favorito
de los deepfakes en Argentina
El vector de ataque más común en Argentina no es la videollamada corporativa de USD 25M. Es la nota de voz de WhatsApp. Y es el que más funciona.
Por qué WhatsApp facilita el engaño
Identidad aparente
Nombre y foto del contacto
La nota de voz llega con el nombre y foto del contacto conocido (cuenta comprometida o número spoofed). El receptor confía en la identidad mostrada antes de evaluar el contenido.
Compresión OPUS
El aliado del atacante
La compresión OPUS 32 kbps elimina los artefactos de síntesis que delatarían un deepfake. El audio falso suena más convincente después de pasar por WhatsApp que antes.
Sin metadatos
El .ogg reenviado pierde origen
El formato .ogg de WhatsApp no preserva metadatos del dispositivo de origen ni del modelo que lo generó. La cadena de evidencia es frágil desde el primer reenvío.
Ingeniería social
Urgencia + secreto + cuenta nueva
Las tres señales clásicas. La urgencia desactiva el análisis crítico. El secreto bloquea la verificación social. La cuenta nueva habilita el desvío del dinero. Combinadas: 97% de probabilidad de fraude según FBI IC3.
Paso a paso de una estafa real
A
Inteligencia (OSINT)
El atacante investiga a la víctima y su red. Identifica al familiar, jefe o amigo más influyente. Busca audios o videos públicos de esa persona: graduación, nota de voz reenviada en un grupo, entrevista local. Descarga el material — públicamente disponible en la mayoría de los casos.
B
Clonación y síntesis del mensaje falso
Sube el audio a ElevenLabs (o usa XTTS-v2 localmente). Escribe el guion cuidando el registro de habla (muletillas, vocabulario). Genera el audio. Ajusta. Tiempo total: 5 a 30 minutos. Costo: USD 0.
C
Conversión al formato WhatsApp
Convierte a OPUS 32 kbps, 24 kHz mono. El archivo .ogg resultante es indistinguible del formato nativo de WhatsApp.
ffmpeg -i fake.wav -c:a libopus -b:a 32k -ar 24000 -ac 1 nota_falsa.ogg
D
Entrega y explotación de la urgencia emocional
Envío desde número spoofed o cuenta comprometida. El receptor ve el nombre y foto del familiar/jefe, escucha la voz reconocida y procesa la urgencia. El guion siempre incluye: límite temporal corto, instrucción de no verificar con otros, escenario de emergencia.
El dato más inquietante (UFECI 2025): en el 78% de los casos reportados con voz clonada en Argentina, la víctima reconoció que "algo sonaba raro" pero igual actuó porque "la urgencia era real". La tecnología no es perfecta. La ingeniería social sí. El ataque funciona porque explota la presión temporal, no la calidad del deepfake.
Marco normativo · ISO aplicable
Las 4 normas que sostienen
una pericia en juicio
No son burocracia. Son el protocolo que hace admisible el trabajo técnico y defendible la postura organizacional.
ISO/IEC 27037:2012
Cadena de custodia digital
Identificación, recolección, adquisición y preservación de evidencia digital. Hash SHA-256 antes de cualquier acción. Copia forense bit-a-bit. Dispositivo original sellado e intacto. Documentación con timestamp.
Aplicación en deepfakes
Audio por WhatsApp requiere dispositivo original + hash SHA-256 para ser evidencia válida. Reenvío del audio = evidencia potencialmente contaminada. El hash del original es la base de todo.
ISO/IEC 27042:2015
Análisis e interpretación
Metodología documentada, reproducible, con grado de certeza declarado. El perito debe declarar explícitamente las incertidumbres y limitaciones del análisis.
Aplicación en deepfakes
Informe válido = espectrograma + AASIST + valores Praat + declaración de incertidumbres. No alcanza concluir "suena falsa". Requiere metodología técnica reproducible.
ISO/IEC 27001:2022
Gestión de seguridad de la información
Sistema de Gestión de Seguridad de la Información. Versión 2022 con controles específicos contra ingeniería social y verificación de identidad. Control A.5.24 (gestión de incidentes), A.5.19 (relaciones con proveedores), A.8.12 (fuga de datos).
Aplicación en deepfakes
Organizaciones con verificación por voz deben evaluar riesgo de suplantación sintética. El principio de 4 ojos para transferencias es control mínimo recomendado bajo A.5.24.
ISO/IEC 42001:2023
Gestión de sistemas de IA
Primera norma específica para gestión de IA. Publicada en diciembre 2023. Introduce el concepto de AI Impact Assessment (AIAS). Define cómo gestionar desarrollo, despliegue y uso responsable de IA.
Aplicación en deepfakes
Organizaciones que usan o son víctimas de síntesis de voz deben documentar riesgos, salvaguardas y responsabilidades. El gap entre capacidad técnica y marco normativo es activo hoy.
EU AI Act — Reglamento (UE) 2024/1689:
Art. 5: deepfakes con intención de engaño = práctica de IA prohibida.
Art. 50(4): etiquetado obligatorio de contenido IA generado.
Argentina — Gap regulatorio activo: la Estrategia Nacional de IA 2023 es marco de referencia, NO normativa vinculante. El Código Penal no tipifica deepfakes de voz como delito autónomo. Los arts. 173 CP, 153 bis CP y 1770 CCyC son instrumentos imperfectos pero aplicables.
Conclusiones · Lo que te llevás
5 acciones que implementás esta semana
No hay conciencia sin acción. Estas cinco son implementables hoy, cuestan USD 0 y reducen el riesgo de forma medible.
01
FREEZAR antes de actuar
Ante cualquier solicitud urgente por voz o audio: parar, respirar, colgar. Verificar por canal alternativo — llamando vos al número real del contacto desde tu lista. El atacante necesita tu urgencia. No se la des.
Inmediato
02
ESTABLECER palabra código familiar
Acordá con tu familia una palabra o frase secreta que debe estar en cualquier llamada de emergencia real. No la escribas digitalmente. Renovar cada 6 meses. Una sola conversación familiar puede evitar pérdidas significativas.
5 minutos
03
AUDITAR tu huella de voz pública
Buscá tu nombre en YouTube, Instagram, TikTok, LinkedIn. Contá cuántos minutos de tu voz existen públicamente. Configurar privacidad. Deshabilitar Stitch/Duet. Eliminar historial de voz en Google My Activity. Saber qué hay disponible es el primer paso.
30 minutos
04
PRESERVAR antes de denunciar
Si recibís un audio sospechoso: NO borres, NO reenvíes. Generar hash SHA-256 del archivo. Documentar contexto (número origen, hora, chat). Denunciar en UFECI (fiscales.gob.ar/ufeci) o CERT.ar. Sin hash previo, la evidencia es impugnable en juicio.
ISO 27037
05
PROTOCOLIZAR en tu organización
Principio de 4 ojos para transferencias: toda instrucción financiera por voz requiere confirmación escrita + aprobación de dos personas por canal alternativo. Documentar en política. Entrenar al equipo. El protocolo pre-definido es la única defensa que funciona en tiempo real.
ISO 27001 A.5.24
El takeaway final: la tecnología ya está acá. No va a desaparecer. La ventaja ya no es técnica — es de protocolo. Quien tiene el protocolo establecido antes del ataque, sobrevive al ataque.