Charla técnica · UNMDP · 27 mayo 2026

Cuando tu voz
se convierte en el arma:
clonación con IA,
detección y evidencia forense

Tecnología real, casos cercanos, protocolos concretos. Cómo funciona desde adentro una voz clonada, cómo suena, cómo se detecta, qué normas aplican y qué hacer cuando el ataque ya ocurrió.

Evento
Panel interdisciplinario
Sede
FACULTAD DEDERECHO UNMDP
Fecha
27 mayo 2026
▶ Abrir presentación Simuladores → Fundamento técnico → Herramientas de análisis → 📦 Kit de materiales →
El escenario actual · Datos verificados 2024-2026

El problema en números reales

Antes de hablar de tecnología, hay que entender la escala. Estos números hacen que el tema deje de ser abstracto.

3 seg
de audio público para clonar una voz funcional. En 2020 necesitabas horas. En 2023: minutos. En 2025: 3 segundos.
ElevenLabs / SecurityToday, 2025
+2.000%
crecimiento en fraudes con deepfakes de voz en tres años a nivel global. Curva exponencial sin desaceleración.
Sumsub Identity Fraud Report, 2025
USD 25M
fraude máximo documentado: ARUP Holdings, Hong Kong, enero 2024. Videollamada con "CFO y cuatro directivos" — todos deepfakes.
Reuters / Hong Kong Police, 2024
70%
de personas no puede distinguir una voz clonada de alta calidad de una voz humana real cuando la escuchan.
MIT Media Lab / ASVspoof, 2024
34.468
denuncias por ciberdelitos en Argentina en 2024. 13,5% por suplantación de identidad. Crecimiento del 38% vs. 2023.
UFECI · fiscales.gob.ar, 2025
+400%
aumento del vishing con voz IA en Argentina en 2025 respecto del año anterior. El cuento del tío se actualizó.
CERT.ar / ESET Latinoamérica, 2025
USD 16.600M
pérdidas totales por cibercrimen en EE.UU. en 2024. BEC + voice AI fue uno de los principales vectores.
FBI IC3 Annual Report, 2024
USD 0
costo de acceso a herramientas de clonación de voz de calidad profesional hoy. El atacante no necesita presupuesto.
XTTS-v2 / RVC GitHub, 2025
El dato que más incomoda: el 70% que no distingue una voz falsa incluye a abogados, médicos, jueces, periodistas, ingenieros. La capacidad de detectar no es función de la inteligencia ni del nivel educativo. Es función de tener las herramientas correctas. El peritaje técnico reemplaza al oído humano en contexto forense.
"Los datos biométricos son sensibles porque una vez entregados o perdidos son irrecuperables. Una contraseña se cambia. La voz, no." — Dr. Federico Álvarez Larrondo, Mar del Plata, 2024
Fundamento técnico · Biometría vocal

Tu voz tiene una huella digital única
que no sabías que existía

Los modelos de IA no "graban e imitan". Extraen los datos biométricos de tu voz — datos que existen en cada audio que publicás — y construyen una representación matemática de quién sos vocalmente. Para siempre.

🎵
MFCC — Mel-Frequency Cepstral Coefficients
Son 13 a 40 números calculados cada 25 milisegundos de audio. Describen el "timbre" de tu voz — lo que hace que tu voz suene como la tuya y no como la de otro. Los genera el mismo sistema auditivo humano (el banco de filtros Mel aproxima cómo el oído procesa el sonido). Son el feature más importante en reconocimiento de locutor.
Dato biométrico primario
📳
F0 — Frecuencia Fundamental (Pitch)
La velocidad de vibración de tus cuerdas vocales. Voces masculinas típicas: 85-180 Hz. Femeninas: 165-255 Hz. Varía con emoción, salud, edad y estrés. Cuando alguien está nervioso, el F0 sube. Cuando miente, el jitter (variación del F0) cambia. La IA replica el F0 promedio pero falla en replicar sus microirregularidades naturales — eso es detectable.
Indicador de autenticidad
🌊
Formantes (F1-F4) — Las resonancias de tu tracto vocal
Son las frecuencias de resonancia de tu boca, faringe y nariz. Definen cómo suenan tus vocales. F1 y F2 juntos determinan si escuchamos una "a", una "e" o una "o". Son tan únicos como la forma de tu boca. Un cantante tiene formantes distintos a los de un locutor, aunque digan lo mismo. La IA los captura en el speaker embedding.
Identidad fonética única
🧬
Speaker Embedding — El ADN matemático de tu voz
Un vector de 192 o 512 números generado por una red neuronal (ECAPA-TDNN o d-vector) a partir de todos los features anteriores. Este vector sos vos en matemática. Funciona en cualquier idioma. Se puede crear con 3 segundos de audio limpio. Si alguien lo tiene, puede usarlo para sintetizar tu voz diciendo cualquier cosa, en cualquier idioma, ahora y en el futuro.
Irrecuperable una vez extraído
📐
Prosodia — El ritmo y la melodía de tu habla
Cómo subís y bajás el tono, cómo acelerás o frenas, dónde hacés pausas, cómo enfatizás palabras. La prosodia es cultural (rioplatense vs. cordobés) y personal. Los modelos actuales replican la prosodia promedio bien pero fallan en replicar la prosodia de una persona específica en un estado emocional específico — ese es el talón de Aquiles de los deepfakes actuales.
Indicador de detección
📊
Jitter y Shimmer — Las imperfecciones naturales
Jitter: variación ciclo a ciclo en el período del F0. Shimmer: variación en la amplitud. Las voces humanas reales tienen jitter y shimmer naturales (2-5%). Las voces sintéticas tienen valores fuera de rango (demasiado perfectas o demasiado irregulares). Medibles con Praat (open source). Uno de los indicadores más confiables en condiciones de laboratorio.
Herramienta: Praat
¿Cuánto audio se necesita realmente?
Con 3 segundos de audio limpio → embedding funcional, calidad de 70-80% de similitud perceptual.
Con 30 segundos → 85-92% de similitud. Convincente para la mayoría de personas.
Con 5 minutos → 95%+ de similitud. Indistinguible sin herramientas especializadas.
Todo el audio que publicaste en redes sociales en los últimos 5 años equivale a horas de material de entrenamiento.
Tu voz como dato biométrico · Ley 25.326

Los parámetros que te identifican — y que pueden falsificarse

Frecuencia fundamental
F0 / Pitch
Frecuencia básica de vibración de las cuerdas vocales. En humanos adultos: 85-255 Hz (hombres) y 165-255 Hz (mujeres). Las síntesis actuales replican el rango con error menor al 3%.
Coeficientes cepstrales
MFCC
Mel-Frequency Cepstral Coefficients. Representación compacta del timbre vocal. Es la "huella" que los modelos comparan para identificar y clonar una voz. 13-40 coeficientes capturan la identidad vocal.
Resonancias del tracto
Formantes
F1, F2, F3: frecuencias resonantes del tracto vocal. Determinan qué vocal se percibe. La posición de F1-F2 es única por individuo. En síntesis: replicables con precisión milimétrica.
Ruido armónico
HNR
Harmonics-to-Noise Ratio. Relación entre componentes periódicas (voz limpia) y aperiódicas (soplo, ronquera). Valor normal: 15-25 dB. Las voces sintéticas tienden a ser anormalmente "limpias".
Parámetro Rango Humano Normal Señal Sintética — Alerta
Jitter 0.5 – 2.0 % < 0.5% (demasiado perfecto) o > 2.5% (calidad baja)
Shimmer 1 – 4 % < 1% (anormalmente estable) o > 5% (artefactos)
HNR 15 – 25 dB > 30 dB (exceso de limpieza) o < 5 dB (muy comprimido)
Proceso técnico · Paso a paso

Cómo se clona una voz:
el pipeline completo explicado

Desde el audio de referencia hasta el mensaje de WhatsApp que recibe la víctima. Sin tecnicismos innecesarios, con la profundidad que el análisis forense requiere.

01
Captura del material de referencia
El atacante recopila audio de la víctima. Fuentes más comunes: notas de voz de WhatsApp de conversaciones anteriores, videos de Instagram/TikTok/YouTube, entrevistas en medios online, audios de Telegram, grabaciones de videollamadas. Con 3 segundos de audio limpio es suficiente para un clon funcional. Con 30 segundos, el resultado es convincente para el 85% de personas. No se necesita acceso físico al dispositivo. El material está públicamente disponible en la mayoría de los casos.
fuentes comunes: Instagram Stories · YouTube · Podcast público · Nota de voz de WhatsApp reenviada
02
Preprocesamiento del audio
El audio crudo necesita limpieza para que el speaker encoder pueda extraer features correctamente. Se aplica: reducción de ruido (Audacity: Effects → Noise Reduction, o DeepFilter en Python), normalización de volumen (target: -20 LUFS), separación de silencios, conversión a WAV 16kHz mono (formato óptimo para extracción de MFCC). Sin este paso, la calidad del clon baja significativamente.
ffmpeg -i input.mp3 -ar 16000 -ac 1 -af "loudnorm" output.wav
03
Extracción del Speaker Embedding (el ADN de voz)
Una red neuronal (ECAPA-TDNN en XTTS-v2, d-vector en ElevenLabs) procesa el audio preprocesado frame por frame (ventanas de 25ms con overlap de 10ms). De cada frame extrae los MFCC y los pasa por capas de la red. El resultado es un vector de 192 o 512 dimensiones — el speaker embedding. Este vector captura timbre, prosodia, formantes y patrones únicos. Se puede almacenar y reutilizar indefinidamente sin el audio original.
speaker_embedding = encoder.encode(audio_16k) # vector [192] o [512]
04
Síntesis TTS neural zero-shot
El modelo TTS (XTTS-v2 usa una arquitectura basada en VITS + cross-lingual speaker conditioning) recibe como entrada: (a) el texto a sintetizar y (b) el speaker embedding. Sin necesidad de reentrenar el modelo, genera un mel-spectrogram — una representación visual bidimensional del audio (tiempo vs. frecuencia). El "zero-shot" es la clave: el modelo nunca vio esta voz durante su entrenamiento inicial, pero puede sintetizarla correctamente usando el embedding como condición.
mel = tts_model.synthesize(text="Autorizo la transferencia", speaker_embedding=embedding)
05
Vocoder neural (HiFi-GAN) — De matemática a audio
El mel-spectrogram generado en el paso anterior es una representación matemática, no audio audible. El vocoder (HiFi-GAN en la mayoría de sistemas modernos) lo convierte en una forma de onda (waveform) a 22.050 Hz o 24.000 Hz. HiFi-GAN funciona en tiempo real o muy cerca: genera audio 13x más rápido que el tiempo real en una GPU modesta. El resultado ya es un archivo .wav reproducible con calidad superior a una llamada telefónica.
audio = vocoder.generate(mel) # WAV 22050 Hz, 60 seg generados en ~5 seg
06
Post-processing — "Hacerlo sonar como WhatsApp"
Un audio de síntesis de alta calidad puede ser detectado por herramientas anti-spoofing. Pero si se comprime al formato de WhatsApp (OPUS Ogg Vorbis, 32kbps, 24kHz), los artefactos de alta frecuencia que delatan la síntesis desaparecen bajo el ruido de compresión. Paradoja: la compresión de WhatsApp ayuda al deepfake. El resultado suena exactamente como una nota de voz grabada desde un teléfono Android o iPhone en condiciones normales.
ffmpeg -i fake_hd.wav -c:a libopus -b:a 32k -ar 24000 nota_voz.ogg
07
Variante crítica: Real-Time Voice Conversion (RVC)
El vector de ataque más peligroso. En lugar de sintetizar un audio pregrabado, RVC convierte la voz del atacante en la de la víctima en tiempo real durante una llamada activa. El atacante habla con su propia voz; el sistema la convierte en la del CEO, el familiar, el médico. Latencia: 100-300ms (imperceptible en conversación). El receptor escucha la voz "correcta" en tiempo real. Disponible en GitHub gratuitamente. No requiere GPU profesional. Fue usado en el caso de CEO fraud de USD 243.000 en Arizona (2024).
pipeline: micrófono → encoder → FAISS retrieval → decoder → salida en tiempo real (100-300ms)
¿Por qué el caso del cantante es didáctico para entender la biometría?
Para clonar la voz de un cantante como Freddie Mercury o Michael Jackson: se toman todas las grabaciones comerciales disponibles (horas de audio), se separa la voz de la música (con Demucs, open source), se extraen los MFCC y formantes de cada canción, se entrena un voice conversion model en esas características, y el resultado es un modelo que puede cantar cualquier canción nueva en esa voz. El proceso evidencia qué datos biométricos contiene el audio: no solo "cómo suena" sino la geometría exacta del tracto vocal de esa persona. Los mismos datos que usa el sistema de identificación biométrica del Aeropuerto de Ezeiza.
Proceso técnico · Paso a paso

Cómo se clona una voz: técnica y derecho en cada paso

Cada paso técnico tiene una implicancia jurídica concreta. Para abogados: la columna derecha es el encuadre normativo aplicable.

01
Adquisición de la muestra
Técnico

3-30 segundos de audio de fuente pública (YouTube, Instagram, podcast). FFmpeg extrae el audio del video. Normalización a WAV 16kHz mono. El atacante no necesita acceso físico al dispositivo de la víctima.

02
Speaker Embedding — Extracción de huella vocal
Técnico

Red neuronal ECAPA-TDNN procesa el audio en ventanas de 25ms. Extrae MFCC y los comprime en un vector de 192 dimensiones — el "ADN vocal". Este vector puede almacenarse y reutilizarse indefinidamente sin el audio original.

03
Síntesis de texto — TTS Zero-Shot
Técnico

El modelo XTTS-v2 recibe (a) el texto a sintetizar y (b) el speaker embedding. Sin reentrenar el modelo, genera un mel-spectrogram. "Zero-shot": el modelo nunca entrenó con esta voz pero la reproduce usando el embedding como condición de síntesis.

04
Vocoder y distribución
Técnico

HiFi-GAN convierte el mel-spectrogram en forma de onda audible (22.050 Hz). Calidad superior a llamada telefónica. Se convierte a .ogg (OPUS) para WhatsApp. La compresión degrada artefactos espectrales.

Ecosistema de herramientas · Creación y detección

Las herramientas reales:
cómo se usan y cómo se auditan

Cada herramienta listada es real, funcional hoy, y relevante para el análisis forense — ya sea porque el atacante la usa o porque el investigador la necesita.

Herramientas de creación — Lo que usa el atacante

FREEMIUM · WEB
ElevenLabs
ZERO-SHOT VOICE CLONING · TTS NEURAL
La herramienta más usada en fraudes documentados de 2024-2025. Instant Voice Cloning funciona con 30 segundos de audio. Plan gratuito: 10.000 caracteres/mes (~8 minutos de audio). No requiere GPU ni instalación. Interfaz web simple. Tiene términos de uso que prohíben el uso malicioso — sin impacto en la práctica forense ya que el abuso es el problema.
elevenlabs.io → Voice Lab → Instant Voice Cloning
Cómo auditarla: verificar política de retención de audios subidos (por defecto los retiene). Checar si implementa SynthID o watermarking propio. Revisar si el audio generado tiene metadatos identificatorios del servicio.
OPEN SOURCE · LOCAL
Coqui TTS / XTTS-v2
ZERO-SHOT · MULTILINGÜE · SIN TRAZABILIDAD
Modelo open source descargable y ejecutable localmente. Sin trazabilidad. Sin registro. Sin límites. Soporta 17 idiomas incluyendo español. Requiere Python 3.10+ y ~8GB RAM. El audio generado no tiene ningún marcador del origen — el mayor desafío forense. Dataset de entrenamiento: VCTK + LibriTTS (documentado, auditable).
github.com/coqui-ai/TTS · pip install TTS
Cómo auditarla: el código fuente es completamente auditable en GitHub. El modelo pesa ~2GB. Sin watermark. Para identificar si un audio fue generado con XTTS-v2, buscar artefactos espectrales específicos de su vocoder HiFi-GAN adaptado.
OPEN SOURCE · TIEMPO REAL
RVC — Real-Time Voice Conversion
CONVERSIÓN EN TIEMPO REAL DURANTE LLAMADAS
Convierte la voz del atacante en la de la víctima con 100-300ms de latencia durante una llamada activa. Requiere GPU (recomendado NVIDIA RTX 3060 o superior). Disponible como RVC-WebUI en GitHub con interfaz gráfica. El atacante instala un audio virtual (VB-Audio Cable) que redirige la voz convertida a la app de llamadas. Totalmente indetectable sin análisis espectral post-call.
github.com/RVC-Project/Retrieval-based-Voice-Conversion-WebUI
Cómo auditarla: en grabaciones de llamadas comprometidas, buscar cortes abruptos de latencia, periodicidad antinatural en la distribución de pitch, ausencia de respiración orgánica entre frases.
OPEN SOURCE · EXPRESIVO
Bark (Suno AI)
TTS CON EMOCIONES · RISAS · PAUSAS NATURALES
Genera voz con expresividad emocional: llanto, risa, susurros, pausa dramática. Ideal para deepfakes de mensajes familiares de emergencia ("mamá, tuve un accidente, estoy llorando"). No es tan preciso en identidad vocal como XTTS-v2 pero es más expresivo. El output emocional baja las defensas del receptor.
github.com/suno-ai/bark
Cómo identificarlo: la expresividad emocional artificial tiene patrones de pitch rise/fall que no coinciden con la prosodia natural de la persona real. Analizable en Praat.

Herramientas de detección y análisis forense

GRATUITO · MULTIPLATAFORMA
Audacity
ANÁLISIS ESPECTRAL VISUAL · FORENSE BÁSICO
El primer paso en cualquier análisis forense de audio. Vista de espectrograma (View → Spectrogram): permite ver regularidades artificiales en 8-16 kHz, ausencia de ruido ambiental, silencio perfecto entre palabras. No determinante por sí solo, pero es el indicador preliminar más accesible. El instalador está en la carpeta del proyecto.
audacityteam.org/download/ — gratuito, Windows/Mac/Linux
Protocolo: File → Import Audio → View → Spectrogram. Observar en rango 6-16 kHz: uniformidad excesiva = sospechoso. Comparar con audio de referencia conocido de la misma persona.
OPEN SOURCE · ACADÉMICO
AASIST
ANTI-SPOOFING · ASVspoof5 · DETECCIÓN NEURAL
Audio Anti-Spoofing using Integrated Spectro-Temporal graph attention networks. Modelo de referencia del challenge ASVspoof 5 (Interspeech 2024). EER (Equal Error Rate) de 0.83% en condiciones de laboratorio. Degrada a 15-25% EER en condiciones reales de compresión. Requiere Python + PyTorch.
github.com/clovaai/aasist · paper: arXiv:2110.01200
Uso forense: correr sobre la copia forense (nunca el original). Documentar versión del modelo, parámetros de inferencia, score de salida, y las condiciones de compresión del audio. El score no es binario: documentar la distribución de probabilidad.
GRATUITO · WEB
AI Voice Detector
DETECCIÓN ONLINE · SIN INSTALACIÓN
Herramienta web de acceso libre para detección rápida. Sube un archivo de audio y devuelve un score de probabilidad de ser IA generado. Útil para primer triaje. No debe usarse como evidencia principal en juicio — no es un modelo auditado para contexto forense y no documenta cadena de custodia.
aivoicedetector.com — sin registro necesario
Limitación forense: el audio se sube a servidores externos — rompe la cadena de custodia si se usa sobre el original. Usar solo sobre copia forense previa generación de hash.
GRATUITO · CLI
MediaInfo + ExifTool + CertUtil
METADATOS · HASH · CADENA DE CUSTODIA
El trío de herramientas básicas de forense de archivo. MediaInfo: codec, bitrate, sample rate, duración exacta. ExifTool: metadatos embebidos (fecha de creación, herramienta de creación si está disponible). CertUtil (Windows) o sha256sum (Linux/Mac): generación del hash de integridad.
mediaarea.net/MediaInfo · exiftool.org · incluido en Windows
Protocolo ISO 27037: CertUtil -hashfile archivo.ogg SHA256 → anotar hash → solo entonces continuar análisis. Este hash es la cadena de custodia del archivo digital.
OPEN SOURCE · LINGÜÍSTICO
Praat
ANÁLISIS FONÉTICO · JITTER · SHIMMER · F0
Herramienta académica de lingüística computacional. Mide jitter (variación F0 ciclo a ciclo), shimmer (variación de amplitud), HNR (Harmonics-to-Noise Ratio), y traza el espectrograma de banda ancha/estrecha. Los valores de jitter y shimmer fuera del rango natural son indicadores de síntesis. Disponible gratuitamente para todas las plataformas.
fon.hum.uva.nl/praat/ — estándar en fonética forense
Valores de referencia: jitter local normal: 0.5-2%. Shimmer local: 2-5%. HNR: 15-25 dB. Valores sintéticos típicos: jitter < 0.2% (demasiado perfectos) o > 3% (modelo de baja calidad).
GRATUITO · API
Resemble Detect
DETECCIÓN COMERCIAL · API · MAYOR PRECISIÓN
API de detección de audio sintético de Resemble AI. Mayor tasa de precisión que las herramientas open source en condiciones reales (compresión incluida). Devuelve score por segmentos del audio, no solo global. Útil para detectar deepfakes parciales (donde solo algunas frases fueron sintetizadas). Plan gratuito limitado.
resemble.ai/detect
Uso forense: el análisis por segmentos es valioso para identificar edición de audio: si un segmento puntual en un audio largo aparece como sintético, puede indicar una inserción.
Identidad digital · Casos cercanos

La voz como identidad digital
y la falsificación de audios de WhatsApp

El vector de ataque más común en Argentina no es la videollamada corporativa de USD 25M. Es la nota de voz de WhatsApp. Y es el que más funciona.

🪪
¿Qué es la identidad digital de voz?
La identidad digital no es solo un usuario y contraseña. Es el conjunto de datos biométricos que nos identifican en los sistemas digitales: cara, huella dactilar, iris, y voz. La voz ya se usa para autenticación bancaria (Banco Santander, HSBC) y en sistemas de call center. Si alguien puede reproducir tu voz, puede potencialmente autenticarse como vos en estos sistemas.
Art. 2° Ley 25.326 — Dato biométrico sensible
📱
Por qué WhatsApp es el vector perfecto
1. La nota de voz lleva el nombre y foto del contacto conocido. 2. La compresión OPUS 32kbps elimina los artefactos de síntesis que delatan al deepfake. 3. El formato .ogg no preserva metadatos de origen cuando se reenvía. 4. La urgencia emocional activa respuestas primitivas antes que el análisis crítico. 5. La longitud corta (15-30 seg) limita el tiempo de análisis.
Compresión OPUS: el aliado del atacante
🎤
Cómo se clona la voz de un cantante (caso educativo)
Paso 1: separación de voz/música con Demucs (open source, Meta). Paso 2: extracción de MFCC y embeddings de cada canción. Paso 3: fine-tuning del voice conversion model en ese timbre específico. Paso 4: el modelo puede cantar cualquier canción nueva en esa voz. Esto evidencia que los datos biométricos de voz están codificados en todas las grabaciones — no solo en el habla conversacional.
Demucs: github.com/facebookresearch/demucs
🔍
Cómo se identifican los datos biométricos de voz
En términos entendibles: imaginá que tu voz es como una melodía que siempre tocás de la misma manera, con el mismo instrumento (tu garganta), con el mismo estilo (tu prosodia). Los MFCC capturan la "calidad del instrumento". El F0 captura el "tono base". Los formantes capturan "cómo tocás las notas". La IA extrae esos datos y puede tocar la misma melodía con cualquier letra nueva.
Metáfora para público mixto

El paso a paso de una estafa de audio de WhatsApp

A
Recopilación de inteligencia (OSINT)
El atacante investiga a la víctima y a su red de contactos. Identifica quién es el familiar, jefe o amigo más influyente. Busca audios o videos públicos de esa persona: un video de graduación, una nota de voz reenviada en un grupo, una entrevista en la radio local. Descarga el audio o video. En la mayoría de los casos tiene materiales más que suficientes sin piratear nada.
B
Clonación y síntesis del mensaje falso
Sube el audio a ElevenLabs (o usa XTTS-v2 localmente). Escribe el script del mensaje falso, cuidando el registro de habla de esa persona (¿dice "che" o "oiga"? ¿habla rápido o lento? ¿qué palabras usa habitualmente?). Genera el audio. Escucha y ajusta. El proceso completo desde el material de referencia hasta el audio final toma entre 5 y 30 minutos.
tiempo total: 5-30 minutos · costo: USD 0 · materiales: internet + PC estándar
C
Conversión al formato WhatsApp
Convertir con ffmpeg al formato exacto de WhatsApp: OPUS, 32kbps, 24kHz mono. El resultado es un archivo .ogg indistinguible del formato nativo de WhatsApp. Renombrado como nota de voz. El archivo no tiene metadatos que indiquen origen sintético — WhatsApp no preserva esa información en el formato que usa para notas de voz.
ffmpeg -i fake.wav -c:a libopus -b:a 32k -ar 24000 -ac 1 nota_falsa.ogg
D
Entrega y explotación de la urgencia emocional
El mensaje se envía desde un número spoofed o desde una cuenta comprometida del contacto real. El receptor ve el nombre y foto del familiar o jefe. Escucha su voz. El script siempre incluye: urgencia extrema, petición de no verificar con otros ("no le digas a nadie todavía"), ventana temporal corta ("el banco cierra en 20 minutos"). La urgencia emocional desactiva el análisis crítico antes de que comience.
El dato más inquietante del análisis de casos argentinos: en el 78% de los casos reportados a UFECI con voz clonada, la víctima reconoció que "algo sonaba raro" pero igual actuó porque "la urgencia era real". La tecnología no es perfecta. La ingeniería social sí. El ataque funciona porque explota la presión temporal, no la calidad del deepfake.
Análisis forense de audio · Protocolo técnico

Cómo identificar un deepfake de voz:
protocolo de análisis bajo ISO 27037/27042

El análisis de evidencia de audio sintético requiere un protocolo documentado y reproducible. Sin protocolo, el análisis no es forense — es opinión.

Regla de oro — Lo primero siempre: generar el hash SHA-256 del archivo ANTES de reproducirlo, abrirlo o analizarlo. CertUtil -hashfile audio.ogg SHA256 (Windows) o sha256sum audio.ogg (Linux/Mac). Anotar el hash, fecha y hora. Trabajar solo sobre copia forense. El archivo original no se toca más. Sin este paso, la defensa puede impugnar toda la prueba posterior.
ISO
27037
Paso 1 — Preservación y cadena de custodia
Hash SHA-256 del archivo original. Documentar: hash, tamaño en bytes, nombre original, dispositivo donde se encontró, fecha y hora de adquisición, persona que realizó la adquisición. Crear copia forense bit-a-bit. Almacenar original en evidencia sellada (digital o física). Todos los análisis posteriores se realizan sobre la copia. Esta documentación es la cadena de custodia — sin ella, la evidencia es impugnable.
CertUtil -hashfile audio_original.ogg SHA256 > hash_registro.txt
Capa
1
Análisis de metadatos (MediaInfo + ExifTool)
Examinar: codec y versión, bitrate (constante vs. variable — la voz humana real tiene bitrate variable), sample rate (48kHz en supuesta grabación de celular es sospechoso — los celulares graban a 44.1kHz o 22.05kHz), duración exacta al milisegundo, fecha de creación vs. fecha de modificación, herramienta de creación si está embebida. Un audio generado por XTTS-v2 puede tener "Python" en los metadatos si no fueron limpiados. ElevenLabs tiene su propio fingerprint en los primeros bytes.
mediainfo audio_copia.ogg | grep -E "Format|Bit rate|Sampling rate|Codec"
Capa
2
Análisis espectral visual (Audacity)
Abrir en Audacity → View → Spectrogram. Observar: (1) Rango 8-16 kHz: uniformidad antinatural sugiere síntesis (la voz humana tiene distribución energética irregular en altas frecuencias). (2) Silencios entre palabras: silencio perfecto = sintético (la voz real tiene "lip sounds", respiración, ruido ambiental). (3) Amplitud: envolvente demasiado uniforme es sospechoso. (4) Ausencia de ruido ambiental consistente a lo largo del audio. Documentar con screenshots de pantalla con timestamp.
Capa
3
Análisis fonético (Praat) — Jitter, Shimmer, HNR
Medir en Praat sobre la copia forense: Jitter local (normal: 0.5-2%; sintético: <0.2% o >3%), Shimmer local (normal: 2-5%; sintético: fuera de rango), HNR — Harmonics-to-Noise Ratio (normal: 15-25 dB; sintético: puede ser >30 dB por ausencia de ruido orgánico), y el espectrograma de banda estrecha para ver la regularidad de los formantes. Documentar con tablas de valores y comparación con valores de referencia de la persona real si existen.
praat --run analisis.praat audio_copia.wav > resultados_fonoaudiologicos.txt
Capa
4
Modelos anti-spoofing (AASIST / Resemble Detect)
Correr AASIST (clovaai/aasist) sobre la copia forense. El modelo devuelve un score de spoofing probability. Documentar: versión del modelo, parámetros de inferencia, score raw, y las condiciones de compresión del audio (importante: el performance degrada con OPUS/MP3). Si hay divergencia entre el score del modelo y el análisis espectral, documentar la divergencia como "incertidumbre técnica" en el informe — no ocultar resultados contradictorios. Corroborar con Resemble Detect si el presupuesto lo permite.
python run_aasist.py --input audio_copia.wav --model AASIST --output score.json
ISO
27042
Redacción del informe pericial
El informe debe incluir: (1) Identificación del perito y credenciales, (2) Descripción del material analizado con hash SHA-256, (3) Metodología aplicada (reproducible por otro perito), (4) Herramientas usadas con versión exacta, (5) Resultados capa por capa con evidencias (screenshots, logs), (6) Grado de certeza de las conclusiones (no hacer afirmaciones absolutas si el análisis tiene limitaciones), (7) Limitaciones conocidas del análisis (ej: "La compresión OPUS reduce la precisión del modelo anti-spoofing al X%"), (8) Conclusiones técnicas con lenguaje accesible para el tribunal.
Marco normativo · ISO aplicable

Las 4 normas que sostienen una pericia en juicio

No son burocracia. Son el protocolo que hace admisible el trabajo técnico y defendible la postura organizacional.

ISO 27037:2012
Cadena de custodia digital
Hash SHA-256 antes de cualquier acción. Copia forense bit-a-bit. Dispositivo original sellado e intacto. Documentación de cada paso con timestamp.
Aplicación en deepfakes
Audio por WhatsApp requiere dispositivo original + hash SHA-256 para ser evidencia válida. Reenvío del audio = evidencia potencialmente contaminada. El hash del original es la base de todo.
ISO 27042:2015
Análisis e interpretación de evidencia digital
Metodología documentada, reproducible, con grado de certeza declarado. El perito debe declarar explícitamente las incertidumbres y limitaciones del análisis.
Aplicación en deepfakes
Informe válido = espectrograma + AASIST + valores Praat + declaración de incertidumbres. No alcanza concluir "suena falsa". Requiere metodología técnica reproducible.
ISO 27001:2022
Gestión del riesgo biométrico organizacional
Anexo A, Control A.8. La voz en sistemas de autenticación es activo biométrico que requiere evaluación de riesgo explícita y controles documentados.
Aplicación en deepfakes
Organizaciones con verificación por voz deben evaluar riesgo de suplantación sintética. El principio de 4 ojos para transferencias es control mínimo recomendado bajo A.5.24.
ISO 42001:2023
Gestión de sistemas de IA
Primera norma específica para gestión de IA. AI Impact Assessment requerido antes de desplegar sistemas que sinteticen, analicen o usen voz.
Aplicación en deepfakes
Organizaciones que usan síntesis de voz deben documentar riesgos, salvaguardas y responsabilidades. El gap entre capacidad técnica y marco normativo es activo hoy.
EU AI Act — Reglamento (UE) 2024/1689:
Art. 5: deepfakes con intención de engaño = práctica de IA prohibida.
Art. 50(4): etiquetado obligatorio de contenido IA generado.

Argentina — Estrategia Nacional de IA 2023: marco de referencia, NO normativa vinculante. El Código Penal no tipifica deepfakes de voz como delito autónomo. Los arts. 173, 153 bis y 1770 CCyC son instrumentos imperfectos pero aplicables. Gap regulatorio activo.
Protocolos de protección · Personal y organizacional

Tres capas de defensa:
lo que funciona antes del ataque

El protocolo establecido antes del ataque decide si la víctima sobrevive al ataque. No hay protocolo que funcione si se diseña durante la crisis.

👨‍👩‍👧
Protocolo Personal / Familiar
La palabra código: establece con tu familia una palabra o frase secreta que deben incluir en cualquier llamada de emergencia real. Sin esa palabra, la llamada no es válida — verificar por canal alternativo antes de actuar. Elegir algo que no esté en redes sociales ni en conversaciones grabables. Renovar cada 6 meses. Nunca escribirla en WhatsApp.
Implementable hoy · USD 0
🏢
Protocolo Organizacional / CEO Fraud
Principio de 4 ojos + fuera de banda: toda transferencia financiera requiere: (1) aprobación de dos personas independientes, (2) confirmación por canal alternativo al que recibió la solicitud original. Si el CEO llama por teléfono pidiendo transferencia urgente, la confirmación se hace por email institucional o reunión física, nunca en la misma llamada. Documentar en política de seguridad (ISO 27001 A.5.24).
ISO 27001 A.5.24 · A.8.7
🔍
Auditoría de Huella de Voz Pública
Inventariar cuántos minutos de tu voz existen públicamente online. Busca tu nombre en YouTube, Instagram, TikTok, LinkedIn. Configura privacidad: Instagram privado, deshabilitar Stitch/Duet en TikTok, restringir videos en LinkedIn. Eliminar historial de voz en Google My Activity y de asistentes de voz (Siri, Alexa, Google). No es eliminar el riesgo — es reducirlo a lo mínimo gestionable.
GDPR Art. 17 · Ley 25.326 Art. 16
Protocolo de Respuesta a Incidente
Si recibís un audio sospechoso: (1) NO lo reenvíes — amplificás el daño, (2) NO lo borres — es evidencia, (3) generá hash SHA-256 antes de tocarlo, (4) documentá contexto: quién lo envió, desde qué número, a qué hora, en qué chat, (5) Reportá a UFECI: fiscales.gob.ar/ufeci o al CERT.ar. Si es un incidente corporativo, activar el plan de respuesta ISO 27001 antes de notificar externamente.
UFECI · CERT.ar · ISO 27001 A.5.24
El protocolo que más vidas salva, probado en casos reales:
"Ante cualquier solicitud urgente de dinero o información sensible recibida por voz o audio — parar, colgar, llamar directamente al número conocido de la persona desde mis propios contactos. Nunca llamar de vuelta al número que me llamó."
Eso es todo. Un solo paso. El 90% de los fraudes con voz clonada reportados en Argentina se hubieran detenido ahí.
Simuladores interactivos · 3 casos reales

¿Cómo reaccionarías? Decisiones bajo presión real

Hacé click en una opción para ver las consecuencias técnicas, forenses y jurídicas de tu elección.

Simulador 1 · Presion alta
El llamado del CFO
ROL: Gerente de finanzas · Buenos Aires · 9:15 AM
TIEMPO
30 seg
Recibís una llamada de quien parece tu CFO. Su voz es idéntica. "Necesito una transferencia urgente de $2.500.000 a una cuenta nueva. Es confidencial, no lo menciones con nadie. Antes de las 11."
Elegí tu respuesta:
El tiempo venció — la urgencia te paralizó. Eso es exactamente lo que el atacante busca.
Simulador 2 · Pericia forense
El audio sospechoso
ROL: Perita informática forense · Designada por juzgado · 11:30 AM
TIEMPO
30 seg
Te entregan un USB con un archivo de audio — supuestamente la voz del imputado instruyendo a su socio. El defensor alega deepfake. La jueza necesita tu informe en 48 horas. ¿Cuál es tu primer paso?
Elegí tu acción:
El tiempo venció — la urgencia te paralizó. Eso es exactamente lo que el atacante busca.
Simulador 3 · Estrategia legal
El chatbot de la voz robada
ROL: Abogada/o · Denuncia de ciudadana afectada
TIEMPO
30 seg
Una ciudadana denuncia que crearon un chatbot con su voz clonada en plataforma extranjera usando audios públicos de sus redes sociales. El chatbot la hace "decir" cosas para acosar a terceros. La plataforma está en EE.UU. ¿Cuál es la estrategia legal más efectiva disponible hoy en Argentina?
Elegí tu estrategia:
El tiempo venció — la urgencia te paralizó. Eso es exactamente lo que el atacante busca.
Simuladores interactivos · 6 casos reales

Simuladores con factor de estrés real

Cada caso es una decisión real bajo presión. El temporizador es intencional. La urgencia que sentís es exactamente la que siente la víctima.

CASO 01 · ARUP HOLDINGS · HONG KONG · ENERO 2024 · USD 25.000.000 45
⚡ ESTRÉS MUY ALTO · TIEMPO LIMITADO
Videollamada con el "CFO" y cuatro directivos de la empresa
Es lunes a las 9:15 AM. Sos empleado de ARUP Holdings (firma de ingeniería con sede global en Hong Kong). Recibiste un email del CFO citándote a una videollamada urgente y confidencial. En la llamada estás vos, el "CFO" y cuatro personas que reconocés como directivos de la empresa. El CFO dice que están cerrando una adquisición confidencial y que necesita que proceses 5 transferencias a cuentas diferentes — total: HKD 200 millones (USD 25M) — antes del mediodía. "Nadie más puede saber de esto hasta que anunciemos la adquisición mañana." Las caras y las voces de todos los presentes te resultan completamente familiares y naturales. El CFO mira directo a la cámara y te da las instrucciones en voz alta. ¿Qué hacés?
FACTOR DE ESTRÉS
CRÍTICO
CASO 02 · CEO FRAUD · ARGENTINA · 2025 · AUDIO WHATSAPP 40
⚡ ESTRÉS ALTO · PRESIÓN TEMPORAL
Nota de voz de WhatsApp del "CEO" pidiendo transferencia urgente
Son las 8:45 AM del lunes. Sos gerente de administración de una empresa mediana en Buenos Aires. Tu celular recibe una nota de voz de WhatsApp del número del CEO — el contacto aparece con su nombre y foto. La voz dice: "Hola, soy [nombre del CEO]. Mira, estoy en una reunión ahora, no puedo hablar. Necesito que hagas una transferencia urgente antes de las 10 AM a una cuenta nueva de un proveedor que acabo de cerrar. Te mando los datos por este chat. Son $2.400.000. No le digas nada a nadie del equipo porque todavía no anunciamos el contrato. Es muy importante. Confirmame cuando lo tenés listo." La voz suena exactamente como el CEO. El número es el suyo. ¿Qué hacés?
FACTOR DE ESTRÉS
MUY ALTO
CASO 03 · ESTAFA FAMILIAR · "EL CUENTO DEL TÍO" VERSIÓN IA · ARGENTINA 2025 35
⚡ ESTRÉS EMOCIONAL MÁXIMO · DECISIÓN BAJO PÁNICO
Nota de voz de tu hijo/hija: "Mamá, tuve un accidente"
Son las 14:30. Tu hijo de 24 años está manejando de vuelta a Mar del Plata desde Buenos Aires. Te llega una nota de voz de WhatsApp de su número. La voz — que reconocés perfectamente — dice con la voz entrecortada y con llanto: "Mamá, tuve un accidente. Choqué contra otro auto. El otro conductor dice que le rompí el parabrisas y el espejo y que si no le pago ahora llama a la policía. Son $180.000 pesos. Por favor mamá necesito que hagas una transferencia ahora. Estoy en la ruta 2, altura 200, no sé qué hacer. Por favor no le digas nada a papá todavía." La voz tiembla. Reconocés sus muletillas, su forma de hablar. ¿Qué hacés?
FACTOR DE ESTRÉS EMOCIONAL
MÁXIMO
CASO 04 · VISHING BANCARIO CON VOZ CLONADA · ARGENTINA 2025 30
⚡ ESTRÉS ALTO · AUTORIDAD INSTITUCIONAL
Llamada del "Banco" con voz de operadora real clonada
Tu teléfono suena. El número que aparece es el número oficial del banco (spoofing de número). Una voz femenina que reconocés como la de las locutoras del banco — tono profesional, dicción perfecta — dice: "Buenos días, le habla Carla Rodríguez del Departamento de Seguridad del Banco [nombre]. Detectamos tres intentos de compra sospechosos en su tarjeta de crédito terminada en 4821 por un total de $340.000 realizados desde IP de Colombia. Para proteger su cuenta necesitamos validar su identidad y bloquear las operaciones. ¿Podría confirmarme su número completo de DNI, fecha de vencimiento de su tarjeta y el código de verificación de tres dígitos?" La voz suena exactamente como las del banco. El número es el del banco. ¿Qué hacés?
FACTOR DE ESTRÉS
MUY ALTO
CASO 05 · AUDIO POLÍTICO DEEPFAKE · WHATSAPP MASIVO · 2025 35
⚡ ESTRÉS MEDIO · DESINFORMACIÓN MASIVA
Te llega un audio de WhatsApp: "el candidato confesando la corrupción"
Faltan 10 días para las elecciones municipales. Te llega por WhatsApp un audio de 45 segundos reenviado por un contacto de confianza. En el audio, la voz del candidato A (que reconocés de haber visto en entrevistas) dice: "Che, yo sé que esto no puede salir de acá. El contrato con [empresa] ya está arreglado. Ellos ponen $2 millones para la campaña y nosotros les damos la licitación. Así funciona esto." El audio está siendo viral. Ya tiene 50 reenvíos. Tu contacto lo mandó con el comentario: "¡Se terminó! Esto lo grabó alguien de su entorno." ¿Qué hacés?
FACTOR DE ESTRÉS
MEDIO
CASO 06 · PERICIA FORENSE · AUDIO SOSPECHOSO EN CAUSA JUDICIAL 45
🔬 PERICIA TÉCNICA · DECISIÓN FORENSE
¿Cómo proceder con un archivo de audio sospechoso presentado como evidencia?
Sos perita informática forense. La fiscalía te presenta un archivo .ogg que alegan es una nota de voz de WhatsApp del imputado instruyendo a su socio para falsificar documentos. El imputado niega haber mandado ese audio y alega que su voz fue clonada con IA. El archivo fue descargado del celular de la supuesta víctima y copiado en una USB. Tenés acceso al celular original. La defensa ya pidió la nulidad de la prueba por "ausencia de cadena de custodia documentada". ¿Cuál es tu primer paso?
FACTOR DE ESTRÉS
MEDIO — Responsabilidad alta
Conclusiones · Lo que te llevás

5 acciones que hacés esta semana

No hay conciencia sin acción. Estas 5 cosas son implementables hoy, cuestan USD 0, y reducen el riesgo de forma medible.

01
FREEZAR antes de actuar
Ante cualquier solicitud urgente de dinero o información sensible recibida por voz o audio: parar, respirar, colgar. Verificar por canal alternativo — llamando vos al número real del contacto desde tu lista de contactos. El atacante necesita tu urgencia. No se la des.
Implementable: ahora mismo
02
ESTABLECER palabra código familiar
Acordar con tu familia una palabra o frase secreta que debe estar en cualquier llamada de emergencia real. Sin esa palabra, la llamada no es válida — verificar antes de actuar. No escribirla en WhatsApp. Renovar cada 6 meses. Una sola conversación familiar puede evitar $180.000 de pérdida.
Tiempo requerido: 5 minutos
03
AUDITAR tu huella de voz pública
Buscá tu nombre en YouTube, Instagram, TikTok y LinkedIn. Contá cuántos minutos de tu voz existen públicamente. Configurar Instagram/TikTok como privado. Deshabilitar Stitch/Duet en TikTok. Eliminar historial de voz en Google My Activity. No es eliminar el riesgo — es reducirlo.
Tiempo requerido: 30 minutos
04
PRESERVAR antes de denunciar
Si recibís un audio sospechoso: NO borrés, NO reenviés. Generar hash SHA-256 del archivo. Documentar contexto (número origen, hora, chat). Denunciar en UFECI (fiscales.gob.ar/ufeci) o CERT.ar. Sin hash previo, la evidencia es impugnable en juicio.
ISO 27037: hash primero siempre
05
PROTOCOLIZAR en tu organización
Principio de 4 ojos para transferencias: toda instrucción financiera por voz requiere confirmación escrita + aprobación de dos personas por canal alternativo. Documentar en política de seguridad. Entrenar al equipo. El protocolo pre-definido es la única defensa que funciona en tiempo real.
ISO 27001 A.5.24 · A.5.19
Recursos para profundizar · Herramientas funcionales

Herramientas de análisis, normas
y fuentes que funcionan

Solo recursos verificados, accesibles y relevantes para el análisis técnico y la formación continua.

Detección y análisis

GRATUITO
Audacity — Análisis espectral
Herramienta de edición y análisis de audio. View → Spectrogram para análisis forense básico. El instalador está en esta carpeta (Audacity_Installer_via_MuseHub.exe).
audacityteam.org/download/
Uso: File → Import Audio → View → Spectrogram → analizar rango 6-16 kHz buscando uniformidad antinatural.
GRATUITO
Praat — Fonética forense
Software estándar de lingüística computacional. Mide jitter, shimmer, HNR, F0, formantes. Referencia en fonética forense académica y judicial.
fon.hum.uva.nl/praat/
Medir: Pitch → Voice Report. Valores de referencia: jitter < 0.5% (sintético demasiado perfecto) o > 2.5% (voz sintética de baja calidad).
OPEN SOURCE
AASIST — Anti-spoofing neural
Modelo de referencia ASVspoof 5. 95%+ EER en laboratorio. Requiere Python + PyTorch. Paper: arXiv:2110.01200.
github.com/clovaai/aasist
Instalación: git clone + pip install -r requirements.txt. Inferencia: python main.py --mode eval --config ./config/AASIST.conf
GRATUITO · WEB
AI Voice Detector
Detección online sin instalación. Para primer triaje. No usar sobre originales forenses — rompe cadena de custodia.
aivoicedetector.com
Sube el audio, espera el score. Útil para triaje inicial. No citar como evidencia única en informes forenses.
GRATUITO · CLI
MediaInfo — Metadatos de audio
Extracción de metadatos técnicos: codec, bitrate, sample rate, duración exacta. Disponible en Windows, Mac y Linux.
mediaarea.net/en/MediaInfo
Buscar: bitrate constante (sospechoso en voz), sample rate 48kHz (inusual para celular), codec mismatch.
OPEN SOURCE
Demucs (Meta) — Separación voz/música
Separa la voz del fondo musical en grabaciones. Útil para extraer muestras limpias de voz de videos musicales o con música de fondo.
github.com/facebookresearch/demucs
pip install demucs → demucs audio.mp3 → salida en /separated/htdemucs/

Normas y documentación técnica

ISO · NORMATIVA
ISO/IEC 27037:2012
Identificación, recolección, adquisición y preservación de evidencia digital. El estándar fundamental de forense digital.
iso.org/standard/44381.html
Disponible también en versión gratuita a través de IRAM (Instituto Argentino de Normalización). Buscar en iram.org.ar.
ISO · NORMATIVA
ISO/IEC 27042:2015
Análisis e interpretación de evidencia digital. Complemento de ISO 27037 para el proceso de análisis.
iso.org/standard/44405.html
ISO · IA · 2023
ISO/IEC 42001:2023
El primer estándar ISO específico para gestión de sistemas de IA. Publicado en diciembre 2023. Incluye AI Impact Assessment.
iso.org/standard/81230.html
OPEN ACCESS · ACADEMIA
ASVspoof 5 Challenge Papers
Interspeech 2024. Los modelos de detección más avanzados publicados. arXiv:2408.08739 — resumen del challenge y estado del arte.
arxiv.org/abs/2408.08739
GRATUITO · ARGENTINA
UFECI — Unidad Fiscal para Ciberdelitos
Unidad especializada del Ministerio Público Fiscal de Argentina. Estadísticas de ciberdelitos, recursos para víctimas, formulario de denuncia.
fiscales.gob.ar/ufeci/
GRATUITO · ARGENTINA
CERT.ar — Centro de Respuesta
Centro Nacional de Respuesta a Incidentes de Seguridad Informática. Reportar incidentes, guías de seguridad, alertas de amenazas.
cert.ar

Verificación y fact-checking

GRATUITO · ARGENTINA
Chequeado
Plataforma argentina de verificación de información. Primera parada ante un audio o video político sospechoso.
chequeado.com
GRATUITO
SynthID Detector (Google)
Detecta marca de agua inaudible en audios generados con herramientas de Google DeepMind. Limitación: solo aplica a esas herramientas específicas.
deepmind.google/technologies/synthid/
GRATUITO · WEB
Resemble Detect
API de detección de audio sintético con análisis por segmentos. Mayor precisión en condiciones de compresión. Plan gratuito limitado.
resemble.ai/detect
GRATUITO · CLI
ffprobe (parte de ffmpeg)
Análisis de contenedores de audio/video. Revela codec, bitrate, sample rate, streams embebidos. Disponible junto con ffmpeg.
ffmpeg.org/download.html
ffprobe -v quiet -print_format json -show_streams audio.ogg
Kit completo · Materiales para la experiencia

Cinco recursos diseñados para acompañar la charla
antes, durante y después del panel

Cada pieza tiene un momento de uso. La presentación es para acompañar la exposición en vivo. El kit interactivo y el protocolo son para la práctica de cada participante. El glosario y el cheat-sheet quedan como referencia profesional después del evento.

🎙️
Material principal · Durante el panel
La presentación visual en formato slide
Versión optimizada para proyectar durante la exposición. Diseño limpio sobre fondo claro, secciones secuenciales: contexto, biometría, pipeline, herramientas, normas, protocolos y acciones. Sin simuladores — esos viven en el kit interactivo.
▶ Abrir presentación
🎮
Interactivo
Kit interactivo · 8 dilemas gamificados
Ocho escenarios con factor de estrés real para practicar la decisión bajo presión: ARUP, CEO fraud, audio familiar, vishing bancario, audio político, pericia forense y más. Cada caso incluye consecuencias técnicas, forenses y jurídicas.
Práctica grupal · Durante o después
🛡️
Protocolo
Protocolo Cero Confianza
Las tres reglas mínimas para activar hoy frente a llamadas o audios sospechosos. Implementable en cinco minutos, costo USD 0. Aplicable a la familia, al equipo de trabajo y al ejercicio profesional.
Implementación inmediata · 5 min
📖
Referencia
Glosario técnico-legal
Cuarenta términos técnicos (MFCC, jitter, speaker embedding, vocoder, HiFi-GAN, OPUS, AASIST) traducidos al lenguaje jurídico. Diseñado para abogados y operadores del derecho que necesitan entender la evidencia técnica.
Consulta · Antes y después
⚖️
Estrado
Cheat-Sheet ISO para estrado
Referencias rápidas de las normas ISO 27037, 27042, 27001 y 42001 aplicadas a evidencia digital. Tres líneas por norma: artículo, aplicación al caso, respuesta a preguntas trampa en sala.
Sala de audiencia · Durante pericia
🧭 Ruta sugerida: 1 · Presentación 2 · Kit interactivo 3 · Protocolo 4 · Glosario + Cheat-Sheet — para llevarse y volver durante la práctica profesional