Panel · Facultad de Derecho · UNMdP · 27 Mayo 2026

Cuando tu voz se convierte
en el arma.

Clonación de voz con IA: cómo funciona desde adentro, cómo se detecta, qué normas aplican y qué hacer cuando el ataque ya ocurrió. Tecnología real, casos cercanos, protocolos concretos.

Ing. Marina Soledad Cabreros Perito Informático Forense ISO 27001 · 27037 · 27042 · 42001 Demostración en vivo durante el panel
3 seg
audio para
clonar voz
USD 0
costo del
ataque
+2.000%
crecimiento
3 años
4 ISO
normas que
aplican hoy
El escenario actual · Datos verificados 2024-2026

El problema en números reales

Antes de la tecnología, la escala. Estos números hacen que el tema deje de ser abstracto y empiece a ser tu problema.

3 seg
de audio público para clonar una voz funcional. En 2020 hacían falta horas. En 2023: minutos. En 2025: 3 segundos.
ElevenLabs · SecurityToday 2025
+2.000%
crecimiento de fraudes con deepfakes de voz en tres años a nivel global. Curva exponencial, sin desaceleración.
Sumsub Identity Fraud Report 2025
USD 25M
fraude máximo documentado: ARUP Holdings, Hong Kong, enero 2024. Videollamada con "CFO y cuatro directivos" — todos deepfakes.
Reuters · Hong Kong Police 2024
70%
de personas no distingue una voz clonada de alta calidad de una voz humana real al escucharla.
MIT Media Lab · ASVspoof 2024
34.468
denuncias por ciberdelitos en Argentina en 2024. 13,5% por suplantación de identidad. Crecimiento del 38% vs. 2023.
UFECI · fiscales.gob.ar 2025
+400%
aumento del vishing con voz IA en Argentina en 2025 vs. el año anterior. El "cuento del tío" se actualizó.
CERT.ar · ESET Latinoamérica 2025
USD 16.600M
pérdidas totales por cibercrimen en EE.UU. en 2024. BEC + voice AI entre los principales vectores.
FBI IC3 Annual Report 2024
USD 0
costo de acceso a herramientas de clonación de voz de calidad profesional hoy. El atacante no necesita presupuesto.
XTTS-v2 · RVC GitHub 2025
El dato que más incomoda: el 70% que no distingue una voz falsa incluye a abogados, médicos, jueces, periodistas, ingenieros. La capacidad de detectar no es función de la inteligencia ni del nivel educativo: es función de tener las herramientas correctas. En contexto forense, el peritaje técnico reemplaza al oído humano.
"Los datos biométricos son sensibles porque una vez entregados o perdidos son irrecuperables. Una contraseña se cambia. La voz, no." — Dr. Federico Álvarez Larrondo, Mar del Plata, 2024
Fundamento técnico · Biometría vocal · Ley 25.326

Tu voz tiene una huella digital única
que no sabías que existía

Los modelos de IA no "graban e imitan". Extraen datos biométricos que existen en cada audio que publicás y construyen una representación matemática de quién sos vocalmente. Para siempre.

Coeficientes cepstrales
MFCC
13 a 40 números calculados cada 25 ms de audio. Describen el timbre — lo que hace que tu voz suene como la tuya. El banco de filtros Mel aproxima cómo el oído humano procesa el sonido. Es el feature primario en reconocimiento de locutor.
Frecuencia fundamental
F0 / Pitch
Velocidad de vibración de las cuerdas vocales. Voces masculinas típicas: 85-180 Hz. Femeninas: 165-255 Hz. Varía con emoción, salud, edad y estrés. La IA replica el promedio pero falla en replicar microirregularidades naturales.
Resonancias del tracto
Formantes (F1-F4)
Frecuencias resonantes de boca, faringe y nariz. F1-F2 determinan si se percibe una "a", "e" u "o". Son tan únicos como la geometría exacta de tu tracto vocal. La IA los captura en el speaker embedding.
El ADN matemático
Speaker Embedding
Vector de 192-512 números generado por red neuronal (ECAPA-TDNN o d-vector). Es vos en matemática. Funciona en cualquier idioma. Se crea con 3 segundos de audio limpio. Una vez extraído, irrecuperable.
Ritmo y melodía
Prosodia
Cómo subís y bajás el tono, dónde pausás, cómo enfatizás. Cultural (rioplatense vs. cordobés) y personal. Los modelos replican la prosodia promedio bien, pero fallan en replicar prosodia individual en un estado emocional específico.
Imperfecciones naturales
Jitter · Shimmer · HNR
Jitter: variación ciclo a ciclo del F0 (normal: 0,5-2%). Shimmer: variación de amplitud (2-5%). HNR: relación armónico-ruido (15-25 dB). Las voces sintéticas tienen valores fuera de rango. Medibles con Praat.

Valores de referencia forense

Parámetro Rango humano normal Señal sintética — alerta
Jitter 0,5 – 2,0 % < 0,2 % (demasiado perfecto) o > 3 % (calidad baja)
Shimmer 2 – 5 % < 1 % (anormalmente estable) o > 5 % (artefactos)
HNR 15 – 25 dB > 30 dB (exceso de limpieza) o < 5 dB (sobrecomprimido)
¿Cuánto audio se necesita realmente? Con 3 segundos de audio limpio se obtiene un embedding funcional, similitud perceptual del 70-80%. Con 30 segundos se llega a 85-92%, convincente para la mayoría. Con 5 minutos supera el 95% e indistinguible sin herramientas especializadas. Todo el audio que publicaste en redes en los últimos 5 años equivale a horas de material de entrenamiento.
Marco legal vigente (Ley 25.326, art. 9): la voz es dato biométrico sensible. Publicar contenido en redes sociales NO equivale a consentir su uso para entrenar modelos de IA. El consentimiento para una finalidad (difusión pública) no cubre otras (extracción biométrica, síntesis). Dar una conferencia no habilita usos tecnológicos posteriores no comunicados.
Proceso técnico · Paso a paso

Cómo se clona una voz: técnica y derecho
en cada paso del pipeline

Cada paso tiene una implicancia jurídica concreta. Para abogados: la columna derecha es el encuadre normativo aplicable.

01
Captura del material de referencia
Técnico

3-30 segundos de audio de fuente pública: nota de voz de WhatsApp, video de Instagram/TikTok/YouTube, entrevista en medios, llamada grabada. FFmpeg extrae el audio. Normalización a WAV 16 kHz mono. El atacante no necesita acceso físico al dispositivo.

02
Preprocesamiento del audio
Técnico

Reducción de ruido (Audacity o DeepFilter en Python), normalización a -20 LUFS, separación de silencios, conversión a WAV 16 kHz mono. Sin este paso, la calidad del clon baja significativamente.

ffmpeg -i input.mp3 -ar 16000 -ac 1 -af "loudnorm" output.wav
03
Extracción del speaker embedding
Técnico

Red neuronal (ECAPA-TDNN en XTTS-v2, d-vector en ElevenLabs) procesa el audio en ventanas de 25 ms con overlap de 10 ms. Comprime los MFCC en un vector de 192-512 dimensiones — el "ADN vocal". Puede almacenarse y reutilizarse sin el audio original.

speaker_embedding = encoder.encode(audio_16k)
04
Síntesis TTS neural zero-shot
Técnico

El modelo XTTS-v2 (arquitectura VITS + cross-lingual conditioning) recibe (a) el texto a sintetizar y (b) el speaker embedding. Sin reentrenar, genera un mel-spectrogram. "Zero-shot" = nunca entrenó con esta voz pero la reproduce usando el embedding como condición.

05
Vocoder neural — de matemática a audio
Técnico

HiFi-GAN convierte el mel-spectrogram en forma de onda audible (22.050 Hz o 24.000 Hz). Genera audio 13× más rápido que tiempo real en una GPU modesta. Calidad superior a una llamada telefónica.

06
Post-processing — "Hacerlo sonar como WhatsApp"
Técnico

Compresión OPUS 32 kbps a 24 kHz, formato nativo de WhatsApp. La compresión elimina artefactos de alta frecuencia que delatarían la síntesis. Paradoja: la compresión ayuda al atacante.

ffmpeg -i fake.wav -c:a libopus -b:a 32k -ar 24000 nota_voz.ogg
07
Variante crítica: Real-Time Voice Conversion (RVC)
Técnico

En lugar de sintetizar audio pregrabado, RVC convierte la voz del atacante en la de la víctima en tiempo real durante una llamada activa. Latencia 100-300 ms, imperceptible en conversación. Disponible gratis en GitHub. Usado en el CEO fraud de USD 243.000 en Arizona (2024).

El caso didáctico del cantante: para clonar la voz de Freddie Mercury o Michael Jackson se toman horas de grabaciones comerciales, se separa voz de música con Demucs, se extraen MFCC y formantes de cada canción, y se entrena un voice conversion model. El proceso evidencia qué datos biométricos contiene el audio: no solo "cómo suena" sino la geometría exacta del tracto vocal — los mismos datos que usa el sistema de identificación biométrica del Aeropuerto de Ezeiza.
Ecosistema de herramientas · Atacante y perito

Las herramientas reales:
qué usa el atacante y qué usa el forense

Cada herramienta listada es real, funcional hoy, y relevante para el análisis forense — ya sea porque el atacante la usa o porque el investigador la necesita.

⚠ Riesgo · Herramientas de creación
ElevenLabs
Web · Freemium · 10K chars/mes gratis
La herramienta más usada en fraudes documentados 2024-2025. Instant Voice Cloning funciona con 30 segundos de muestra. No requiere GPU ni instalación. API disponible para automatización masiva. Sus términos prohíben el abuso — sin impacto práctico.
XTTS-v2 (Coqui TTS)
Open source · Local · Sin trazabilidad
Modelo open source descargable y ejecutable localmente. Sin logs externos, sin registro, sin watermark. Soporta 17 idiomas. Dataset: VCTK + LibriTTS (auditable). pip install TTS
RVC · Real-Time Voice Conversion
Open source · Tiempo real · Latencia 100-300 ms
Transforma la voz del atacante en la de la víctima durante una llamada activa. Requiere GPU (RTX 3060+). Se usa con audio virtual (VB-Audio Cable) redirigiendo a la app de llamadas. Vector principal de vishing en curso.
Bark (Suno AI)
Open source · Síntesis emocional
Genera llanto, susurros, urgencia, risas. Vector ideal para deepfakes de emergencia familiar ("mamá, tuve un accidente"). Menos preciso en identidad vocal que XTTS-v2 pero más expresivo. La emoción artificial baja las defensas del receptor.
✓ Defensa · Herramientas de análisis forense
sha256sum · CertUtil
Integrado en OS · CLI
PRIMER PASO FORENSE siempre. Sin este hash, la evidencia es impugnable.
CertUtil -hashfile audio.ogg SHA256 (Windows)
sha256sum audio.ogg (Linux/Mac)
Audacity
Gratuito · Windows/Mac/Linux
Espectrograma visual (View → Spectrogram). Detección preliminar de artefactos. Primera exploración — no suficiente para informe pericial pero indispensable para el triaje inicial.
Praat
praat.org · Estándar académico
Software de lingüística computacional. Mide jitter, shimmer, HNR, F0, formantes. Genera gráficos documentables y exportables. Referencia académica aceptada en peritajes de fonética forense.
AASIST (clovaai/aasist)
Python · ASVspoof 5 · EER 0,83% lab
Modelo de detección anti-spoofing de referencia. Degrada al 15-25% EER en condiciones reales con compresión. Requiere documentar versión, parámetros de inferencia y dataset en el informe pericial.
MediaInfo + ExifTool
Gratuito · Metadatos técnicos
Codec, bitrate, sample rate, fecha de creación, encoder. Sample rate 48 kHz en supuesta grabación de celular = sospechoso (los celulares graban a 44,1 o 22,05 kHz). Bitrate constante en voz humana = sospechoso.
AI Voice Detector · Resemble Detect
Web · Solo triaje inicial
Verificación online rápida. NUNCA usar sobre originales forenses — subir a servidor externo contamina la cadena de custodia. Resemble Detect ofrece análisis por segmentos, útil para identificar deepfakes parciales.
Demostración técnica durante el panel. Algunas de estas herramientas serán ejecutadas en vivo sobre material de un voluntario, mostrando el proceso completo desde la captura hasta la síntesis. La intención es didáctica y el material se descarta inmediatamente al finalizar.
Identidad digital · Casos cercanos

WhatsApp: el vector favorito
de los deepfakes en Argentina

El vector de ataque más común en Argentina no es la videollamada corporativa de USD 25M. Es la nota de voz de WhatsApp. Y es el que más funciona.

Por qué WhatsApp facilita el engaño

Identidad aparente
Nombre y foto del contacto
La nota de voz llega con el nombre y foto del contacto conocido (cuenta comprometida o número spoofed). El receptor confía en la identidad mostrada antes de evaluar el contenido.
Compresión OPUS
El aliado del atacante
La compresión OPUS 32 kbps elimina los artefactos de síntesis que delatarían un deepfake. El audio falso suena más convincente después de pasar por WhatsApp que antes.
Sin metadatos
El .ogg reenviado pierde origen
El formato .ogg de WhatsApp no preserva metadatos del dispositivo de origen ni del modelo que lo generó. La cadena de evidencia es frágil desde el primer reenvío.
Ingeniería social
Urgencia + secreto + cuenta nueva
Las tres señales clásicas. La urgencia desactiva el análisis crítico. El secreto bloquea la verificación social. La cuenta nueva habilita el desvío del dinero. Combinadas: 97% de probabilidad de fraude según FBI IC3.

Paso a paso de una estafa real

A
Inteligencia (OSINT)
El atacante investiga a la víctima y su red. Identifica al familiar, jefe o amigo más influyente. Busca audios o videos públicos de esa persona: graduación, nota de voz reenviada en un grupo, entrevista local. Descarga el material — públicamente disponible en la mayoría de los casos.
B
Clonación y síntesis del mensaje falso
Sube el audio a ElevenLabs (o usa XTTS-v2 localmente). Escribe el guion cuidando el registro de habla (muletillas, vocabulario). Genera el audio. Ajusta. Tiempo total: 5 a 30 minutos. Costo: USD 0.
C
Conversión al formato WhatsApp
Convierte a OPUS 32 kbps, 24 kHz mono. El archivo .ogg resultante es indistinguible del formato nativo de WhatsApp.
ffmpeg -i fake.wav -c:a libopus -b:a 32k -ar 24000 -ac 1 nota_falsa.ogg
D
Entrega y explotación de la urgencia emocional
Envío desde número spoofed o cuenta comprometida. El receptor ve el nombre y foto del familiar/jefe, escucha la voz reconocida y procesa la urgencia. El guion siempre incluye: límite temporal corto, instrucción de no verificar con otros, escenario de emergencia.
El dato más inquietante (UFECI 2025): en el 78% de los casos reportados con voz clonada en Argentina, la víctima reconoció que "algo sonaba raro" pero igual actuó porque "la urgencia era real". La tecnología no es perfecta. La ingeniería social sí. El ataque funciona porque explota la presión temporal, no la calidad del deepfake.
Análisis forense de audio · Protocolo técnico

Cómo identificar un deepfake:
protocolo ISO 27037 / 27042 paso a paso

El análisis de evidencia de audio sintético requiere un protocolo documentado y reproducible. Sin protocolo, no es forense — es opinión.

Regla de oro · Lo primero, siempre: generar el hash SHA-256 del archivo ANTES de reproducirlo, abrirlo o analizarlo. Anotar hash, fecha y hora. Trabajar solo sobre copia forense. El archivo original no se toca más. Sin este paso, la defensa puede impugnar toda la prueba posterior.
ISO
27037
Preservación y cadena de custodia
Hash SHA-256 del archivo original. Documentar: hash, tamaño en bytes, nombre original, dispositivo donde se encontró, fecha y hora de adquisición, persona que realizó la adquisición. Copia forense bit-a-bit. Original sellado en evidencia. Todos los análisis sobre la copia.
CertUtil -hashfile audio_original.ogg SHA256 > hash_registro.txt
Capa
1
Análisis de metadatos
MediaInfo + ExifTool. Examinar codec, bitrate (variable = humano; constante = sospechoso), sample rate (48 kHz en supuesta grabación de celular = sospechoso), duración exacta al ms, herramienta de creación si está embebida. Un audio de XTTS-v2 puede tener "Python" en los metadatos si no fueron limpiados.
mediainfo audio_copia.ogg | grep -E "Format|Bit rate|Sampling rate|Codec"
Capa
2
Análisis espectral visual (Audacity)
View → Spectrogram. Observar: (1) rango 8-16 kHz con uniformidad antinatural = síntesis (la voz humana tiene distribución irregular en altas frecuencias). (2) Silencio perfecto entre palabras = sintético (la voz real tiene lip sounds, respiración, ruido ambiental). (3) Envolvente de amplitud demasiado uniforme. Documentar con screenshots.
Capa
3
Análisis fonético (Praat)
Medir jitter (normal 0,5-2%, sintético <0,2% o >3%), shimmer (normal 2-5%), HNR (normal 15-25 dB, sintético >30 dB por ausencia de ruido orgánico), espectrograma de banda estrecha para regularidad de formantes. Documentar con tablas y comparar con valores de referencia de la persona real si existen.
Capa
4
Modelos anti-spoofing
Correr AASIST sobre la copia forense. Documentar versión del modelo, parámetros de inferencia, score raw, condiciones de compresión. Si hay divergencia entre el score del modelo y el análisis espectral, documentar como "incertidumbre técnica" — no ocultar resultados contradictorios.
python run_aasist.py --input audio_copia.wav --model AASIST --output score.json
ISO
27042
Informe pericial
Identificación del perito y credenciales. Hash SHA-256 del material. Metodología reproducible. Herramientas con versión exacta. Resultados capa por capa con evidencias (screenshots, logs). Grado de certeza explícito. Limitaciones conocidas (ej.: "compresión OPUS reduce precisión del modelo al X%"). Conclusiones técnicas en lenguaje accesible para el tribunal.
Marco normativo · ISO aplicable

Las 4 normas que sostienen
una pericia en juicio

No son burocracia. Son el protocolo que hace admisible el trabajo técnico y defendible la postura organizacional.

ISO/IEC 27037:2012
Cadena de custodia digital
Identificación, recolección, adquisición y preservación de evidencia digital. Hash SHA-256 antes de cualquier acción. Copia forense bit-a-bit. Dispositivo original sellado e intacto. Documentación con timestamp.
Aplicación en deepfakes
Audio por WhatsApp requiere dispositivo original + hash SHA-256 para ser evidencia válida. Reenvío del audio = evidencia potencialmente contaminada. El hash del original es la base de todo.
ISO/IEC 27042:2015
Análisis e interpretación
Metodología documentada, reproducible, con grado de certeza declarado. El perito debe declarar explícitamente las incertidumbres y limitaciones del análisis.
Aplicación en deepfakes
Informe válido = espectrograma + AASIST + valores Praat + declaración de incertidumbres. No alcanza concluir "suena falsa". Requiere metodología técnica reproducible.
ISO/IEC 27001:2022
Gestión de seguridad de la información
Sistema de Gestión de Seguridad de la Información. Versión 2022 con controles específicos contra ingeniería social y verificación de identidad. Control A.5.24 (gestión de incidentes), A.5.19 (relaciones con proveedores), A.8.12 (fuga de datos).
Aplicación en deepfakes
Organizaciones con verificación por voz deben evaluar riesgo de suplantación sintética. El principio de 4 ojos para transferencias es control mínimo recomendado bajo A.5.24.
ISO/IEC 42001:2023
Gestión de sistemas de IA
Primera norma específica para gestión de IA. Publicada en diciembre 2023. Introduce el concepto de AI Impact Assessment (AIAS). Define cómo gestionar desarrollo, despliegue y uso responsable de IA.
Aplicación en deepfakes
Organizaciones que usan o son víctimas de síntesis de voz deben documentar riesgos, salvaguardas y responsabilidades. El gap entre capacidad técnica y marco normativo es activo hoy.
EU AI Act — Reglamento (UE) 2024/1689:
Art. 5: deepfakes con intención de engaño = práctica de IA prohibida.
Art. 50(4): etiquetado obligatorio de contenido IA generado.

Argentina — Gap regulatorio activo: la Estrategia Nacional de IA 2023 es marco de referencia, NO normativa vinculante. El Código Penal no tipifica deepfakes de voz como delito autónomo. Los arts. 173 CP, 153 bis CP y 1770 CCyC son instrumentos imperfectos pero aplicables.
Protocolos de protección · Personal y organizacional

Tres capas de defensa práctica
antes del ataque

El protocolo establecido antes del ataque decide si la víctima sobrevive al ataque. No hay protocolo que funcione si se diseña durante la crisis.

👨‍👩‍👧
Personal · Palabra código familiar
Establecé con tu familia una palabra o frase secreta que deben incluir en cualquier llamada de emergencia. Sin esa palabra, la llamada no es válida — verificar por canal alternativo antes de actuar. No la escribas en WhatsApp ni redes. Renovar cada 6 meses.
Implementable hoy · USD 0
🏢
Organizacional · Principio de 4 ojos
Toda transferencia financiera requiere: (1) aprobación de dos personas independientes, (2) confirmación por canal alternativo al que recibió la solicitud. Si el CEO llama, la confirmación se hace por otro medio — nunca en la misma llamada. Documentado en política de seguridad.
ISO 27001 · A.5.24 · A.8.7
🔍
Auditoría de huella de voz pública
Inventariar cuántos minutos de tu voz existen online. Buscá tu nombre en YouTube, Instagram, TikTok, LinkedIn. Configurar privacidad: cuentas privadas, deshabilitar Stitch/Duet, eliminar historial de voz en Google My Activity y asistentes (Siri, Alexa). No elimina el riesgo — lo reduce.
Ley 25.326 art. 16 · GDPR art. 17
Respuesta a incidente
Si recibís un audio sospechoso: (1) NO lo reenvíes — amplifica el daño. (2) NO lo borres — es evidencia. (3) Hash SHA-256 antes de tocarlo. (4) Documentar contexto: emisor, número, hora, chat. (5) Reportar a UFECI o CERT.ar. Si es corporativo, activar plan ISO 27001 antes de notificar externamente.
UFECI · CERT.ar · ISO 27001 A.5.24
El protocolo que más vidas salva, probado en casos reales: ante cualquier solicitud urgente de dinero o información sensible recibida por voz o audio, parar, colgar, llamar directamente al número conocido de la persona desde mis propios contactos. Nunca llamar de vuelta al número que me llamó. Un solo paso. El 90% de los fraudes con voz clonada reportados en Argentina se hubieran detenido ahí.
Conclusiones · Lo que te llevás

5 acciones que implementás esta semana

No hay conciencia sin acción. Estas cinco son implementables hoy, cuestan USD 0 y reducen el riesgo de forma medible.

01
FREEZAR antes de actuar
Ante cualquier solicitud urgente por voz o audio: parar, respirar, colgar. Verificar por canal alternativo — llamando vos al número real del contacto desde tu lista. El atacante necesita tu urgencia. No se la des.
Inmediato
02
ESTABLECER palabra código familiar
Acordá con tu familia una palabra o frase secreta que debe estar en cualquier llamada de emergencia real. No la escribas digitalmente. Renovar cada 6 meses. Una sola conversación familiar puede evitar pérdidas significativas.
5 minutos
03
AUDITAR tu huella de voz pública
Buscá tu nombre en YouTube, Instagram, TikTok, LinkedIn. Contá cuántos minutos de tu voz existen públicamente. Configurar privacidad. Deshabilitar Stitch/Duet. Eliminar historial de voz en Google My Activity. Saber qué hay disponible es el primer paso.
30 minutos
04
PRESERVAR antes de denunciar
Si recibís un audio sospechoso: NO borres, NO reenvíes. Generar hash SHA-256 del archivo. Documentar contexto (número origen, hora, chat). Denunciar en UFECI (fiscales.gob.ar/ufeci) o CERT.ar. Sin hash previo, la evidencia es impugnable en juicio.
ISO 27037
05
PROTOCOLIZAR en tu organización
Principio de 4 ojos para transferencias: toda instrucción financiera por voz requiere confirmación escrita + aprobación de dos personas por canal alternativo. Documentar en política. Entrenar al equipo. El protocolo pre-definido es la única defensa que funciona en tiempo real.
ISO 27001 A.5.24
El takeaway final: la tecnología ya está acá. No va a desaparecer. La ventaja ya no es técnica — es de protocolo. Quien tiene el protocolo establecido antes del ataque, sobrevive al ataque.
Recursos para profundizar · Herramientas funcionales

Herramientas, normas y fuentes verificadas

Solo recursos verificados, accesibles y relevantes para análisis técnico y formación continua.

Detección y análisis forense

Gratuito
Audacity
Edición y análisis de audio. View → Spectrogram para forense básico.
audacityteam.org/download
Gratuito · Académico
Praat
Estándar de fonética forense. Mide jitter, shimmer, HNR, F0, formantes.
fon.hum.uva.nl/praat
Open source
AASIST · Anti-spoofing
Modelo de referencia ASVspoof 5. Paper arXiv:2110.01200.
github.com/clovaai/aasist
Gratuito · CLI
MediaInfo
Metadatos técnicos: codec, bitrate, sample rate, duración exacta.
mediaarea.net/MediaInfo
Open source · Meta
Demucs · separación voz/música
Separa voz del fondo musical. Útil para muestras limpias de videos.
github.com/facebookresearch/demucs
Gratuito · Web
SynthID Detector
Detecta marca de agua inaudible en audios de Google DeepMind. Limitado a esas herramientas.
deepmind.google/synthid

Normas y documentación técnica

ISO · Normativa
ISO/IEC 27037:2012
Identificación, recolección, adquisición y preservación de evidencia digital.
iso.org/standard/44381
ISO · Normativa
ISO/IEC 27042:2015
Análisis e interpretación de evidencia digital. Complemento de 27037.
iso.org/standard/44405
ISO · IA · 2023
ISO/IEC 42001:2023
Primer estándar específico para gestión de sistemas de IA. Incluye AI Impact Assessment.
iso.org/standard/81230
Academia · Open access
ASVspoof 5 Challenge Papers
Interspeech 2024. Estado del arte en detección de voz sintética.
arxiv.org/abs/2408.08739

Argentina · Reporte y verificación

Gratuito · Argentina
UFECI · Unidad Fiscal para Ciberdelitos
Unidad especializada del Ministerio Público Fiscal. Estadísticas, recursos para víctimas, denuncia.
fiscales.gob.ar/ufeci
Gratuito · Argentina
CERT.ar
Centro Nacional de Respuesta a Incidentes. Reportar, guías, alertas.
cert.ar
Gratuito · Argentina
Chequeado
Verificación de información. Primera parada ante audio o video político sospechoso.
chequeado.com
AI
ISO/IEC
42001:2023
Transparencia de uso de IA AI Impact Assessment

Este sitio fue desarrollado con asistencia de un sistema de inteligencia artificial generativa. En cumplimiento del marco de gestión de IA establecido por ISO/IEC 42001:2023, se declara: el contenido técnico, normativo, legal y los datos estadísticos fueron verificados y editados por persona humana (Ing. Marina Soledad Cabreros, perito informática forense). La diagramación, estructura HTML/CSS y redacción asistida fueron generadas con IA generativa bajo supervisión profesional. No se incluyen datos personales de terceros. Las fuentes están explícitamente citadas en cada estadística.