compraparatodos.online

Estafas con clonación de voz e IA: Camilo Gutiérrez de ESET explica cómo funcionan las llamadas falsas y cómo blindarse

La rápida democratización de la inteligencia artificial generativa ha transformado radicalmente el panorama de la ciberseguridad en América Latina. Lo que antes requería semanas de entrenamiento con modelos complejos de machine learning y potentes equipos de cómputo, hoy está al alcance de cualquiera mediante plataformas web o aplicaciones comerciales por una fracción de su costo original, marcando un salto cuantitativo en las técnicas de suplantación de identidad.

En este contexto, las llamadas de extorsión y los engaños telefónicos han evolucionado desde simples guiones de ingeniería social hacia experiencias multimedia altamente convincentes.

Camilo Gutiérrez - ESET
Camilo Gutiérrez – ESET

Conversamos con Camilo Gutiérrez Amaya, Field CISO de ESET Latinoamérica, quien desglosa el alcance real de esta tecnología, el impacto de los deepfakes en entornos familiares y corporativos, y las medidas de higiene digital esenciales para no caer en la trampa.

🔒 Lee más de ciberseguridad: Registro de celulares: cuidado con las trampas de los ciberdelincuentes

Acceso, herramientas y captura de muestras biométricas

Datos biométricos
Datos biométricos

¿Qué tan accesible es hoy en día para un ciberdelincuente clonar la voz de una persona y cuáles son las herramientas o tecnologías que están facilitando este salto cuantitativo?

La verdad es que la barrera de entrada para lograrlo se derrumbó. Si nos vamos hace un par de años atrás, clonar la voz de una persona exigía conocimientos especializados en modelos de machine learning, necesitaba muchos datos para poder entrenar esos modelos —es decir, muchas grabaciones— y la capacidad de procesamiento para ordenar toda esa información. Hoy en día esto puede hacerse a través de servicios web, aplicaciones comerciales o modelos de código abierto, muchas veces sin escribir una sola línea de código y a costos muy bajos.

La persona que quiera clonar la voz de otra no necesita ser un experto en inteligencia artificial; puede especializarse en manipular a la víctima o tercerizar el componente técnico. La IA no inventó esta forma de estafa; las llamadas telefónicas falsas son viejas, pero estos modelos las industrializan al darles un alcance masivo. Desde ESET hemos advertido que estas falsificaciones sencillas y económicas producen resultados lo suficientemente convincentes para engañar.

¿De dónde obtienen los atacantes las “muestras de voz” necesarias? ¿Basta con un video corto de redes sociales o notas de voz de WhatsApp?

Basta con un video corto o una nota de WhatsApp, ya que contienen la información suficiente para crear una imitación reconocible. No se necesita algo perfecto, sino lo suficientemente convincente para una llamada breve y emocional, que es precisamente lo que buscan los atacantes. A esto se suma el contenido compartido en Instagram, TikTok o YouTube, e incluso el saludo del buzón de voz, que puede funcionar como un banco involuntario de muestras biométricas.

Muestra de Voz (WhatsApp / Redes) ─► Modelo IA de Clonación ─► Libreto de Urgencia ─► Llamada de Extorsión

Escenarios de engaño y el mito de las señales acústicas

Foto: Redes sociales
Foto: Redes sociales

A nivel de ingeniería social, ¿cuáles son los escenarios más comunes que están utilizando las bandas criminales en Latinoamérica para hacer creíbles estas llamadas falsas?

El abuso de la IA ha permitido modernizar libretos delictivos clásicos. Uno de los más evidentes es el secuestro virtual: una llamada donde una supuesta hija, hijo o pareja llora afirmando estar detenido, haber sufrido un accidente o estar secuestrado, exigiendo dinero de inmediato. Existen variantes como el familiar que perdió el teléfono, el ejecutivo solicitando una transacción confidencial o supuestos agentes de fraude y autoridades. Lo más peligroso no es la voz clonada como elemento aislado, sino su combinación con datos filtrados y el contexto público de la víctima.

¿Existen señales acústicas, latencias o patrones específicos en una llamada generada por IA que una persona común pueda aprender a identificar en segundos?

Pueden existir señales como respiraciones extrañas, entonaciones que no coinciden, cambios abruptos de volumen o silencios prolongados antes de responder. Sin embargo, en la tensión del momento, y con la interferencia de una mala conexión telefónica, estas señales pasan a segundo plano. La prueba más confiable no está en la voz, sino en la conducta: siempre habrá urgencia extrema, pedido de secreto absoluto y presión para no cortar la comunicación. Hoy no podemos autenticar la identidad de alguien únicamente porque escuchamos su voz.

Protocolos de protección familiar y el “fraude del CEO”

Deepfakes, phishing y correos falsos del SAT elevan el riesgo de pérdidas para empresas y clientes.
Deepfakes, phishing y correos falsos del SAT elevan el riesgo de pérdidas para empresas y clientes. | Source : Foto generada por IA

¿Cómo pueden protegerse las familias ante el miedo de que utilicen la voz de un familiar para una extorsión?

La mejor defensa es establecer un protocolo familiar: una palabra clave o frase secreta que no esté publicada en redes sociales ni en chats. También sirven preguntas contextuales sobre datos que no sean de dominio público (evitando fechas de cumpleaños o nombres de mascotas). Ante una emergencia real, una verificación de 30 segundos es aceptable; ante una estafa, los ciberdelincuentes intentarán evadir esa comprobación a toda costa.

Llamada Sospechosa ─► [ Pausa de 30 Segundos ] ─► Solicitud de Palabra Clave ─► Verificación / Bloqueo

Desde la perspectiva corporativa, ¿cómo están impactando estos ataques en los ejecutivos de finanzas o directivos?

El “fraude del CEO” dejó de ser un correo mal redactado para convertirse en una experiencia multimedia. Un atacante puede comprometer una cuenta, estudiar el estilo de redacción del ejecutivo y acompañar la solicitud con un audio o videoconferencia falsa. El objetivo es saltarse los procesos de autorización valiéndose de la autoridad de un directivo. Las empresas deben entender que el rostro o la voz de un ejecutivo ya no son factores de autenticación suficientes; se deben exigir procesos de doble aprobación, bandas de transferencia y validaciones independientes.

Detección técnica, deepfakes en vivo y el rol de la industria

Fraude con deepfakes
Fraude con deepfakes

¿Qué rol juegan las empresas tecnológicas y de redes sociales en la mitigación de este problema?

Tienen un rol central porque controlan la información: los datos para crear la voz, los modelos generativos y las plataformas de distribución. Aunque se avance en marcas de agua o verificación de consentimiento, el auge de los modelos de código abierto evita que existan limitaciones universales. Por ello, la responsabilidad sigue estando fragmentada y recae fuertemente en la educación del usuario.

Técnicamente hablando, ¿cómo detectan las soluciones de seguridad como las de ESET este tipo de amenazas?

Hay dos frentes. Para determinar si un audio es sintético existen herramientas que analizan el espectro acústico y la respiración, aunque su efectividad disminuye si el audio está comprimido por servicios como WhatsApp. Por otro lado, frente al malware diseñado para grabar micrófono o capturar audio, las soluciones de ESET analizan comportamientos anómalos. Mediante plataformas EDR o XDR se puede identificar y bloquear, por ejemplo, si una aplicación sin permisos de audio intenta acceder a las API del micrófono y comunicarse con un servidor externo.

Dimensión de Análisis Amenaza Evaluada Mecanismo de Detección / Mitigación
Análisis de Audio Voz sintética / Clonada Inspección espectral y de patrones de respiración (sensible a compresión).
Protección Endpoint Aplicaciones maliciosas Control de permisos excesivos en dispositivos móviles y escritorios.
Monitoreo Corporativo Captura no autorizada de micrófono Soluciones EDR/XDR que correlacionan accesos a API de audio y conexiones externas.
Procesos Operativos Fraude del CEO Autenticación multifactor y protocolos de doble aprobación para transacciones.

¿Qué tan rápido está evolucionando esta tecnología? ¿Ya vemos estafas con videollamadas en tiempo real?

Aunque existen tecnologías para alterar la voz y el rostro en vivo, el audio sigue siendo el vector más rentable para ataques masivos por su bajo costo y menor consumo de recursos. Los deepfakes en tiempo real se reservan para objetivos corporativos de alto valor o esquemas híbridos que inician con un audio y escalan a video. Es cuestión de meses para que veamos modelos más fluidos en conversaciones espontáneas.

Hacia una cultura de higiene digital ante la inteligencia artificial

La evolución de la inteligencia artificial generativa plantea desafíos sin precedentes para la seguridad de la información. La posibilidad de replicar identidades de forma accesible exige que tanto las organizaciones como las personas replanteen la confianza implícita en los canales de comunicación tradicionales. La tecnología continuará avanzando, por lo que la preparación técnica y la concientización resultan fundamentales para neutralizar los intentos de fraude.

Para Camilo Gutiérrez, la regla de oro para la higiene digital actual es simple: asumir la existencia de este riesgo sin caer en la paranoia. Ante cualquier llamada que combine una voz conocida, un escenario de urgencia y una solicitud de dinero o información confidencial, la acción inmediata debe ser pausar la interacción y tomarse 30 segundos para verificar la identidad por un canal alternativo. Ese breve intervalo de comprobación representa hoy la barrera más efectiva contra las estafas basadas en IA.

Review Your Cart
0
Add Coupon Code
Subtotal