Diario RedPolítica

La auditoria de Earshot confirma la autenticidad de los nuevos audios de Hondurasgate sobre el espionaje a través de empresas israelíes

Los audios de la nueva filtración de Hondurasgate fueron sometidos a una auditoria forense independiente de la organización estadunidense Earshot

Una nueva filtración de audios de la plataforma Hondurasgate revela operaciones de espionaje a través de empresas israelíes. Los audios involucran al presidente de Honduras, Nasry Asfura, al presidente del Congreso, Tomás Zambrano, a la vicepresidenta, María Antonieta Méjía, y a la consejera electoral Cossette López, además del expresidente Juan Orlando Hernández. En la nota de voz de fecha 7 de marzo de 2026, Asfura describe a Zambrano los alcances del espionaje en Honduras. De acuerdo a la conversación, estarían trabajando con dos empresas telefónicas: Tigo y Claro a promover una moción legislativa para aumentar el control ciudadano en las redes sociales.

Los audios filtrados en esta nueva entrega fueron sometidos a una auditoría forense independiente de Earshot (earshot.ngo), una reconocida organización sin fines de lucro que usa el sonido en defensa de los derechos humanos y ambientales.

Desde mayo de 2026, y a petición de Drop Site News, Earshot ha analizado grabaciones de prominentes figuras políticas involucradas la filtración de audios del Hondurasgate para determinar su autenticidad.

En esta ocasión, Earshot analizó 12 nuevas grabaciones que involucran al presidente de Honduras, Nasry Asfura, a la vicepresidenta María Antonieta Méjía, a la consejera electoral, Cossette López, y al expresidente Juan Orlando Hernández.

La conclusión fue la siguiente:

“Al identificar varios artefactos de audio consistentes con las grabaciones realizadas en condiciones del mundo real y realizar comparaciones de voz de aprendizaje automático, Earshot concluyó que las doce grabaciones son, con alta probabilidad, auténticas y no generadas por IA”.

Earshot llegó a sus conclusiones mediante dos líneas de análisis: la escucha crítica de artefactos de audio consistentes con el habla auténtica y la comparación de voz por aprendizaje automático utilizando un programa llamado Resemblyzer, con grabaciones conocidas de los presuntos hablantes.

Los hallazgos de escucha crítica se probaron aún más contra el discurso generado por la IA producido con Coqui, un programa de clonación de voz. Una línea de análisis separada, que examinó la frecuencia de muestreo de cada registro, “apoya los hallazgos de los dos primeros”.

Escucha crítica para artefactos de audio, probados contra Coqui

La auditoría, de 35 páginas, explica que se pueden identificar múltiples artefactos de audio en cada una de las 12 grabaciones que son consistentes con el habla natural grabada en condiciones del mundo real. Estos se dividen en dos categorías: artefactos del habla, como las respiraciones y las vacilaciones vocales, y artefactos acústicos, como los ruidos de fondo y las distorsiones de los micrófonos que se pueden escuchar entre oraciones.

“La presencia de múltiples artefactos en una sola grabación apunta a una web acústica coherente que es consistente con el habla grabada en condiciones del mundo real. Sin embargo, los avances en el audio generado por la IA están incorporando progresivamente estos sonidos en el proceso generativo. Esto plantea desafíos a las metodologías de autenticación. Para probar qué tan confiable es cada artefacto como un marcador de autenticidad, Earshot verificó si podían reproducirse usando Coqui”.

“Varios artefactos demostraron ser resistentes a la reproducción por los programas de IA generativa actuales, entre ellos respiraciones precedidas por el sonido distintivo del golpeteo de dientes o labios, bostezos y ruidos de fondo con la misma resonancia de habitación que la voz. Junto con la web acústica coherente identificada en las doce grabaciones, esto hace que sea poco probable que los artefactos hayan sido producidos por el habla generada por la IA”.

Comparación de voz de aprendizaje automático, con Resemblyzer

Earshot realizó una comparación de voz de aprendizaje automático utilizando Resemblyzer, un programa que analiza muestras cortas de una voz y traduce sus patrones de ritmo, prosodia, composición de frecuencia y armónicos en un valor numérico. Este valor se compara con el valor de una grabación conocida del altavoz en cuestión; la puntuación resultante indica cuán similares son las dos voces y, por extensión, qué tan probable es que la supuesta voz sea genuina.

“En las 12 grabaciones, estos resultados apoyaron las conclusiones alcanzadas a través de la escucha crítica”.

Baja frecuencia de muestreo

Un elemento adicional que proporciona evidencia de autenticidad es la tasa de muestreo relativamente baja encontrada en las 12 grabaciones.

“La frecuencia de muestreo se refiere a cuántas veces por segundo un micrófono mide la presión de sonido. El audio digital se graba típicamente en 44.100 o 48.000 muestras por segundo, capturando una amplia gama de frecuencias y, por lo tanto, más detalles. El audio telefónico, por el contrario, generalmente se graba a una frecuencia de muestreo más baja, ya que solo necesita capturar frecuencias de voz (0 a 8.000 Hz) en lugar del rango audible completo (0 a 20.000 Hz). Los doce registros contienen frecuencias de hasta 4.500 Hz, lo que indica que se registraron a una frecuencia de muestreo relativamente baja”.

“Los experimentos en curso de Earshot no han encontrado audio generado por IA con una tasa de muestreo tan baja. Si bien es posible reducir manualmente la frecuencia de muestreo de cualquier grabación, Earshot considera que es más probable que sea un producto de conversaciones telefónicas auténticas”.

Audios 168 y 175

Sobre los dos audios presentados en esta publicación, la organización tiene esta conclusión:

“Mediante la identificación de artefactos de audio como respiraciones, vacilaciones vocales, ruidos de fondo y distorsiones de micrófono, y mediante una comparación de voz por aprendizaje automático para detectar habla generada por IA, Earshot concluye lo siguiente: […] Las grabaciones número 168 y 175 son, con alta probabilidad, grabaciones auténticas de Nasry Asfura y no fueron generadas por inteligencia artificial”.

En el caso del audio 168, la auditoría explica que:

“Earshot identificó un total de 48 artefactos de audio (25 respiraciones, 4 distorsiones de micrófono y 19 ruidos de fondo). […] La presencia en esta grabación de un ‘perfil de respiración’ que coincide con el de Asfura sugiere que la grabación es, con alta probabilidad, auténtica y no generada por IA. […] La alta puntuación de 0,77 entre la voz atribuida y la voz conocida de Asfura, frente a las voces señuelo [0,54], indica que la grabación es, con alta probabilidad, auténtica y no generada por inteligencia artificial”.

Y sobre el audio 175 dice lo siguiente:

“Earshot identificó un total de 23 artefactos de audio (12 respiraciones, 1 distorsión de micrófono y 10 ruidos de fondo). […] La alta puntuación de 0,78 entre la voz atribuida y la voz conocida de Asfura, frente a las voces señuelo [0,55], indica que la grabación es, con alta probabilidad, auténtica y no generada por inteligencia artificial”.

Foto: Diario Red

Recuerda suscribirte a nuestro boletín

📲 https://bit.ly/3tgVlS0
💬 https://t.me/ciudadanomx