Skip to main content
Técnicas y retos actuales en
la detección de contenidos
generados por IA
Por Natzir
Natzir
SEO&CRO estratégico, técnico e internacional
@natzir9 /in/natzir/ natzir.com
14 años logrando resultados demostrables gracias a un
enfoque científico y holístico.
Índice
Contexto y motivación
Detección de imágenes generadas por IA
Detección de texto generado por IA
1
Contexto y motivación
@natzir9
📰 Desinformación y Fake News
© Propiedad Intelectual
🔒 Ciberseguridad
📚 Veracidad académica
📢 Privacidad, ética y difamación
Contexto y motivación
¿Por qué es importante detectar contenido generado por IA?
Por los grandes riesgos que suponen su mal uso
🗳 Integridad de las elecciones
🛡 Seguridad nacional
🏛 Credibilidad y confianza pública
⚖ Competencia desleal
📋 Control de calidad
@natzir9
Contexto y motivación
Desinformación y Fake News
Dufour, Nicholas et al. “AMMeBa: A Large-Scale Survey and Dataset of Media-Based Misinformation In-The-Wild.” ArXiv abs/2405.11697 (2024)
La desinformación se ha disparado desde
la aparición de herramientas GenAI. Casi el
80% de los fact checks actuales están
relacionados con multimedia.
@natzir9
Contexto y motivación
Desinformación y Fake News
Xu, R. et al (2024). "New contexts, old heuristics: How young people in India and the US trust online content in the age of generative AI".
¿Cómo los jóvenes consumen información?
Prioridad de la eficiencia sobre la precisión
Dependencia de heurísticos antiguos
Falta de habilidades críticas para evaluar la
información
@natzir9
Contexto y motivación
Desinformación y Fake News
ChatGPT Statistics 2024 by Tooltester
@natzir9
Contexto y motivación
Credibilidad y confianza pública
Marchal, Nahema et al. “Generative AI Misuse: A Taxonomy of Tactics and Insights from Real-World Data.” ArXiv abs/2406.13843 (2024)
El uso de GenAI para manipular opiniones
y crear desinformación erosiona la
confianza pública en las fuentes de
información y los procesos democráticos.
La generación masiva y personalizada de
contenido dificulta verificar su autenticidad,
aumentando el escepticismo hacia la
información digital.
@natzir9
Contexto y motivación
Privacidad, ética y difamación
@natzir9
Contexto y motivación
Propiedad Intelectual
@natzir9
Contexto y motivación
Ciberseguridad
@natzir9
Contexto y motivación
Control de calidad
Baeza-Yates, Ricardo. (2018). "Bias on the web". Communications of the ACM. 61. 54-61. 10.1145/3209581
@natzir9
Contexto y motivación
Control de calidad
First Google Search Result for Tiananmen Square “Tank Man” Is AI Generated Selfie - 404media.co
@natzir9
Contexto y motivación
Control de calidad
AI Images in Google Search Results Have Opened a Portal to Hell - 404media.co
IA IA IA IA
IA
IA IA
IA IA
IA
IA IA
IA
IA
IA
IA
IA
IA
IA IA
@natzir9
Contexto y motivación
Control de calidad
Pizza aux anchois - baume-referencement.com
@natzir9
Contexto y motivación
Control de calidad
Perplexity Pages showing in Google AI Overviews
@natzir9
Contexto y motivación
Control de calidad
Google: Sites Using AI For Some Articles But Don't Specify Which Is Lowest Quality Pages
@natzir9
Contexto y motivación
Control de calidad
Google Artificially Generated Content AGC Classification Score?
@natzir9
Contexto y motivación
Ley de IA Europea
Ley de IA - europa.eu
2
Detección de imágenes GenAI
@natzir9
Detección de imágenes GenAI
Detección automática de imágenes hechas con modelos GAN y Diffusion
Las imágenes generadas con Midjourney, Stable Diffusion o Dall-E dejan huellas detectables
Marra, Francesco et al. “Do GANs Leave Artificial Fingerprints?” 2019 IEEE Conference on Multimedia Information Processing and Retrieval (MIPR)
IA IA Real
@natzir9
Detección de imágenes GenAI
Detección automática de imágenes hechas con modelos GAN y Diffusion
Las imágenes generadas con Midjourney, Stable Diffusion o Dall-E dejan huellas detectables
Davenash. Features that clearly differentiate between Real, Deepfake (swapped images of Real people), and completely AI-generated images.
@natzir9
Detección de imágenes GenAI
Detección automática de imágenes hechas con modelos GAN y Diffusion
hivemoderation.com
@natzir9
Detección de imágenes GenAI
Detección automática de imágenes hechas con modelos GAN y Diffusion
Falsos positivos
Instagram Photos Are Being Labeled ‘Made With AI’ When They’re Not
@natzir9
Detección de imágenes GenAI
Detección automática de imágenes hechas con modelos GAN y Diffusion
hivemoderation.com
Falsos positivos
Foto real de Neil
Armstrong en la
misión Apollo 11
@natzir9
Detección de imágenes GenAI
Detección automática de imágenes hechas con modelos GAN y Diffusion
hivemoderation.com
Falsos positivos
Foto real de Neil
Armstrong en la
misión Apollo 11
@natzir9
Detección de imágenes GenAI
Cómo engañar a detectores de imágenes IA
How to Fool Hive Moderation's AI-Generated Image Detection [Hack]
Neil Armstrong en la misión Apollo 11 Pared de mi fachada Blend al 4%
@natzir9
Detección de imágenes GenAI
Cómo engañar a detectores de imágenes IA
How to Fool Hive Moderation's AI-Generated Image Detection [Hack]
Imagen creada con Midjourney 6 Arena de la playa Blend al 4%
@natzir9
Detección de imágenes GenAI
Las 3 grandes medidas
IPTC - SynthID - C2PA
Marca de agua
Metadatos
Huella digital “hormonada”
@natzir9
Detección de imágenes GenAI
C2PA
contentcredentials.org/verify
@natzir9
Detección de imágenes GenAI
C2PA
contentcredentials.org/verify
@natzir9
Detección de imágenes GenAI
C2PA
contentcredentials.org/verify
@natzir9
Contexto y motivación
Cómo romper y falsificar el C2PA
Breaking and Fooling C2PA [Hack]
Certificado autofirmado y creación de manifest
@natzir9
Contexto y motivación
Cómo romper y falsificar el C2PA
Breaking and Fooling C2PA [Hack]
@natzir9
Detección de imágenes GenAI
Google SynthID
SynthID
@natzir9
Mapeo
Embedding Noisy Embedding
Ruido
Detección de imágenes GenAI
Cómo romper el watermarking de imágenes
Breaking Google SynthID Watermarking [Hack]
Imagen con Watermarking Imagen sin Watermarking
Regenerar
@natzir9
La validación de la blockchain requiere mucha potencia computacional. ¿Quiénes son y quién
pagaría a los validadores?
¿Qué solución blockchain puede manejar el volumen de datos de Facebook o Google? ¿Solana?
Las blockchains crecen constantemente, lo que puede hacer que la descarga y verificación de una
blockchain antigua sea extremadamente lenta (a menos que se usen checkpoints).
Muchas soluciones blockchain dependen de firmas propietarias, lo que puede hacerlas menos
independientes.
Si dos personas registran el mismo archivo, no se puede determinar fácilmente cuál es el registro
propietario, no tiene por qué ser el primero.
Detección de imágenes GenAI
¿Qué nos queda?
¿Blockchain?
3
Detección de texto GenAI
@natzir9
Análisis NLP: n-gramas, entropía, perplejidad (perplexity), varianza (burstiness)…
Modelos discriminativos: Clasificadores entrenados sobre el léxico, la sintáctica, semántica,
estilo.
Watermarking: Inserción y detección de marcas de agua invisibles.
Aaronson, 2023 - Gumbel Softmax para modificar las probabilidades
Kirchenbauer et al., 2023 - Modifica de forma pseudorandom las probabilidades
Christ et al., 2023 - Watermarks criptográficamente indetectables
Kuditipudi et al., 2023 - Claves tan largas como el texto generado
Detección de textos GenAI
Cómo se puede detectar texto generado por IA de forma automática
@natzir9
Detección de textos GenAI
Cómo se puede detectar texto generado por IA de forma automática
Corpus IA: +530K artículos (+360M palabras) por David García (@DavidGarciaSEO), Sergio Ruiz (@seryitogost), Fernando González (@nandovcia), Jesus Arias (@chuchiseo) y Natzir
Corpus Humano: Versión española de CommonCrawl en Español por Meta (+13.700M palabras)
“crucial”
6.413
🚩
“este artículo
exploraremos”
150.805
🚩
@natzir9
Detección de textos GenAI
Cómo se puede detectar texto generado por IA de forma automática
Falsos positivos
Extracto del
Génesis de la
Biblia
@natzir9
Detección de textos GenAI
Cómo se puede detectar texto generado por IA de forma automática
Falsos positivos
Extracto del
Génesis de la
Biblia
@natzir9
Detección de textos GenAI
Cómo engañar a modelos discriminativos
GPTZero
@natzir9
Detección de textos GenAI
Cómo romper el watermarking
Parafraseando, traduciendo o aprendiendo el watermark
Sadasivan, Vinu Sankar et al. “Can AI-Generated Text be Reliably Detected?” ArXiv abs/2303.11156 (2023)
@natzir9
Detección de textos GenAI
Cómo romper el watermarking
A Watermark for Large language Models
@natzir9
Detección de textos GenAI
Cómo romper el watermarking
Parafraseando o traduciendo el output original con otro modelo
@natzir9
Detección de textos GenAI
Cómo romper el watermarking
Ataques de sustitución
Kirchenbauer, John et al. “A Watermark for Large Language Models.” International Conference on Machine Learning (2023).
@natzir9
Detección de textos GenAI
Cómo romper el watermarking
Ataques de sustitución
“En resumen”, ESTAMOS JODIDOS
MUCHAS GRACIAS