Skip to main content
Blog
Blog Attacks

Detectar agentes de IA: ratón, scroll y escritura

Las señales de comportamiento detectan agentes de IA que pasan CAPTCHA y rotan IPs: ratón, cadencia de scroll y ritmo de tecleo que no pueden fingir.

Jul 14, 2026 12 min read
Detectar agentes de IA: ratón, scroll y escritura

Puedes falsificar casi todo lo que un navegador informa. Un agente de IA moderno se ejecuta dentro de Chrome real, rota IPs residenciales, presenta una huella limpia y resuelve un CAPTCHA sin frenar. Lo que no puede fingir de forma convincente es cómo una persona real mueve el ratón, hace scroll y escribe a lo largo de toda una sesión.

Eso es lo que leen las señales de comportamiento, y es la base de la detección de agentes de IA basada en comportamiento. En lugar de comprobar una identidad una sola vez en la puerta, observan cómo se desarrolla la visita: la curva de una trayectoria del ratón, el ritmo del scroll, el espaciado entre pulsaciones y las pausas que hace un agente mientras un modelo decide qué hacer a continuación. cside lee más de 100 señales desde tu propio JavaScript de origen, en la página en vivo, y la capa de comportamiento es la parte que a la automatización más le cuesta ocultar.

Esta es una guía práctica de esas señales, por qué funcionan y cómo convertirlas en una decisión.

TL;DR

  • Las comprobaciones de huella, IP y CAPTCHA son puntuales y falsificables. El comportamiento se produce en vivo durante la sesión y es mucho más difícil de fingir.
  • La capa de comportamiento tiene cuatro partes: trayectoria del ratón, cadencia de scroll, espaciado entre pulsaciones y ritmo de escritura, y una capa de IA (latencia de razonamiento y texto generado por IA).
  • Los agentes LLM modernos ya no dependen de entradas programadas, así que las comprobaciones de una sola señal no los detectan. La clave está en correlacionar varias señales.
  • cside lee estas señales desde JavaScript de origen en sesiones reales y envía una puntuación de riesgo en tiempo real a tu stack de login, checkout y fraude.
  • Nunca bloquees con una sola señal. Puntúa por convergencia y responde en pasos graduales.

Por qué las señales de comportamiento detectan lo que la huella pasa por alto

La detección basada en comportamiento lee cómo una sesión se mueve, hace scroll y escribe a lo largo del tiempo para separar a las personas reales de la automatización, en lugar de confiar en lo que el navegador informa en un único momento.

Las señales de identidad estáticas describen lo que un navegador dice ser: su user-agent, plataforma, pantalla, fuentes y GPU. Todas pueden reescribirse. Los navegadores anti-detect existen para que una sesión programada parezca un dispositivo nuevo y corriente, y los buenos se mantienen lo bastante coherentes internamente como para pasar una comprobación de huella.

El comportamiento es distinto porque tiene que producirse en vivo, en cada sesión, en respuesta a tu página real. Una mano real se rige por la física y un cerebro real por la cognición. Las trayectorias del ratón se curvan y se pasan de largo, la velocidad del scroll sube y baja, y la escritura incluye pausas, erratas y correcciones. Nada de eso es un valor que un operador pueda fijar de antemano.

También hay una brecha estructural en las comprobaciones únicas. Un desafío pone a prueba al visitante una vez, en la puerta, y da por bueno todo lo que ocurre después. Esa suposición es la razón por la que los desafíos visibles fallan como defensa principal: un bot solo tiene que parecer humano durante lo que dura el puzzle. Leer el comportamiento a lo largo de toda la sesión elimina ese punto ciego.

Nada de esto es nuevo como campo. Analizar patrones de pulsaciones y de ratón para distinguir personas de máquinas tiene décadas. La investigación sobre tiempos de tecleo se remonta a los años 80, y la autenticación continua lleva años usando dinámicas de ratón y de escritura. Lo que cambió es la urgencia. Ahora que los agentes de IA manejan navegadores reales a gran escala, la capa de comportamiento pasó de ser un extra a ser la señal que de verdad separa a un humano de un agente capaz.

PropiedadHuella / IP / CAPTCHASeñales de comportamiento
Qué compruebaLo que el navegador informa en un momentoCómo la sesión se mueve, hace scroll y escribe a lo largo del tiempo
MomentoPuntual, comprobado en la puertaContinuo, durante toda la sesión
FalsificableSí; los navegadores anti-detect lo reescribenMucho más difícil; se produce en vivo en respuesta a la página
Detecta un agente en Chrome realNo

Las capas de detección de agentes de IA basada en comportamiento que lee cside

cside agrupa las señales de interacción en cuatro capas, ponderadas según lo difícil que es falsificar cada una.

Capa de comportamientoLo que produce una persona realLo que suele producir la automatizaciónPor qué resiste la falsificación
Trayectoria del ratónTrayectorias curvas, microcorrecciones cerca de un objetivo, temblor fisiológicoLíneas rectas o curvas limpias, velocidad idéntica, mismo origenLa capa más madura del stack de cside; las bibliotecas de automatización no han reproducido el movimiento humano a escala
Cadencia de scrollRáfagas cortas con velocidad que sube y baja, pausas para leerVelocidad plana o en escalones, intervalos perfectamente uniformesBarata de leer y cara de falsificar bien, porque el ritmo natural de lectura depende de un contenido que el agente no está leyendo
Espaciado entre pulsaciones y ritmo de escrituraIntervalos irregulares, tiempos de pulsación característicos, retrocesos y correccionesVarianza casi nula, o un pegado instantáneo sin ritmoLa capa que la mayoría de stacks de detección infrautiliza, así que rara vez se falsifica
Capa de IA: latencia de razonamiento y texto generadoTiempo de reflexión humano, texto escrito por humanosPausas de ida y vuelta de inferencia, texto generado por un modeloApunta al propio modelo del agente, algo que las herramientas programadas no pueden enmascarar

Panel de detección de agentes de IA de cside

Trayectoria del ratón

El movimiento humano del cursor tiene una estructura que los scripts rara vez reproducen: microcorrecciones cerca de un objetivo, aceleración y desaceleración que siguen la ley de Fitts, una ligera deriva lateral y un temblor fisiológico que nunca se detiene del todo. La automatización tiende a moverse en líneas rectas o curvas matemáticamente limpias, vuelve al mismo origen y reacciona con una velocidad idéntica.

Esta es la parte más madura del stack de comportamiento de cside, y el trabajo sobre movimiento del ratón se cubre en detalle en su propia entrada. En resumen: un modelo de comportamiento (cursor_v2) puntúa el movimiento del ratón frente a patrones que las bibliotecas de automatización no han reproducido a escala. En pruebas controladas, detecta sesiones de Playwright sin más al 98,2% de recall y sesiones de browserless en modo stealth al 100%, con una tasa de falsos positivos humanos inferior al 1% (método de detección de navegadores headless). Las herramientas que intentan aprender un movimiento humano siguen dejando las señales de cursor que cside detecta en tráfico de Playwright y browserless.

Cadencia de scroll

El scroll produce el mismo tipo de señal. Los usuarios reales hacen scroll en ráfagas cortas con un perfil de velocidad natural: un empujón, un deslizamiento, una pausa para leer. Los scripts que llaman a window.scrollTo() o que controlan el scroll mediante el DevTools Protocol producen una velocidad plana o en escalones, intervalos perfectamente uniformes o saltos sin rampa. La cadencia de scroll es barata de leer y cara de falsificar bien, porque el ritmo natural de lectura depende de un contenido que el agente en realidad no está leyendo. cside lee la velocidad de scroll y el tiempo de permanencia directamente desde JavaScript de origen en la página en vivo y los puntúa como una entrada más del modelo de convergencia, donde un perfil de scroll plano e independiente del contenido solo cobra sentido cuando coincide con las demás señales de comportamiento.

Espaciado entre pulsaciones y ritmo de escritura (dinámica de tecleo)

Esta es la capa que la mayoría de stacks de detección infrautiliza. La escritura humana es irregular de una forma concreta. El intervalo entre pulsaciones varía según el recorrido de los dedos y lo familiar que sea un par de letras, el tiempo que se mantiene pulsada cada tecla se sitúa en un rango característico, y la entrada real está llena de retrocesos y correcciones. Los rellenos de formulario programados van al revés: varianza casi nula entre pulsaciones, o un pegado instantáneo de todo el valor sin ningún ritmo de escritura.

cside lee directamente el espaciado entre pulsaciones y el ritmo de escritura, midiendo la varianza en los tiempos entre entradas y no su contenido. Un campo completado con precisión de metrónomo, o rellenado más rápido de lo que un humano podría teclear físicamente, es una señal fuerte por sí sola y aún más fuerte cuando coincide con una trayectoria de ratón lineal.

La capa de IA: latencia de razonamiento y texto generado

Los bots programados y los agentes basados en LLM fallan de forma distinta, y la capa de IA apunta a esa diferencia.

Un agente autónomo suele hacer una pausa entre acciones mientras su modelo decide qué hacer a continuación. Esa pausa tiene una firma de máquina: es una ida y vuelta a un paso de inferencia, no una persona leyendo la pantalla y dudando. cside lee la latencia entre entradas y acciones y marca el patrón de latencia de razonamiento que dejan las sesiones dirigidas por agentes, que se ve distinto del tiempo de reflexión humano incluso cuando el agente añade retrasos para parecer más humano.

La segunda señal de IA es el propio contenido. Junto a los tiempos de comportamiento, cside incluye un motor de detección de texto generado por IA: cuando un visitante envía texto a través de un formulario, cside puntúa si lo escribió una persona o lo generó un modelo. Eso convierte el texto de un mensaje de soporte, una reseña o un campo de registro en otra entrada para separar a un agente de confianza de uno abusivo.

[MID_BLOG_CTA]

El malentendido: el análisis de comportamiento solo detecta bots programados

La objeción habitual es que la detección de comportamiento solo funciona contra bots toscos y programados, y que un agente de IA capaz la esquiva sin más. Eso era más cierto cuando el principal indicio era una llamada mouse.move(x, y) codificada a mano. Ya no lo es.

Los agentes modernos no siempre usan entradas programadas. Algunos manejan un navegador real e incluso se entrenan con trazas de interacción humana para moverse y escribir de forma más natural. Lo que aún no pueden hacer es mantenerse coherentes en todas las señales a la vez. Un agente puede suavizar su trayectoria de ratón y aun así rellenar un formulario más rápido que cualquier humano. Puede dar variabilidad a su escritura y aun así hacer una pausa con una latencia de razonamiento de precisión mecánica entre pasos. La clave no es una señal perfecta; son las contradicciones entre ellas.

Ninguna señal decide por sí sola: correlación entre señales

Cada señal de comportamiento produce falsos positivos de forma aislada. La tecnología de asistencia automatiza la entrada. Quien usa un trackpad se mueve de forma muy distinta a quien usa un ratón. Un mecanógrafo rápido y experto puede parecer casi programado. Bloquear con una sola lectura castigaría a clientes reales.

Por eso el modelo funciona por convergencia. cside puntúa a través de más de 100 señales de navegador, dispositivo y comportamiento, y busca contradicciones internas. Una sesión que dice ser un escritorio corriente pero ejecuta una superficie de control de automatización, escribe sin varianza y llega desde una IP de centro de datos está contando una historia que no encaja. Una señal débil es una pregunta. Varias señales independientes que apuntan en la misma dirección son una respuesta.

Dónde lees las señales importa

La detección de comportamiento vale lo que vale su punto de observación. cside se ejecuta como JavaScript de origen dentro de sesiones de visitantes reales, en la página en vivo, así que lee las señales de interacción en crudo en lugar de inferirlas después. Esas señales se convierten en una puntuación de riesgo en tiempo real que puedes enviar a los momentos que importan: login, registro y checkout.

Esa ubicación es también lo que hace accionables las señales. Como la puntuación llega a tu propio stack, tú decides la respuesta por cada solicitud en vez de aceptar un único veredicto de una caja externa.

Qué hacer cuando detectas un agente de IA

La detección solo es útil si impulsa una respuesta gradual. No todos los agentes son abuso; parte de la automatización es bienvenida, y distinguir humanos, bots buenos y agentes maliciosos es el objetivo de la puntuación por intención.

  1. Instrumenta las señales de comportamiento en tiempo de ejecución, dentro de la sesión, junto al contexto de dispositivo y red.
  2. Puntúa por señales independientes que convergen, no por la más fuerte por sí sola.
  3. Deja pasar sin fricción a la automatización conocida como buena y a los clientes reales.
  4. Aplica un desafío o verificación adicional a las sesiones de confianza media.
  5. Bloquea o retén el abuso de alta confianza en login, registro y checkout, y conserva las señales en crudo y el motivo del riesgo como registro de auditoría.

El AI Agent Detection y el Bot Detection de cside hacen esto desde dentro de la página: leen señales de ratón, scroll y escritura, capturan el contexto de dispositivo e IP real, puntúan la intención en tiempo real y permiten a tu equipo permitir, desafiar o bloquear por cada solicitud a través del SDK.

Más lecturas en cside

Simon Wijckmans
Founder & CEO

Founder and CEO of cside. Previously a product manager on Cloudflare Page Shield (now Cloudflare Client-Side Security). Co-chair of the W3C Anti-Fraud Community Group and a Forbes 30 Under 30 honoree. Building accessible security against client-side attacks, web security is not an enterprise-only problem.

FAQ

Frequently Asked Questions

La detección de bots basada en comportamiento identifica la automatización por cómo se comporta una sesión y no por lo que informa el navegador. Lee la trayectoria del ratón, la cadencia de scroll y los tiempos de tecleo que un visitante produce en vivo, y luego puntúa si ese comportamiento coincide con el de una persona real o con el de una máquina. Como el comportamiento se genera en tiempo real en respuesta a la página, es mucho más difícil de fingir que una huella, así que detecta agentes de IA que ya pasaron el CAPTCHA y las comprobaciones de IP.

Sí. Las comprobaciones de huella y CAPTCHA prueban lo que informa un navegador y si puede resolver un puzzle en un momento dado. Un agente que maneja Chrome real pasa ambas. Las señales de comportamiento leen cómo la sesión se mueve, hace scroll y escribe con el tiempo, algo que se produce en vivo y es mucho más difícil de fingir. cside lee estas señales desde tu propio JavaScript de origen, así que detecta la automatización que ya superó el WAF y resolvió el CAPTCHA.

El movimiento del ratón es una capa. Por sí sola es vencible, y ya hay herramientas que entrenan modelos para reproducir trayectorias de cursor con aspecto humano. Leer el comportamiento significa correlacionar la trayectoria del ratón, la cadencia de scroll, el espaciado entre pulsaciones y el ritmo de escritura, la latencia entre acciones y si el texto enviado lo escribió una persona o lo generó una IA. La detección surge de que esas señales se contradigan entre sí, no de un único flujo.

Pueden hacerlo si bloqueas con una sola señal. Los lectores de pantalla, el acceso por conmutador, los trackpads y las entradas de asistencia producen tiempos y movimientos que parecen inusuales. Por eso cside puntúa a través de más de 100 señales y actúa por convergencia, no por una sola lectura. Una sesión que escribe con precisión de máquina, ejecuta una superficie de automatización conocida y llega desde una IP de centro de datos es muy distinta de un cliente real que usa tecnología de asistencia, y una respuesta gradual mantiene a ese cliente en marcha.

La capa de comportamiento lee tiempos y movimiento, no identidad: cuándo se pulsan las teclas y cómo se mueve el cursor, no quién eres. El motor de texto generado por IA de cside es una señal aparte que evalúa el contenido que un visitante envía a través de un formulario para juzgar si lo escribió una persona o una IA. Ambos se ejecutan como señales de origen en el sitio que el visitante ya está usando, y alimentan una puntuación de riesgo de bot en lugar de un perfil personal.

Monitoriza y Asegura tus Scripts de Terceros

Gain full visibility and control over every script delivered to your users to enhance site security and performance.

Comienza gratis, o prueba Business con una prueba de 14 días.

Interfaz del panel de cside mostrando monitorización de scripts y análisis de seguridad
Related Articles
Reservar una demo