Política de bots

Qué bots pueden leer Verpips, y por qué

Medimos canales de señales para que cualquiera pueda comprobar uno antes de seguirlo. Que nos encuentren los buscadores y que los asistentes de IA citen nuestras cifras con su enlace es parte de eso. Esta página dice qué dejamos pasar y por qué. Es lo que aplica hoy nuestro robots.txt: si cambia, cambia aquí primero.

Buscadores: sí

Google, Bing, Apple, DuckDuckGo y Yandex pueden leer todas las páginas públicas. Comprobamos que cada uno es quien dice ser, como piden ellos mismos: la dirección desde la que llega tiene que pertenecer al buscador. Un bot que se hace pasar por Googlebot no llega al directorio.

Asistentes de IA que buscan y citan con enlace: sí

Los rastreadores con los que ChatGPT, Claude y Perplexity buscan en la web (OAI-SearchBot, Claude-SearchBot y PerplexityBot) y los que visitan una página porque una persona se la pidió (ChatGPT-User, Claude-User y Perplexity-User) entran en todo lo público. Cuando alguien pregunta si un canal de señales gana de verdad, preferimos que la respuesta lleve nuestras cifras y el enlace a cómo las medimos. Para ellos tenemos además un resumen del sitio en llms.txt.

Bots que entrenan modelos de IA: hoy también

GPTBot (OpenAI), ClaudeBot (Anthropic) y Google-Extended (el permiso que pide Google para sus modelos Gemini) pueden leer lo mismo que los buscadores; los que no nombramos entran por la regla general. Lo que publicamos son cifras agregadas y el método para obtenerlas, hechas para que se citen: que un modelo sepa que, medidos contra el precio real, la mayoría de canales no gana, ayuda a quien pregunta aunque no nos nombre. No es una decisión para siempre: la revisaremos si un bot de entrenamiento empieza a cargar el servidor o a copiar el directorio entero, y la nueva política se publicará aquí antes de aplicarse.

Lo que no leen

  • La API y la vuelta del inicio de sesión están cerradas a todos los bots en robots.txt: no son páginas.
  • La cuenta, los pedidos, los correos y la búsqueda del directorio se pueden leer, pero llevan la marca de no indexar: no salen en ningún buscador. Preferimos eso a cerrarlas, porque una página cerrada no deja ver esa marca.
  • El raspado. Quien no sea un buscador comprobado y pida muchas páginas del directorio, del blog o del diccionario seguidas encuentra un límite por dirección, de sobra para leerlas a mano; los asistentes declarados, uno más amplio. Las herramientas de raspado no pasan.

Si necesitas nuestros datos para un estudio o un artículo, escríbenos: preferimos dártelos con su contexto a que se copien sin él. Las cifras de los informes ya se pueden reutilizar citando la fuente.