Política de bots
Qué bots pueden leer Verpips, y por qué
Medimos canales de señales para que cualquiera pueda comprobar uno antes de seguirlo. Que nos encuentren los buscadores y que los asistentes de IA citen nuestras cifras con su enlace es parte de eso. Esta página dice qué dejamos pasar y por qué. Es lo que aplica hoy nuestro robots.txt: si cambia, cambia aquí primero.
Buscadores: sí
Google, Bing, Apple, DuckDuckGo y Yandex pueden leer todas las páginas públicas. Comprobamos que cada uno es quien dice ser, como piden ellos mismos: la dirección desde la que llega tiene que pertenecer al buscador. Un bot que se hace pasar por Googlebot no llega al directorio.
Asistentes de IA que buscan y citan con enlace: sí
Los rastreadores con los que ChatGPT, Claude y Perplexity buscan en la web (OAI-SearchBot, Claude-SearchBot y PerplexityBot) y los que visitan una página porque una persona se la pidió (ChatGPT-User, Claude-User y Perplexity-User) entran en todo lo público. Cuando alguien pregunta si un canal de señales gana de verdad, preferimos que la respuesta lleve nuestras cifras y el enlace a cómo las medimos. Para ellos tenemos además un resumen del sitio en llms.txt.
Bots que entrenan modelos de IA: hoy también
GPTBot (OpenAI), ClaudeBot (Anthropic) y Google-Extended (el permiso que pide Google para sus modelos Gemini) pueden leer lo mismo que los buscadores; los que no nombramos entran por la regla general. Lo que publicamos son cifras agregadas y el método para obtenerlas, hechas para que se citen: que un modelo sepa que, medidos contra el precio real, la mayoría de canales no gana, ayuda a quien pregunta aunque no nos nombre. No es una decisión para siempre: la revisaremos si un bot de entrenamiento empieza a cargar el servidor o a copiar el directorio entero, y la nueva política se publicará aquí antes de aplicarse.
Lo que no leen
- La API y la vuelta del inicio de sesión están cerradas a todos los bots en robots.txt: no son páginas.
- La cuenta, los pedidos, los correos y la búsqueda del directorio se pueden leer, pero llevan la marca de no indexar: no salen en ningún buscador. Preferimos eso a cerrarlas, porque una página cerrada no deja ver esa marca.
- El raspado. Quien no sea un buscador comprobado y pida muchas páginas del directorio, del blog o del diccionario seguidas encuentra un límite por dirección, de sobra para leerlas a mano; los asistentes declarados, uno más amplio. Las herramientas de raspado no pasan.
Si necesitas nuestros datos para un estudio o un artículo, escríbenos: preferimos dártelos con su contexto a que se copien sin él. Las cifras de los informes ya se pueden reutilizar citando la fuente.