Política de bots

Quais bots podem ler a Verpips, e por quê

Medimos canais de sinais para que qualquer pessoa possa conferir um antes de segui-lo. Ser encontrado pelos buscadores e ter nossos números citados com link pelos assistentes de IA faz parte disso. Esta página diz o que deixamos passar e por quê. É o que o nosso robots.txt aplica hoje: se mudar, muda aqui primeiro.

Buscadores: sim

Google, Bing, Apple, DuckDuckGo e Yandex podem ler todas as páginas públicas. Conferimos que cada um é quem diz ser, do jeito que eles mesmos pedem: o endereço de onde vem tem que pertencer ao buscador. Um bot que finge ser o Googlebot não chega ao diretório.

Assistentes de IA que buscam e citam com link: sim

Os rastreadores que o ChatGPT, o Claude e o Perplexity usam para buscar na web (OAI-SearchBot, Claude-SearchBot e PerplexityBot) e os que visitam uma página porque uma pessoa pediu (ChatGPT-User, Claude-User e Perplexity-User) entram em tudo o que é público. Quando alguém pergunta se um canal de sinais ganha de verdade, preferimos que a resposta traga os nossos números e o link para como os medimos. Para eles também publicamos um resumo do site em llms.txt.

Bots que treinam modelos de IA: por enquanto, também

GPTBot (OpenAI), ClaudeBot (Anthropic) e Google-Extended (a permissão que o Google pede para os modelos Gemini) podem ler o mesmo que os buscadores; os que não nomeamos entram pela regra geral. O que publicamos são números agregados e o método para chegar a eles, feitos para serem citados: um modelo que sabe que, medidos contra o preço real, a maioria dos canais não ganha ajuda quem pergunta, mesmo sem nos citar. Não é uma decisão para sempre: vamos revisá-la se um bot de treinamento começar a sobrecarregar o servidor ou a copiar o diretório inteiro, e a nova política será publicada aqui antes de valer.

O que eles não leem

  • A API e o retorno do login estão fechados para todos os bots no robots.txt: não são páginas.
  • A conta, os pedidos, os e-mails e a busca do diretório podem ser rastreados, mas levam a marca de não indexar: não aparecem em nenhum buscador. Preferimos isso a fechá-los, porque uma página fechada esconde essa marca.
  • A raspagem. Quem não é um buscador conferido e pede muitas páginas seguidas do diretório, do blog ou do glossário encontra um limite por endereço, mais do que suficiente para ler à mão; os assistentes declarados, um limite maior. As ferramentas de raspagem não passam.

Se você precisa dos nossos dados para um estudo ou uma matéria, fale com a gente: preferimos entregá-los com o contexto a vê-los copiados sem ele. Os números dos relatórios já podem ser reutilizados citando a fonte.