Rastrear um site

Última atualização em 8 de out de 2026

Defina os pontos de partida, escopo e limites de processamento para um rastreamento de site.

O Knowledge Base Indexer começa com uma ou mais URLs de destino e segue links de acordo com as configurações definidas por você. Configure o rastreamento primeiro, depois use o Modo de descoberta para testá-lo sem fazer upload de conteúdo ou o Modo de upload para adicionar conteúdo indexado a uma coleção da Knowledge Base no Acrobat.

Antes de começar

  • Instale o Knowledge Base Indexer.
  • Verifique se o computador tem conexão com a internet.
  • Identifique uma ou mais URLs HTTPS para rastrear.

Configure um rastreamento de site

Abra o Knowledge Base Indexer.

Em Target URLs, insira uma ou mais URLs iniciais.

Insira cada URL em uma linha diferente. As URLs devem começar com https://.

Defina a Crawl Depth.

A profundidade de rastreamento determina quantos níveis de links o Indexer segue a partir das URLs iniciais.

  • Um valor de 1 processa páginas vinculadas diretamente das URLs iniciais.
  • Valores mais altos seguem níveis adicionais de links.

Defina o Page Limit.

O limite de páginas restringe o número máximo de páginas processadas durante o rastreamento.

  • Padrão: 5
  • Máximo: 5.000

Defina o Number of Workers.

Os trabalhadores controlam quantos rastreadores processam páginas em paralelo.

  • Padrão: 4
  • Recomendado para a maioria dos sistemas: 4–8, dependendo do número de núcleos do processador.

Insira uma Authentication URL quando o Indexer precisar se autenticar antes de rastrear conteúdo protegido.

Sites públicos não exigem esse valor.

Como funcionam as configurações de rastreamento

URLs de destino

Define onde o rastreamento começa.

Insira uma URL HTTPS por linha.

Profundidade de rastreamento

Determina quantos níveis de links o Indexador segue.

Um valor de 1 segue links diretamente das URLs iniciais.

Limite de páginas

Restringe o número máximo de páginas processadas.

Padrão: 5; máximo: 5.000.

Número de trabalhadores

Controla quantos rastreadores processam páginas em paralelo.

Padrão: 4; recomendado: 4–8 para a maioria dos sistemas.

URL de autenticação

Fornece uma URL que o indexador pode usar para autenticar antes de rastrear conteúdo protegido.

Opcional para sites públicos.

Práticas recomendadas

  • Inicie com uma profundidade de rastreamento superficial e um limite pequeno de páginas.
  • Direcione uma seção específica do site em vez de um domínio inteiro.
  • Aumente o número de trabalhadores apenas quando o computador tem recursos suficientes.
  • Teste o rastreamento configurado no Modo de descoberta antes de fazer upload do conteúdo.

Informações importantes

  • Apenas URLs HTTPS são compatíveis.
  • Endereços de rede local são bloqueados como medida de segurança.
  • Endereços de loopback e determinados endereços IP restritos também são rejeitados.
  • URLs inválidas geram erros nos logs quando o rastreamento é executado.
  • Profundidades de rastreamento mais altas podem incluir mais páginas do que o pretendido.
  • Limites de página grandes podem aumentar o tempo de processamento.
  • Contagens de trabalhador mais altas podem melhorar a velocidade, mas usam mais recursos do sistema.
  • Configurar o rastreamento não inicia o processamento nem faz upload do conteúdo.

Próximas etapas

  • Para testar o rastreamento configurado sem fazer upload do conteúdo, consulte [Descobrir conteúdo do site].
  • Para executar o rastreamento e fazer upload do conteúdo indexado, consulte [Fazer upload do conteúdo do site para uma coleção].