Abra o Knowledge Base Indexer.
Defina os pontos de partida, escopo e limites de processamento para um rastreamento de site.
O Knowledge Base Indexer começa com uma ou mais URLs de destino e segue links de acordo com as configurações definidas por você. Configure o rastreamento primeiro, depois use o Modo de descoberta para testá-lo sem fazer upload de conteúdo ou o Modo de upload para adicionar conteúdo indexado a uma coleção da Knowledge Base no Acrobat.
Antes de começar
- Instale o Knowledge Base Indexer.
- Verifique se o computador tem conexão com a internet.
- Identifique uma ou mais URLs HTTPS para rastrear.
Configure um rastreamento de site
Em Target URLs, insira uma ou mais URLs iniciais.
Insira cada URL em uma linha diferente. As URLs devem começar com https://.
Defina a Crawl Depth.
A profundidade de rastreamento determina quantos níveis de links o Indexer segue a partir das URLs iniciais.
- Um valor de 1 processa páginas vinculadas diretamente das URLs iniciais.
- Valores mais altos seguem níveis adicionais de links.
Defina o Page Limit.
O limite de páginas restringe o número máximo de páginas processadas durante o rastreamento.
- Padrão: 5
- Máximo: 5.000
Defina o Number of Workers.
Os trabalhadores controlam quantos rastreadores processam páginas em paralelo.
- Padrão: 4
- Recomendado para a maioria dos sistemas: 4–8, dependendo do número de núcleos do processador.
Insira uma Authentication URL quando o Indexer precisar se autenticar antes de rastrear conteúdo protegido.
Sites públicos não exigem esse valor.
Como funcionam as configurações de rastreamento
URLs de destino |
Define onde o rastreamento começa. |
Insira uma URL HTTPS por linha. |
Profundidade de rastreamento |
Determina quantos níveis de links o Indexador segue. |
Um valor de 1 segue links diretamente das URLs iniciais. |
Limite de páginas |
Restringe o número máximo de páginas processadas. |
Padrão: 5; máximo: 5.000. |
Número de trabalhadores |
Controla quantos rastreadores processam páginas em paralelo. |
Padrão: 4; recomendado: 4–8 para a maioria dos sistemas. |
URL de autenticação |
Fornece uma URL que o indexador pode usar para autenticar antes de rastrear conteúdo protegido. |
Opcional para sites públicos. |
Práticas recomendadas
- Inicie com uma profundidade de rastreamento superficial e um limite pequeno de páginas.
- Direcione uma seção específica do site em vez de um domínio inteiro.
- Aumente o número de trabalhadores apenas quando o computador tem recursos suficientes.
- Teste o rastreamento configurado no Modo de descoberta antes de fazer upload do conteúdo.
Informações importantes
- Apenas URLs HTTPS são compatíveis.
- Endereços de rede local são bloqueados como medida de segurança.
- Endereços de loopback e determinados endereços IP restritos também são rejeitados.
- URLs inválidas geram erros nos logs quando o rastreamento é executado.
- Profundidades de rastreamento mais altas podem incluir mais páginas do que o pretendido.
- Limites de página grandes podem aumentar o tempo de processamento.
- Contagens de trabalhador mais altas podem melhorar a velocidade, mas usam mais recursos do sistema.
- Configurar o rastreamento não inicia o processamento nem faz upload do conteúdo.
Próximas etapas
- Para testar o rastreamento configurado sem fazer upload do conteúdo, consulte [Descobrir conteúdo do site].
- Para executar o rastreamento e fazer upload do conteúdo indexado, consulte [Fazer upload do conteúdo do site para uma coleção].