Rastrear un sitio web

Última actualización el 29 sep 2026

Define los puntos de partida, el ámbito y los límites de procesamiento para el rastreo de un sitio web.

El Indexador de Base de Conocimiento comienza con una o más URL de destino y sigue vínculos según la configuración que definas.Configura el rastreo primero, luego usa el Modo de Descubrimiento para probarlo sin cargar Contenido o el Modo de Carga para agregar Contenido indexado a una colección de Base de Conocimiento en Acrobat.

Antes de empezar

  • Instala el Indexador de Base de Conocimiento.
  • Asegúrate de que el ordenador tenga conexión a internet.
  • Identifica una o más URL HTTPS para rastrear.

Configurar el rastreo de un sitio web

Abre el Indexador de Base de Conocimiento.

En URL de destino, introduce una o más URL de inicio.

Introduce cada URL en una línea separada.Las URL deben comenzar con https://.

Establece la Profundidad de Rastreo.

La profundidad de rastreo determina cuántos niveles de vínculos sigue el Indexador desde las URL de inicio.

  • Un valor de 1 procesa páginas vinculadas directamente desde las URL de inicio.
  • Valores más altos siguen niveles adicionales de vínculos.

Establece el Límite de Páginas.

El límite de páginas restringe el número máximo de páginas procesadas durante el rastreo.

  • Predeterminado: 5
  • Máximo: 5.000

Establece el Número de Secundarios.

Los secundarios controlan cuántos rastreadores procesan páginas en paralelo.

  • Predeterminado: 4
  • Recomendado para la mayoría de los sistemas: 4–8, dependiendo del número de núcleos del procesador.

Introduzca una URL de autenticación cuando el indexador deba autenticarse antes de rastrear contenido protegido.

Los sitios web públicos no requieren este valor.

Cómo funciona la configuración de rastreo

URLs de destino

Define dónde comienza el rastreo.

Introduzca una URL HTTPS por línea.

Profundidad de rastreo

Determina cuántos niveles de vínculos sigue el indexador.

Un valor de 1 sigue vínculos directamente desde las URL iniciales.

Límite de páginas

Restringe el número máximo de páginas procesadas.

Predeterminado: 5; máximo: 5.000.

Número de secundarios

Controla cuántos rastreadores procesan páginas en paralelo.

Predeterminado: 4; recomendado: 4–8 para la mayoría de sistemas.

URL de autenticación

Proporciona una URL que el indexador puede usar para autenticarse antes de rastrear contenido protegido.

Opcional para sitios web públicos.

Prácticas recomendadas

  • Comience con una profundidad de rastreo superficial y un límite pequeño de páginas.
  • Apunte a una sección específica del sitio web en lugar de un dominio completo.
  • Aumente el número de secundarios solo cuando el ordenador tenga recursos suficientes.
  • Pruebe el rastreo configurado en Modo de descubrimiento antes de cargar contenido.

Cosas que debes saber

  • Solo se admiten URL HTTPS.
  • Las direcciones de red local se bloquean como medida de seguridad.
  • Las direcciones de bucle invertido y ciertas direcciones IP restringidas también se rechazan.
  • Las URL no válidas generan errores en los registros cuando se ejecuta el rastreo.
  • Profundidades de rastreo más altas pueden incluir más páginas de las deseadas.
  • Los límites de páginas elevados pueden aumentar el tiempo de procesamiento.
  • Un mayor número de procesos secundarios puede mejorar la velocidad, pero utiliza más recursos del sistema.
  • Configurar el rastreador no inicia el procesamiento ni la carga de contenido.

Pasos siguientes

  • Para probar el rastreador configurado sin cargar contenido, consulte [Descubrir contenido del sitio web].
  • Para ejecutar el rastreador y cargar contenido indexado, consulte [Cargar contenido de sitio web a una colección].