Información general sobre el indexador web

Última actualización el 29-09-2026

Rastrea contenido de sitio web, prueba los resultados y añade páginas indexadas a una colección.

El Knowledge Base Indexer es una aplicación de escritorio para rastrear contenido de sitio web. Úsela con Knowledge Base en Acrobat para inspeccionar el contenido descubierto durante un rastreo o cargar páginas indexadas a una colección.

Elegir un modo de operación

El indexador proporciona dos modos de operación:

Modo Úsala para
Modo de descubrimiento Rastrea y procesa contenido de sitio web sin cargarlo a una colección.
Modo de carga Rastrea contenido de sitio web y carga las páginas indexadas a una colección donde tienes acceso de escritura.

El modo de descubrimiento está seleccionado de forma predeterminada.

Desactiva el modo de descubrimiento cuando estés listo para autenticarte en Knowledge Base, seleccionar una colección de destino y cargar contenido.

Comprender los controles principales

La aplicación incluye controles para configurar y ejecutar un rastreo:

Control Propósito
URLs objetivo Define dónde comienza el rastreo.
Profundidad de rastreo Controla cuántos niveles de vínculos sigue el Indexer.
Límite de páginas Restringe el número máximo de páginas procesadas.
Número de secundarios Controla cuántos rastreadores procesan páginas en paralelo.
URL de autenticación Proporciona una URL opcional para acceder a contenido de sitio web protegido.
Modo de descubrimiento Cambia entre el modo de descubrimiento y el modo de carga.
Selector de colección Identifica la colección que recibe contenido indexado en modo de carga.
Registros Muestra el progreso, las páginas descubiertas y procesadas, las advertencias, los errores y el estado de finalización.
Iniciar y Detener Inicia o detiene el rastreo.
Cerrar sesión Invalida el token de sesión actual de Knowledge Base.

Cómo funciona el flujo de trabajo de indexación

Un flujo de trabajo de indexación típico incluye:

  1. Instala el paquete Knowledge Base Indexer que coincida con tu ordenador.
  2. Introduce una o más URL de inicio HTTPS.
  3. Configura la profundidad de rastreo, el límite de páginas y el número de procesos secundarios.
  4. Añade una URL de autenticación cuando el sitio web contenga contenido protegido.
  5. Ejecute el rastreo en Modo de descubrimiento para inspeccionar su ámbito e identificar errores.
  6. Cambie al modo de carga, autentíquese y seleccione una colección con permisos de escritura.
  7. Ejecute el rastreo y monitorice los registros hasta que se complete el procesamiento.

Prácticas recomendadas

  • Inicie con una profundidad de rastreo baja y un límite pequeño de páginas.
  • Utilice una URL de inicio para una sección específica del sitio web en lugar de todo un dominio.
  • Pruebe un rastreo en Modo de descubrimiento antes de cargar contenido.
  • Revisa las advertencias y errores en los registros.
  • Aumenta el número de procesos secundarios solo cuando el ordenador tenga recursos suficientes.
  • Evita el rastreo excesivo del mismo sitio web en un período corto.

Cosas que debes saber

  • Solo se admiten URL HTTPS.
  • Las direcciones de red local, las direcciones de bucle invertido y ciertas direcciones IP restringidas están bloqueadas.
  • Se requiere una cuenta de Knowledge Base para el modo de carga, pero no para el modo de descubrimiento.
  • El modo de carga enumera solo las colecciones donde tienes acceso de escritura.
  • Una mayor profundidad de rastreo puede incluir más contenido del previsto.
  • Los límites de página grandes pueden aumentar el tiempo de procesado.
  • Un mayor número de procesos secundarios puede mejorar la velocidad, pero utiliza más recursos del sistema.
  • Los tokens de autenticación se gestionan de forma segura y no se almacenan de forma permanente.