Apri il Knowledge Base Indexer.
Definire i punti di partenza, l'ambito e i limiti di elaborazione per la scansione di un sito web.
Il Knowledge Base Indexer inizia con uno o più URL target e segue i collegamenti in base alle impostazioni che definisci.Prima configura la scansione, quindi usa Discovery Mode per testarla senza caricare contenuto o Upload Mode per aggiungere contenuto indicizzato a una raccolta knowledge base in Acrobat.
Prima di iniziare
- Installa il Knowledge Base Indexer.
- Assicurati che il computer abbia una connessione internet.
- Identifica uno o più URL HTTPS da scansionare.
Configurare la scansione di un sito web
In Target URLs, inserisci uno o più URL di partenza.
Inserisci ogni URL in una riga separata.Gli URL devono iniziare con https://.
Imposta Crawl Depth.
La profondità di scansione determina quanti livelli di collegamenti l'Indexer segue dagli URL di partenza.
- Un valore di 1 elabora le pagine collegate direttamente dagli URL di partenza.
- Valori più alti seguono livelli aggiuntivi di collegamenti.
Imposta Page Limit.
Il limite di pagina limita il numero massimo di pagine elaborate durante la scansione.
- Predefinito: 5
- Massimo: 5.000
Imposta Number of Workers.
I worker controllano quanti crawler elaborano le pagine in parallelo.
- Predefinito: 4
- Consigliato per la maggior parte dei sistemi: 4–8, a seconda del numero di core del processore.
Inserisci un Authentication URL quando l'Indexer deve autenticarsi prima di eseguire la scansione del contenuto protetto.
I siti web pubblici non richiedono questo valore.
Come funzionano le impostazioni di scansione
URL target |
Definisce il punto di partenza della scansione. |
Inserisci un URL HTTPS per riga. |
Profondità di scansione |
Determina quanti livelli di collegamenti segue l'indicizzatore. |
Un valore di 1 segue i collegamenti direttamente dagli URL di partenza. |
Limite di pagine |
Limita il numero massimo di pagine elaborate. |
Predefinito: 5; massimo: 5.000. |
Numero di worker |
Controlla quanti crawler elaborano le pagine in parallelo. |
Predefinito: 4; consigliato: 4–8 per la maggior parte dei sistemi. |
URL di autenticazione |
Fornisce un URL utilizzabile dall'indicizzatore per l'autenticazione prima di eseguire la scansione di contenuti protetti. |
Facoltativo per i siti web pubblici. |
Best practice
- Inizia con una profondità di scansione ridotta e un limite di pagine piccolo.
- Prendi come target una sezione specifica del sito web anziché un intero dominio.
- Aumenta il numero di processi secondari solo quando il computer ha risorse sufficienti.
- Testa la scansione configurata in modalità Discovery prima di caricare i contenuti.
Aspetti da considerare
- Sono supportati solo gli URL HTTPS.
- Gli indirizzi di rete locali sono bloccati per motivi di sicurezza.
- Anche gli indirizzi loopback e determinati indirizzi IP limitati vengono rifiutati.
- Gli URL non validi generano errori nei registri durante l'esecuzione della scansione.
- Profondità di scansione maggiori possono includere più pagine di quelle previste.
- Limiti di pagina elevati possono aumentare i tempi di elaborazione.
- Un numero maggiore di processi secondari può migliorare la velocità, ma utilizza più risorse di sistema.
- La configurazione della scansione non avvia l'elaborazione né carica contenuti.
Fasi seguenti
- Per testare la scansione configurata senza caricare contenuti, vedi [Scoprire i contenuti del sito web].
- Per eseguire la scansione e caricare contenuti indicizzati, vedi [Caricare i contenuti del sito web in una raccolta].