Öppna Knowledge Base Indexer.
Definiera startpunkter, omfattning och bearbetningsgränser för en webbsidecrawlning.
Knowledge Base Indexer börjar med en eller flera mål-URL:er och följer länkar enligt de inställningar du definierar.Konfigurera crawlningen först, använd sedan Discovery Mode för att testa den utan att ladda upp innehåll eller Upload Mode för att lägga till indexerat innehåll till en Knowledge Base in Acrobat-samling.
Innan du börjar
- Installera Knowledge Base Indexer.
- Se till att datorn har en internetanslutning.
- Identifiera en eller flera HTTPS-URL:er att crawla.
Konfigurera en webbsidecrawlning
I Target URLs, ange en eller flera start-URL:er.
Ange varje URL på en separat rad.URL:er måste börja med https://.
Ställ in Crawl Depth.
Crawldjup bestämmer hur många nivåer av länkar Indexer följer från start-URL:erna.
- Ett värde på 1 bearbetar sidor länkade direkt från start-URL:erna.
- Högre värden följer ytterligare nivåer av länkar.
Ställ in Page Limit.
Sidgräns begränsar det maximala antalet sidor som bearbetas under crawlningen.
- Standard: 5
- Maximum: 5 000
Ställ in Number of Workers.
Sekundärer kontrollerar hur många crawlers som bearbetar sidor parallellt.
- Standard: 4
- Rekommenderat för de flesta system: 4–8, beroende på antalet processorkärnor.
Ange en Authentication URL när indexeraren måste autentisera innan den crawlar skyddat innehåll.
Offentliga webbsidor kräver inte detta värde.
Så här fungerar crawlinställningarna
Mål-URL:er |
Definierar var crawlningen börjar. |
Ange en HTTPS-URL per rad. |
Crawldjup |
Bestämmer hur många nivåer av länkar som Indexeraren följer. |
Ett värde på 1 följer länkar direkt från start-URL:erna. |
Sidgräns |
Begränsar det maximala antalet sidor som bearbetas. |
Standard: 5; maximum: 5 000. |
Antal arbetare |
Kontrollerar hur många crawlers som bearbetar sidor parallellt. |
Standard: 4; rekommenderat: 4–8 för de flesta system. |
Autentiserings-URL |
Tillhandahåller en URL som Indexeraren kan använda för att autentisera innan den crawlar skyddat Innehåll. |
Valfritt för offentliga webbsidor. |
Bästa praxis
- Börja med ett grunt crawldjup och en liten sidgräns.
- Rikta in dig på en specifik webbsidassektion istället för en hel domän.
- Öka antalet arbetare endast när datorn har tillräckliga resurser.
- Testa den konfigurerade crawlen i Discovery Mode innan du laddar upp Innehåll.
Bra att veta
- Endast HTTPS-URL:er stöds.
- Lokala nätverksadresser blockeras som en säkerhetsåtgärd.
- Loopback-adresser och vissa begränsade IP-adresser avvisas också.
- Ogiltiga URL:er genererar fel i loggarna när crawlen körs.
- Högre crawldjup kan inkludera fler sidor än avsett.
- Stora sidgränser kan öka bearbetningstiden.
- Högre antal sekundära kan förbättra hastigheten men använder mer systemresurser.
- Att konfigurera crawlningen startar inte bearbetning eller uppladdning av innehåll.
Nästa steg
- För att testa den konfigurerade crawlningen utan att ladda upp innehåll, se [Upptäck webbplatsinnehåll].
- För att köra crawlningen och ladda upp indexerat innehåll, se [Ladda upp webbplatsinnehåll till en samling].