Indicizzazione Google: come funziona, quanto ci mette e come si verifica

L’indicizzazione Google è il passaggio in cui la Ricerca analizza una pagina e la archivia nel proprio Indice, il database da cui pesca i risultati. Una pagina che non ci entra non compare in SERP, qualunque cosa tu faccia sul resto. Non è un’operazione che si comanda: Google dichiara di non garantire scansione, indicizzazione né

AUTHOR: Donato Pirolo
PUBLISHED: Agosto 29, 2026
MODIFIED: Agosto 29, 2026
Indicizzazione Google: come funziona, quanto ci mette e come si verifica

L’indicizzazione Google è il passaggio in cui la Ricerca analizza una pagina e la archivia nel proprio Indice, il database da cui pesca i risultati. Una pagina che non ci entra non compare in SERP, qualunque cosa tu faccia sul resto.

Non è un’operazione che si comanda: Google dichiara di non garantire scansione, indicizzazione né pubblicazione. Quello su cui puoi intervenire è togliere gli ostacoli e leggere il responso, che arriva sempre con lo stesso vocabolario — i quindici motivi del rapporto «Indicizzazione delle pagine» di Search Console.

Quanto ci mette Google a indicizzare una pagina nuova, come si verifica lo stato di un singolo URL, cosa distingue «Rilevata» da «Scansionata» e perché richiedere l’indicizzazione a mano quasi mai risolve: sono le domande a cui l’articolo risponde, con le procedure per ciascun caso.

Cos’è l’indicizzazione di Google

Indicizzare una pagina vuol dire analizzarne il contenuto e archiviarlo nell’Indice Google, il database da cui la Ricerca pesca i risultati quando qualcuno digita una query.

Google avverte che non garantisce «che eseguirà la scansione della tua pagina, che la indicizzerà o la pubblicherà», anche se rispetti le nozioni di base della Ricerca. E poche righe sotto: «L’indicizzazione non è garantita; non tutte le pagine elaborate da Google verranno indicizzate».

Sono due frasi della pagina su come funziona la Ricerca Google, e sono il motivo per cui questo articolo è fatto come è fatto. Nessuna procedura ti mette in indice: decide Google. L’unica leva che resta è capire cosa ha deciso e perché.

Scansione, indicizzazione, posizionamento: tre cose diverse

Le tre fasi che Google tiene separate: la scansione scarica l'URL, l'indicizzazione analizza e archivia, il posizionamento ordina i risultati; ognuna ha la sua uscita, e il caso più frequente è la pagina che supera la scansione e si pianta all'indicizzazione.

Tre fasi in fila, che Google tiene separate anche nel nome: scansione, indicizzazione, pubblicazione dei risultati. Una pagina può superare la prima e piantarsi alla seconda, ed è il caso che vedo più spesso.

FaseCosa fa GoogleDove si verificaCosa vedi se si ferma qui
ScansioneScarica testo, immagini e video dell’URLControllo URL, sezione Scansione«Rilevata, ma attualmente non indicizzata»
IndicizzazioneAnalizza la pagina, sceglie la canonica, archiviaRapporto Indicizzazione delle pagine«Pagina scansionata, ma attualmente non indicizzata»
PosizionamentoOrdina i risultati per la query dell’utenteRapporto RendimentoLa pagina è in indice e non porta clic

Da qui la regola base dell’indicizzazione SEO: l’indicizzazione è il prerequisito, il posizionamento è il campionato. Lavorare sui title di una pagina fuori dall’indice è come lucidare la macchina mentre sta ancora dal concessionario.

Chi cerca «perché non ranko» ha spesso un problema di fase uno o due, e sta armeggiando sulla tre.

Come funziona l’indicizzazione Google, fase per fase

Le fasi della Ricerca sono tre, scansione, indicizzazione e pubblicazione, e il rendering Google lo mette dentro la scansione. Come fase a sé lo stacca nella guida per i siti JavaScript. Qui lo tengo separato, e prima di tutte c’è il rilevamento.

Rilevamento. Google deve prima sapere che quell’URL esiste. Lo scopre dai link nelle pagine già scansionate, dalle sitemap, dagli URL che gli segnali a mano. Un indirizzo che nessuno linka e che non sta in nessuna sitemap, per Google non c’è.

Scansione. Googlebot preleva l’URL dalla coda e la prima cosa che legge è il robots.txt. Se il percorso è in disallow salta la richiesta HTTP: niente scansione, niente rendering, niente indicizzazione. Altrimenti scarica la risposta e ne estrae i link, che finiscono in fondo alla stessa coda.

Rendering. Tutte le pagine che rispondono 200 vengono accodate per il rendering, con o senza JavaScript dentro, a meno che un meta tag robots o un header non dica di non indicizzarle. Un’istanza di Chromium headless esegue il codice e restituisce l’HTML finale. È la fase dove i siti moderni perdono tempo senza accorgersene.

Indicizzazione. Google analizza testo, immagini e video, raggruppa le pagine con contenuti simili e sceglie la canonica del gruppo, quella che potrà comparire in SERP. Le altre restano versioni alternative. Le informazioni raccolte possono finire nell’Indice, «un grande database ospitato su migliaia di computer». Valgono ancora le due frasi di prima: elaborata non vuol dire indicizzata.

Per la maggior parte dei siti Google indicizza principalmente la versione mobile, e lo dichiara nella documentazione di Googlebot. Se il desktop è ricco e il mobile è stato potato per fare prima, conta il mobile.

La coda di rendering, il ritardo che non si vede

Una pagina può essere già stata scansionata e restare in coda per il rendering, e Google non dice per quanto. In Search Console non ha un’icona rossa, né un errore, né un pulsante.

Google lo documenta senza giri di parole: accoda per il rendering tutte le pagine con codice di stato 200, a meno che un meta tag robots o un header non dica di non indicizzarle, e «la pagina potrebbe rimanere in questa coda per alcuni secondi o per un periodo più lungo». Il rendering parte «quando le risorse di Google lo consentono». Sta tutto nella guida su JavaScript e Ricerca.

Tradotto: se il tuo sito serve una shell vuota e riempie tutto lato client, il contenuto vero esiste solo dopo il rendering. Fino a quel momento Google ha in mano un <div id="root"> e poco altro. Qui non si corregge niente: c’è una fila, e davanti a te sta il resto del web.

Il rimedio è il rendering lato server, o il pre-rendering: il contenuto arriva già nella risposta HTTP. Google lo raccomanda lì stesso, con l’argomento che convince anche chi la SEO non la vuole sentire nominare: non tutti i bot eseguono JavaScript.

Quanti byte legge davvero Googlebot

Due megabyte per URL, PDF esclusi, che ne prendono 64. Il famoso limite di 15 MB che circola in italiano dal 2022 oggi è il valore predefinito degli altri crawler di Google che non ne specificano uno proprio.

Il 31 marzo 2026 Google ha pubblicato il post sui byte di Googlebot, e i dettagli stanno lì:

  • il limite non conta solo il corpo del documento: «Tieni presente che il limite include le intestazioni delle richieste HTTP»;
  • se l’HTML supera la soglia la pagina non viene rifiutata: «l’estrazione si interrompe esattamente alla soglia di 2 MB», e quella porzione passa ai sistemi di indicizzazione e al rendering «come se fosse il file completo»;
  • i byte oltre la soglia «vengono ignorati completamente. Non vengono recuperati, non vengono visualizzati e non sono indicizzati»;
  • quasi ogni risorsa referenziata nell’HTML (fuori restano contenuti multimediali, caratteri e qualche formato esotico) ha «un proprio contatore di byte per URL separato» e non pesa sulle dimensioni della pagina principale.

Nello stesso post Google spiega perché quel numero gira ancora: Googlebot «è solo un utente di qualcosa che assomiglia a una piattaforma di scansione centralizzata», la stessa che serve Shopping e AdSense, e ogni client si regola i byte per conto suo.

Da cui la regola pratica in fondo al post: title, meta tag, canonical e dati strutturati vanno in alto nel documento. Se apri con due megabyte di menu e immagini in base64, il canonical resta sotto il pelo dell’acqua e per Googlebot non esiste.

Quanto tempo ci vuole perché Google indicizzi una pagina

I numeri Google li dà, e sono quattro, uno per situazione. Stanno su tre pagine diverse.

SituazioneTempo dichiarato da Google
Sito o pagina nuovi, dalla pubblicazione all’indicizzazione«da un giorno o due fino a qualche settimana»
Prima di sospettare un problemaalmeno una settimana dall’invio della sitemap o dalla richiesta
Richiesta di indicizzazione da Controllo URL«In genere l’indicizzazione richiede circa un giorno, ma in alcuni casi può richiedere molto più tempo»
Convalida di una correzione in Search Console«fino a 2 settimane, ma in alcuni casi può impiegare molto più tempo»

Nessuna media inventata. Il numero che manca, e che tutti vorrebbero, è «quanto ci mette la mia pagina». Quello Google non lo dà.

Prima riga: «da un giorno o due fino a qualche settimana» è il tempo totale, scansione più indicizzazione, e sta nella scheda di Google sui tempi. La stessa pagina consiglia di aspettare almeno una settimana prima di dare la colpa a qualcuno, ed è il consiglio che si ignora più volentieri: le diagnosi di «Google non mi indicizza» arrivano il terzo giorno.

Sulla terza riga c’è un’altra precisazione. Quel «circa un giorno» vale per la richiesta manuale, e sulla stessa pagina Google scrive anche che l’indicizzazione «potrebbe richiedere un paio di settimane»: caso tipico e caso brutto, tutti e due dichiarati.

Come indicizzare un sito su Google, in ordine

La sequenza è questa, e il primo passo non è la sitemap.

  1. Rendi la pagina raggiungibile da un link. I crawler scoprono gli URL a partire dai link nelle pagine che hanno già scansionato. Nella documentazione sulle sitemap Google scrive che se le pagine del sito sono collegate in modo corretto «riesce solitamente a trovare la maggior parte dei contenuti». La prima domanda è questa: da quale pagina già indicizzata si arriva a questa? Se la risposta è nessuna, il problema l’hai trovato.
  2. Guarda il robots.txt. Un disallow ferma la richiesta HTTP, e senza richiesta non c’è scansione. Nessuno strumento aggira questo passaggio.
  3. Cerca il noindex. Meta tag nell’<head> oppure header X-Robots-Tag. Su WordPress è la casella «Scoraggia i motori di ricerca dall’indicizzare questo sito», che qualcuno ha lasciato spuntata dai tempi dello staging. Succede più spesso di quanto sia decoroso ammettere.
  4. Controlla che risponda 200 e che il canonical punti a sé stessa. Un 3xx, un 4xx o un canonical che rimanda altrove sono tre modi diversi di dire a Google di indicizzare un altro URL.
  5. Invia la sitemap. Aiuta, e su siti grandi o mal collegati aiuta parecchio, ma «non garantisce che tutti gli elementi nella Sitemap vengano sottoposti a scansione e indicizzazione». Come si costruisce, come si spezza e cosa ci va dentro sta nel pezzo sulla sitemap.xml.
  6. Usa Controllo URL per la singola pagina che ti serve subito. Una richiesta ha senso per la pagina nuova a cui tieni, non per i quattromila URL del catalogo.
  7. Aspetta una settimana prima di preoccuparti. Il calendario fa parte della diagnosi.

Il punto uno merita una riga in più, perché in giro si legge il contrario: che l’unico modo di aiutare il crawler sia la sitemap. La sitemap aiuta il rilevamento, il rilevamento ordinario passa dai link. Un sito con una buona architettura interna viene trovato lo stesso, e un sito pieno di pagine orfane non si aggiusta con un file XML: quel file dice a Google che l’URL esiste, e finisce lì.

La sitemap è l’elenco degli invitati, i link interni sono le indicazioni stradali. Se mandi l’elenco senza l’indirizzo, alla festa non si presenta nessuno.

Come verificare se una pagina è indicizzata

Con lo strumento Controllo URL di Search Console. Il comando site: dà un indizio, e si ferma lì.

Il pannello risponde con due indicazioni, che dicono meno di quanto sembri. «L’URL si trova su Google» significa che la pagina è indicizzata e idonea a comparire, e la documentazione del Controllo URL mette il paletto da sola: quell’indicazione «non garantisce che la tua pagina apparirà nei risultati della Ricerca», perché il report «non verifica tutte le condizioni». «L’URL non si trova su Google» dice che non comparirà, e il motivo si legge espandendo la sezione Disponibilità.

Poi c’è la questione dei due tempi, la vera fabbrica di equivoci. Il risultato che vedi per default arriva dalla versione indicizzata più recente, non dalla pagina che c’è online adesso: se hai tolto il noindex stamattina, quel pannello può mostrarti ancora il problema di due settimane fa. Google indica anche il rimedio e il nome del pulsante: «Per testare la versione corrente della pagina così come la vedrebbe Google, seleziona il pulsante Test in tempo reale nella pagina». Le due risposte possono divergere senza che nulla sia rotto, e il test in tempo reale «controlla soltanto se Google-InspectionTool riesce ad accedere alla tua pagina per l’indicizzazione».

Sull’operatore site: la pagina di Google dedicata agli operatori di ricerca è netta. Un URL indicizzato può comparire nelle query site: correlate, «ma non è garantito che accada», e l’elenco restituito «non è sempre esaustivo», soprattutto sui siti grandi. Quando l’URL non compare, quella stessa pagina ti manda al Controllo URL. Usare site: come prova è come cercare qualcuno in casa aprendo solo il frigo: se sta lì l’hai trovato, ma il silenzio non dimostra niente.

I 15 motivi per cui una pagina non è indicizzata

Il rapporto «Indicizzazione delle pagine» ne elenca quindici, con questi nomi esatti nell’interfaccia italiana. Quattro non sono errori: due non chiedono niente, gli altri due al massimo una verifica.

StatoCosa dice GoogleÈ un errore?Cosa fare
Errore del server (5xx)Il server ha restituito un errore di livello 500 alla richiestaLog del server. Se è intermittente è un problema di capacità
Errore di reindirizzamentoCatena troppo lunga, loop, URL oltre la lunghezza massima o URL non valido o vuoto nella catenaAccorcia la catena, possibilmente a un salto solo
URL bloccato da robots.txtBloccata dal file del sito. «Questo non garantisce che la pagina non verrà indicizzata con altri metodi»DipendeSe è voluto va bene. Altrimenti togli il disallow
URL contrassegnato con «noindex»Trovata l’istruzione noindex durante l’indicizzazioneDipendeSe è voluto va bene. Altrimenti rimuovi meta tag o header
Soft 404Restituisce un messaggio «non trovato» senza il codice HTTP 404Rispondi con un 404 vero, oppure metti contenuto nella pagina
Bloccata a causa di una richiesta non autorizzata (401)Accesso a Googlebot bloccato da una richiesta di autorizzazioneDipendeArea riservata, va bene. Altrimenti apri l’accesso
Non trovata (404)404 alla richiesta. L’URL è stato rilevato senza richiesta esplicita né sitemapNon necessariamentePagina rimossa senza sostituto: va bene così. Pagina spostata: redirect 301
Bloccata a causa di un accesso non autorizzato (403)Googlebot non fornisce mai credenziali, «quindi il tuo server restituisce erroneamente questo errore»Consenti l’accesso senza autenticazione
L’URL è bloccato a causa di un altro errore 4xxUn 4xx non contemplato dagli altri statiDebug con lo strumento Controllo URL
Pagina scansionata, ma attualmente non indicizzataScansionata e non indicizzata. «Non è necessario inviare di nuovo l’URL per la scansione»Motivo non dichiaratoVedi la sezione qui sotto
Rilevata, ma attualmente non indicizzataRilevata e non ancora scansionata: la scansione «sembrava sovraccaricare il sito» ed è stata riprogrammataMotivo dichiarato: in genere la capacitàVedi la sezione qui sotto
Pagina alternativa con tag canonical appropriatoLa pagina rimanda correttamente alla canonica, che è indicizzataNo«Non devi fare nulla»
Pagina duplicata senza URL canonico selezionato dall’utenteDuplicato senza canonica dichiarata: Google ne ha scelta un’altraNo, «funziona come previsto»Se la scelta non ti convince, dichiara tu la canonica
Pagina duplicata, Google ha scelto una pagina canonica diversa da quella specificata dall’utenteHai dichiarato una canonica, Google ne ha preferita un’altraNoGuarda con Controllo URL quale ha scelto, poi differenzia i contenuti
Pagina con reindirizzamentoURL non canonico che reindirizza a un’altra paginaNoNiente, è il comportamento atteso

Quattro di questi quindici descrivono pagine indicizzate sotto un altro indirizzo, o URL che rimandano altrove come devono: «Pagina alternativa con tag canonical appropriato», i due stati di pagina duplicata e «Pagina con reindirizzamento». Sul duplicato senza canonica dichiarata Google lo scrive per esteso: «Non si tratta di un errore, ma funziona come previsto, perché Google non pubblica pagine duplicate». Vederli nel rapporto e correggerli è il modo più rapido di rompere qualcosa che funzionava.

Un quinto caso da non trattare come emergenza è «Non trovata (404)»: se la pagina è stata rimossa e non ha un sostituto, quella è la risposta giusta. Google aggiunge che «non esiste un modo per indicare a Googlebot di ignorare definitivamente un URL», anche se la frequenza di scansione cala da sola.

Fuori dai quindici, nella tabella «Migliora l’esperienza sulle pagine», c’è uno stato che conviene conoscere: «Indicizzata ma bloccata da robots.txt», classificato come avviso. La pagina è nell’indice nonostante il blocco, perché altri siti la linkano, e Google avverte che è probabile che gli snippet siano «molto limitati». Il rimedio sta nella sezione sul noindex.

Sui tempi: quando hai corretto e clicchi «Convalida correzione», la stessa pagina avverte che «in genere la convalida richiede fino a 2 settimane, ma in alcuni casi può impiegare molto più tempo». Ricliccare nel frattempo non accelera niente, e Google dice di non farlo.

«Rilevata» e «Scansionata»: due stati, due diagnosi opposte

«Rilevata» e «Scansionata» descrivono momenti opposti della pipeline: nel primo caso Google non ha ancora scaricato la pagina perché la scansione sovraccaricava il server, nel secondo l'ha letta per intero e l'ha lasciata fuori dall'indice, e reinviare l'URL non aggiunge nulla.

I due nomi si somigliano e descrivono momenti opposti della pipeline. Nel primo Google non ha ancora scaricato la pagina. Nel secondo l’ha scaricata, guardata e lasciata fuori. Confonderli porta a fare la cosa sbagliata: reinviare l’URL quando andrebbe guardato il server, o guardare il server quando l’URL è già stato letto.

Rilevata, ma attualmente non indicizzata

Google l’ha trovata e non l’ha ancora scansionata, e la causa la dichiara lui: «In genere questo significa che Google ha cercato di eseguire la scansione dell’URL, ma l’operazione sembrava sovraccaricare il sito, quindi ha dovuto riprogrammare la scansione». È il motivo per cui nel rapporto la data di ultima scansione è vuota.

Qui si guarda la capacità di risposta del server: tempi di risposta, picchi di traffico, hosting condiviso che va in ginocchio alle nove del mattino, CDN a singhiozzo. Se lo stato riguarda una fetta consistente dei tuoi URL, sei anche dentro il terzo caso della guida al crawl budget, più avanti.

La spiegazione che circola, «Google l’ha vista e l’ha giudicata scarsa», qui non regge: per giudicarla dovrebbe averla letta, e non l’ha letta.

Pagina scansionata, ma attualmente non indicizzata

Google l’ha scaricata, l’ha valutata e per ora fuori dall’indice ci resta. Il motivo non lo dichiara. La descrizione ufficiale è tutta qui: «In futuro la pagina potrebbe essere indicizzata o meno, ma non è necessario inviare di nuovo l’URL per la scansione».

Quella frase va presa alla lettera, perché smonta un rituale diffusissimo: reinviare l’URL ogni due giorni sperando che alla settima volta cambi idea. Google i byte ce li ha già. Rimandarglieli non aggiunge informazione.

Cosa resta da fare, senza inventarsi cause che la documentazione non dà: guardare se quella pagina dice qualcosa che le altre tue non dicono già, se è raggiungibile da link interni che contano, se il contenuto è quello che cercava chi ci arriva. Sono ipotesi, e le dichiaro come tali: qui la fonte ufficiale tace, e chi riempie il silenzio sta scrivendo la sua opinione.

Come bloccare l’indicizzazione di una pagina (e di un PDF)

Con il noindex, che esiste in due forme. Il robots.txt a questo non serve, e provarci è il modo più affidabile di non riuscirci.

Il meta tag va nell’<head>:

<meta name="robots" content="noindex">

L’header HTTP fa la stessa identica cosa dal lato server:

HTTP/1.1 200 OK
(...)
X-Robots-Tag: noindex
(...)

Sul PDF l’header è l’unica strada. Un PDF non ha un <head> in cui infilare un meta tag, e nemmeno un XLSX, un’immagine o un file video. Google lo dice esplicito nella pagina sul noindex: l’intestazione della risposta si può usare «per risorse non HTML, come PDF, file video e file immagine». Chi ha un archivio di vecchie circolari in PDF da tenere fuori dalla SERP passa dalla configurazione del server o della CDN.

La trappola è sempre la stessa, e continua a funzionare benissimo. Mettere il noindex sulla pagina e bloccarla nel robots.txt: le due istruzioni si annullano. Google: «Se la pagina è bloccata da un file robots.txt oppure non è possibile accedervi, il crawler non rileverà mai la regola noindex e la pagina potrà essere ancora visualizzata nei risultati di ricerca». Hai chiuso a chiave la stanza dove hai appeso il cartello.

Da lì si capisce anche perché una pagina bloccata compare lo stesso: il blocco vale sulla scansione, non sull’indice. Google dentro non entra, ma l’indirizzo glielo passano i link degli altri, e pubblica un risultato senza descrizione.

La sequenza corretta, quando una pagina bloccata è già in indice: togli il disallow, lascia che Googlebot entri e legga il noindex, e lascialo entrare anche dopo, perché il noindex funziona solo finché Google può rileggerlo. Una cosa da non fare: scrivere il noindex dentro il robots.txt. Google avverte che «specificare la regola noindex nel file robots.txt non è un’operazione supportata». Quali righe il parser accetta davvero, e cosa fa ognuna, sta nel pezzo sul robots.txt.

Si può forzare l’indicizzazione?

No. Si può chiedere, in un modo solo, e la richiesta non vincola nessuno.

La Richiesta di indicizzazione. Sta dentro Controllo URL, si clicca su un URL alla volta e segnala a Google che quell’indirizzo è nuovo o è cambiato. Tre cose scritte sulla stessa pagina, da sapere prima di premere il pulsante: «In genere l’indicizzazione richiede circa un giorno, ma in alcuni casi può richiedere molto più tempo»; «l’invio di una richiesta non garantisce che la pagina verrà visualizzata nell’Indice Google»; «esiste un limite giornaliero al numero di richieste di indicizzazione che puoi inviare». Il numero preciso Google non lo pubblica. Se trovi una guida che ti dice quante sono, quella cifra arriva da qualche altra parte.

L’API Indexing. Esiste, è ufficiale, e quasi certamente non riguarda il tuo sito. Google la delimita in una riga nella guida rapida all’API Indexing: «può essere utilizzata solo per eseguire la scansione di pagine con elementi JobPosting o BroadcastEvent incorporati in una proprietà VideoObject». Offerte di lavoro e dirette video, cioè contenuti che scadono in fretta. Per un blog, un sito aziendale o un e-commerce non è prevista, e sulla stessa pagina Google raccomanda comunque di inviare una sitemap «per la copertura dell’intero sito».

Non si paga. L’ultima premessa da smontare, perché intorno a questa query gira parecchia gente che vende scorciatoie. Google: «L’inserimento e il ranking nei risultati della Ricerca Google non comportano alcun costo e non accettiamo pagamenti per velocizzare l’inserimento o migliorare il ranking di un sito per determinate parole chiave». E la partecipazione a un programma pubblicitario «non incide né positivamente né negativamente». Sta nelle FAQ di Google sul posizionamento nella Ricerca.

Controllare l’indicizzazione di migliaia di URL

Con la URL Inspection API, che restituisce via API lo stesso verdetto del pannello, e con un tetto preciso: 2000 query al giorno e 600 al minuto per proprietà. Il numero sta nelle quote delle API di Search Console, sotto «quota di ispezione dell’indice». Nel calcolo vale la quota per sito, non quella per progetto, che è molto più alta e non ti salva.

Duemila al giorno vuol dire che un catalogo da 40.000 URL si controlla per intero in venti giorni. Chi lavora su e-commerce campiona: gli URL che portano fatturato, quelli nuovi, quelli cambiati. E a fine giro il catalogo si è già mosso.

Un avvertimento che fa risparmiare mezza giornata: il Bulk Data Export verso BigQuery non è la scorciatoia. Quello che documenta la pagina di Search Console sull’esportazione collettiva dei dati è il rendimento in ricerca: impressioni, clic, query, pagine. Lo stato di indicizzazione non è fra i dati descritti, e chi ci arriva per scaricarsi il rapporto Indicizzazione delle pagine in SQL resta a mani vuote.

Resta il crawl budget, che va nominato con le sue condizioni, perché come spiegazione generica se ne abusa. Google apre la guida dicendo che se le tue pagine vengono scansionate lo stesso giorno in cui le pubblichi, quella guida non ti riguarda. Poi la destina a tre tipi di sito: oltre un milione di pagine univoche con contenuti che cambiano circa una volta a settimana; oltre 10.000 pagine univoche con contenuti che cambiano ogni giorno; siti con «una porzione consistente di URL totali» classificati come «Rilevata, ma attualmente non indicizzata». Le cifre, avverte Google, sono «una stima approssimativa» e non soglie precise.

Il terzo caso è l’unico senza soglia dimensionale, ed è quello che passa più spesso inosservato. Un e-commerce da 8.000 URL con mezzo catalogo in «Rilevata» ci sta dentro, milione di pagine o no. Come si interviene sta nei pezzi dedicati, il pillar sulla SEO per e-commerce e il pezzo sui filtri e le faccette, dove il problema ha un nome e un cognome: gli URL generati dai filtri.

Essere indicizzati basta per comparire negli AI Overview?

, come requisito tecnico, e il requisito è uno solo. Google lo scrive nella pagina sulle funzionalità di AI nella Ricerca: per essere idonea a comparire come link di supporto in AI Overview o in AI Mode «una pagina deve essere indicizzata e idonea a comparire nella Ricerca Google con uno snippet e soddisfare i requisiti tecnici della Ricerca. Non sono previsti requisiti tecnici aggiuntivi».

Nessun markup speciale, nessun formato dedicato. Le best practice restano quelle di sempre, e poco sotto, sulla stessa pagina, la frase che ormai riconosci: «l’indicizzazione e la pubblicazione non sono garantite».

Ne discende una conseguenza che Google non scrive e che io leggo così: una pagina in noindex, o una con un nosnippet che ti sei dimenticato addosso, il requisito «indicizzata e idonea a comparire con uno snippet» non lo soddisfa. L’indicizzazione è il biglietto d’ingresso per entrambe le sale.

Sull’altra paura ricorrente, quella dei crawler AI: bloccare Google-Extended non ti fa uscire dall’indice. È un token di prodotto che governa l’uso dei contenuti per l’addestramento dei modelli Gemini e per il grounding, e la documentazione dei crawler di Google è esplicita, «non influisce sull’inclusione di un sito nella Ricerca Google né viene utilizzato come indicatore di ranking». Sono due decisioni separate.

Cosa cambia davvero nelle risposte generative, e come si misura la propria presenza lì dentro, sta in altri due pezzi: SEO per l’AI e misurare la visibilità negli AI Overview.

Domande frequenti

Quanto tempo ci mette Google a indicizzare una pagina nuova?+

Da un giorno o due fino a qualche settimana per una pagina o un sito nuovi, ed è Google a dare il range. Per una richiesta manuale da Controllo URL Google dichiara in genere circa un giorno, con casi molto più lunghi. Prima di sospettare un problema, aspetta almeno una settimana.

Come faccio a sapere se una pagina è indicizzata?+

Con lo strumento Controllo URL di Search Console. Lo stato «L’URL si trova su Google» significa indicizzata e idonea a comparire, e non garantisce che comparirà. Il comando site: resta un’indicazione: l’elenco restituito «non è sempre esaustivo».

Perché la mia pagina è «Rilevata, ma attualmente non indicizzata»?+

Perché Google non l’ha ancora scansionata. La causa che dichiara, in genere, è la capacità di risposta del sito: la scansione «sembrava sovraccaricare il sito», quindi è stata riprogrammata. Il controllo è sul server.

Come tolgo un PDF da Google?+

Con l’header HTTP X-Robots-Tag: noindex, che è l’unica forma di noindex applicabile a un file non HTML. E il PDF non deve essere bloccato dal robots.txt, altrimenti Googlebot quell’header non lo legge mai.

L’API Indexing serve al mio sito?+

No, a meno che tu non pubblichi offerte di lavoro o dirette video. Google la limita alle pagine con JobPosting o BroadcastEvent dentro un VideoObject. Per il resto rimanda alla sitemap.

Si paga per farsi indicizzare da Google?+

No. «L’inserimento e il ranking nei risultati della Ricerca Google non comportano alcun costo», e Google non accetta pagamenti per velocizzare l’inserimento. Nessun canale a pagamento cambia quella riga.

Perché una pagina bloccata dal robots.txt compare lo stesso?+

Perché il blocco riguarda la scansione, non l’indice. Google non entra, ma l’URL lo conosce dai link altrui e può pubblicarlo, di norma senza descrizione. In Search Console è l’avviso «Indicizzata ma bloccata da robots.txt».

Quante richieste di indicizzazione posso inviare al giorno?+

Google non pubblica il numero. Dice che un limite giornaliero c’è e che per molte pagine conviene passare da una sitemap. Le cifre che circolano nelle guide non hanno una fonte ufficiale.

Donato Pirolo

Donato Pirolo

Consulente SEO & AI

Aiuto aziende e professionisti a crescere nei risultati organici e generativi, unendo SEO tecnica, strategia dei contenuti e ottimizzazione per i motori AI (GEO).

Lascia un commento