SEO

Crawl İndexing Farkı: Tarama ve İndeksleme Aynı Şey Değil

Crawl indexing farkı şu ayrımdır: tarama keşif adımı, indeksleme ise saklama kararı. Googlebot sayfayı taradığında yalnızca keşfetmiş olur. Search Console'da Discovered - currently not indexed tarama tarafını, Crawled - currently not indexed içerik tarafını gösterir.

Sercan Gökpınar

Crawl indexing farkı akademik bir incelik gibi görünür, sonra bir gün Search Console'da iki yüz sayfanın indekslenmediğini görürsünüz ve nereye bakacağınıza karar vermeniz gerekir. Ayrımı bilmeyen ekipler burada aylar kaybediyor: tarama tarafında bir problemi içerik ekibine, içerik tarafındaki bir problemi altyapı ekibine gönderiyorlar.

Aşağıdaki bölümler zinciri üç halkaya ayırıyor, her halkanın Search Console'da hangi ekranda göründüğünü gösteriyor ve hangi direktifin hangi halkaya dokunduğunu tabloya döküyor.

Tarama, indeksleme ve sıralama aynı şey değil

Tarama: keşif adımı

Tarama, Googlebot'un bağlantıları takip edip bir adresi istemesi ve orada ne olduğunu görmesidir. Tek başına hiçbir söz vermez. Googlebot sayfanızı çektiğinde elde ettiği şey, sayfanın var olduğu bilgisidir.

Tarama bütçesi de yalnızca burada iş görür. Crawl budget nedir yazısında anlattığımız kapasite ve talep kaldıraçları, Google'ın hangi adresleri hangi sıklıkta isteyeceğini belirler. Belirlemedikleri şey, o adreslerin sonra ne olacağıdır.

İndeksleme: saklama kararı

Google sayfayı taradıktan sonra ayrı bir karar verir: bu sayfa indekste saklanmayı hak ediyor mu?

Karar içeriğe bakar. Kopya olup olmadığına, kanonik sürümün hangisi olduğuna, sayfanın kullanıcıya bir değer sunup sunmadığına. Taranmış olmak bu kararın girdisidir, sonucu değildir. Bir sayfa mükemmel taranıp indekslenmeyebilir.

Sıralama: sorgu başına değerlendirme

Üçüncü halka çoğu yazıda hiç konuşulmuyor. İndeksteki bir sayfa, belirli bir sorgu için sıralanmayı hak edip etmediği konusunda ayrıca değerlendirilir. İndekste olmak görünür olmayı getirmez.

Halkanın ayrı olduğunu gösteren pratik bir kontrol var. Sayfanın tam adresini tırnak içine alıp Google'da aratın. Sonuç dönüyorsa sayfa indekstedir. İndekste olduğu halde hedeflediğiniz sorguda hiçbir sıra almıyorsa, elinizdeki problem tarama veya indeksleme problemi değildir. Alaka ve rekabet problemidir ve çözümü teknik tarafta aranmaz.

Zincirin yönü tek taraflı ve koşulludur. Taranmayan sayfa indekslenemez, indekslenmeyen sayfa sıralanamaz. Ters yön işlemez: taranmak indekslenmeyi, indekslenmek sıralanmayı getirmez.

Tarama ve indeksleme farkı bu üç halkanın ilk ikisi arasındaki sınırdır. Sınırı görmeden yapılan her müdahale, doğru olsa bile yanlış halkaya uygulanma riski taşır.

Crawl budget zincirin neresinde durur

Google'ın tanımı taramada bitiyor

Google'ın tarama altyapısı dokümantasyonu crawl budget'ı "Google'ın tarayabildiği ve taramak istediği URL kümesi" olarak tanımlıyor. Tanımın içinde indeksleme geçmiyor, çünkü bütçenin işi orada bitiyor.

Pratik karşılığı şu: tarama bütçenizi büyütmek indekslenme oranınızı yükseltmez. Bütçe, Google'ın sayfayı görmesini sağlar. Sayfanın saklanıp saklanmayacağı bambaşka bir değerlendirmenin konusudur.

Ayrımın ihmal edilmesi bütçe tarafında da yanlış bir hedef üretiyor. Tarama isteği sayısını yükseltmek için sunucu kaynağı eklemek, indekslenmeyen sayfaların içerik tarafında takıldığı bir sitede para harcayıp hiçbir metriği oynatmamak demektir. Aynı bütçe, kopya sayfaların konsolide edilmesine harcansaydı hem tarama dağılımı hem indekslenme oranı birlikte iyileşirdi. Doğru halkayı seçmek, harcamanın karşılığını belirleyen tek karardır.

Tanımı indekslemeye uzatan kaynaklar

Sektörde yaygın bir tanım crawl budget'ı "Googlebot'un belirli bir sürede taradığı ve indekslediği sayfa sayısı" olarak tarif ediyor. Tanım bu haliyle iki ayrı kararı tek cümlede birleştiriyor ve tam da bu yazının kurduğu ayrımı siliyor.

Hatanın maliyeti teşhiste ortaya çıkıyor. İki karar tek şey sayılırsa, indekslenmeyen sayfalar görüldüğünde refleks olarak tarama tarafına gidilir: sitemap gönderilir, iç link eklenir, robots.txt kurcalanır. Problem içerik tarafındaysa bu müdahalelerin hiçbiri işe yaramaz.

Somut bir örnekle bakalım. 40.000 ürünlü bir kataloğunuz var ve 12.000 ürün sayfası indekste görünmüyor. Tanımı birleştiren yaklaşım tek bir teşhis üretir: tarama bütçesi yetmiyor. Ayrımı koruyan yaklaşım önce Page Indexing raporunu açar ve 12.000 sayfanın hangi kovada olduğuna bakar. Discovered kovasındaysa gerçekten tarama tarafında bir iş vardır. Crawled kovasındaysa Google o sayfaları zaten görmüştür ve saklamamayı seçmiştir; bütçeye dokunmak hiçbir şeyi değiştirmez. İki senaryonun aksiyon listesi ortak tek madde içermez.

Search Console'daki iki "not indexed" durumu

Ayrımın en somut hali Search Console'un Page Indexing raporunda duruyor. Aynı görünen iki durum, iki ayrı problemi işaret ediyor.

Discovered - currently not indexed

Google adresi biliyor ama henüz taramadı.

Sorun tarama tarafındadır. Adres Google'ın kuyruğunda duruyor; sıra ona gelmedi ya da Google onu öncelikli bulmadı. Yığılma varsa bakılacak yerler bellidir: tarama bütçesi, iç linkleme, site mimarisi ve sunucu yanıt süresi.

Büyük sitelerde bu grubun şişmesi genelde envanter probleminin belirtisidir. Google binlerce düşük değerli adres bildiğinde, öncelikli sayfalara sıra geç gelir.

Crawled - currently not indexed

Google adresi taradı ve saklamamayı seçti.

Bu durumda tarama tarafında yapılacak hiçbir şey yok. Sayfa görüldü. Sitemap göndermek, iç link eklemek veya tarama bütçesini büyütmek sonucu değiştirmez, çünkü sorun Google'ın sayfaya ulaşamaması değildi.

Bakılacak yer içeriktir: kopya veya yakın kopya olup olmadığı, kanonik sinyallerin tutarlılığı, sayfanın kendi başına bir değer taşıyıp taşımadığı. Şablondan üretilmiş ince sayfalar bu grupta birikir.

Hangi durumda nereye bakılır

Search Console durumuNe olduHangi tarafİlk bakılacak yer
Discovered - currently not indexedAdres biliniyor, taranmadıTaramaCrawl Stats, iç linkleme, sunucu yanıt süresi
Crawled - currently not indexedTarandı, saklanmadıİçerikKopya kontrolü, canonical, sayfa değeri
İndekslendi ama sıralanmıyorSaklandı, sorguya seçilmediAlaka ve rekabetArama amacı, içerik derinliği, rekabet

Tablonun üçüncü satırı Search Console'da bir durum adı olarak görünmez. Yine de teşhis sırasında sorulması gereken üçüncü sorudur, çünkü ekiplerin en sık atladığı ihtimal, sayfanın indekste olup sorgu için yeterince iyi bulunmamasıdır.

Direktifler zincirin hangi halkasına etki eder

Üç direktif üç ayrı halkaya müdahale eder. Birini diğerinin yerine kullanmak, bu yazıdaki ayrımı bilmemenin en pahalı sonucudur.

robots.txt: taramayı durdurur, indekslemeyi garanti etmez

robots.txt disallow, Googlebot'un adresi istemesini engeller. Engellemediği şey indekslenmedir. Google, içeriği hiç görmese de dış sinyallerle o adresi indeksleyebilir.

Ek bir maliyet daha var: engellenen sayfada Google canonical etiketini de göremez. Kopyaları robots.txt ile kapatmak, kopya problemini çözmek yerine dondurur.

Sonucu arama sonuçlarında görebilirsiniz. Engellenmiş ama dış linklerle bilinen bir adres, açıklaması olmadan listelenebilir. Google başlığı ve içeriği okuyamadığı için yerine "Bu sayfa için bilgi bulunmuyor" benzeri bir not koyar. Sayfayı hem indeksten çıkarmak hem taramadan çekmek istiyorsanız doğru sıra şudur: önce engeli kaldırın, Google noindex direktifini görsün, sayfa indeksten düştükten sonra engellemeyi geri koyun.

noindex: indekslemeyi durdurur, taramayı durdurmaz

noindex direktifi sayfanın HTML'inde veya HTTP başlığında yaşar. Googlebot onu okuyabilmek için sayfayı çekmek zorundadır. Yani noindexli sayfa tarama isteği tüketmeye devam eder.

Buradan çıkan sonuç şu: noindex bir tarama tasarrufu aracı olarak kullanılamaz. İndeksleme kontrolü aracıdır, tarama kontrolü değil.

404 ve 410: zinciri baştan kapatır

Kalıcı olarak kaldırılan sayfada doğru durum kodunu döndürmek, Google için "bu adresi bir daha tarama" yönünde güçlü bir sinyaldir. Engellemekten farkı önemli: Google'ın dokümantasyonuna göre engellenen adresler tarama kuyruğunda çok daha uzun kalır ve engel kaldırıldığı anda yeniden taranır.

Sildiğiniz sayfayı robots.txt'e yazmak, doğru kodu döndürmekten daha kötü bir karardır.

Tarama artışı ne vaat eder, ne etmez

Bütçe büyütmenin iki yolu ve ikisinin de kaliteye bağlanması

Google tarama bütçesini artırmanın yalnızca iki yolunu sayıyor. Birincisi sunucu kaynağı eklemek, ki bu ancak kapasite gerçekten sınırlayıcıysa anlamlıdır. İkincisi hedeflenen Google ürünü için içerik kalitesini yükseltmek.

İkinci maddenin sessiz sonucu dikkat çekici. Google kendi dokümantasyonunda zinciri tersine kurmuş görünüyor: kalite artınca tarama artıyor. Tarama artınca kalite artmıyor.

Korelasyon ile nedensellik

Tarama grafiğinin yükseldiği bir ayda organik trafiğin de yükselmesi sık görülür. İki eğrinin birlikte hareket etmesi birinin diğerine sebep olduğunu göstermez.

Aynı dönemde genelde başka şeyler de olur: içerik yayınlanır, iç linkler eklenir, teknik düzeltmeler yapılır, sezon değişir. Kontrollü bir test olmadan hangi değişkenin ne kadar katkı verdiği bilinemez. Tarama verisini paylaşırken doğru çerçeve şudur: artış, Google'ın siteye kaynak ayırdığını gösteren bir sinyaldir.

Raporlamada da aynı disiplin geçerli. Tarama grafiğini organik trafik grafiğinin yanına koyup ok çizmek, ölçüm yerine anlatı üretir. İki eğri arasındaki ilişki hipotez olarak sunulur ve neyin test edilmediği açıkça yazılır.

Hedef tarama miktarı değil dağılımı

Optimizasyonun amacı toplam taramayı büyütmek olarak kurulursa yanlış metrik takip edilir. Toplam bütçe hiç değişmese bile Google'ın önce doğru sayfaları taraması, yeni ve güncellenen içeriğin daha hızlı görünmesini sağlar.

Sorulacak soru şu: tarama isteklerinin dağılımı, sitenin öncelik sırasıyla örtüşüyor mu? Parametreli adreslere akan bir tarama artışı, artış olduğu için iyi haber sayılmaz.

Zinciri teşhis ederken yapılan üç hata

Crawl indexing farkı teoride nettir, uygulamada üç noktada kayboluyor. Üçü de aynı kökten geliyor: semptoma bakıp halkayı belirlemeden müdahaleye geçmek.

Tek bir sayıya bakmak

"Kaç sayfam indekste" sorusu tek başına hiçbir şey söylemez. Anlamlı olan, indekste olmayan sayfaların hangi kovada durduğudur.

Search Console'un Page Indexing raporu bu kırılımı zaten veriyor. Toplam sayıya bakıp kırılıma bakmamak, ateşi ölçüp nedenine bakmamaya benziyor. İlk açılacak ekran toplam sayı yerine durum listesi olmalı.

Zaman eksenini atlamak

Yeni yayınlanan bir sayfanın indekste olmaması bir problem işareti sayılmaz. Zincir sırayla işler ve her halka zaman alır.

Doğru soru şudur: bu sayfa yayınlanalı ne kadar oldu ve sitenin normal indekslenme süresi ne? Karşılaştırma noktası olmadan tek bir sayfanın durumu yorumlanamaz. Sitenizde yeni içerik ortalama üç günde indeksleniyorsa, iki günlük bir sayfa için alarma geçmek yanlış teşhise davetiye çıkarır.

Aynı anda birden fazla müdahale yapmak

En pahalı hata bu. Sayfalar indekslenmiyor diye aynı hafta içinde sitemap yeniden gönderilir, iç linkler eklenir, robots.txt düzenlenir, içerik genişletilir ve sunucu yükseltilir.

Bir sonraki ay durum düzelirse hangi müdahalenin işe yaradığı bilinemez. Düzelmezse hangisinin işe yaramadığı da bilinemez. Zincir modelinin pratik faydası tam olarak burada: önce halkayı belirleyip yalnızca o halkaya dokunmak, öğrenmeyi mümkün kılan tek yaklaşımdır.

Sıralama şöyle kurulur. Page Indexing raporunda kovayı belirleyin. Discovered kovasıysa tarama tarafında tek bir değişiklik yapın ve bekleyin. Crawled kovasıysa içerik tarafında tek bir değişiklik yapın ve bekleyin. Bekleme süresi sitenizin normal indekslenme süresinden kısa olmasın.

Sıkça Sorulan Sorular

Taranıyor ama indekslenmiyor ne demek?

Google sayfayı çekti ve indekste saklamamayı seçti. Tarama tarafında yapılacak bir şey yoktur; bakılacak yer içeriktir: kopya olup olmadığı, kanonik sinyallerin tutarlılığı ve sayfanın kendi başına bir değer taşıyıp taşımadığı. Googlebot indeksleme kararını sayfayı gördükten sonra verdiği için, sayfayı ona tekrar göstermek kararı değiştirmez.

Crawled currently not indexed nasıl düzeltilir?

Önce sayfanın gerçekten benzersiz bir değer taşıyıp taşımadığına bakın. Şablondan üretilmiş, birbirinin varyasyonu olan sayfalar bu kovada birikir. Yapılacak iş sırayla şudur: yakın kopyaları tek bir güçlü sayfada birleştirin, kalanların kanonik etiketlerinin tutarlı olduğunu doğrulayın, ince sayfaları ya genişletin ya kaldırın. Sitemap göndermek veya iç link eklemek bu kovada sonucu değiştirmez.

Discovered currently not indexed nasıl çözülür?

Google adresi biliyor ama henüz taramadı. Çözüm tarama tarafındadır: sayfaya güçlü sayfalardan iç link verin, sitemap'te yer aldığından emin olun, sunucu yanıt süresini kontrol edin ve düşük değerli adres envanterini küçültün. Büyük sitelerde bu grubun şişmesi genelde envanter probleminin belirtisidir.

Crawl indexing farkı tarama bütçesini nasıl etkiler?

Tarama bütçesi yalnızca zincirin ilk halkasında iş görür. Bütçeyi büyütmek indekslenme oranını yükseltmez, çünkü indeksleme ayrı bir karardır. Bütçe Google'ın sayfayı görmesini sağlar, saklanmasını değil. Ayrımın bütçe tarafındaki pratik sonucu şu: sunucu kaynağına yapılan harcama, sayfaların içerik tarafında takıldığı bir sitede hiçbir metriği oynatmaz.

Sitemap göndermek indekslenmeyi hızlandırır mı?

Sitemap keşfi hızlandırabilir, indekslenmeyi garanti etmez. Google adresi sitemap üzerinden bulup taradıktan sonra saklama kararını yine içeriğe bakarak verir. Sayfalarınız Crawled kovasında bekliyorsa sitemap'i yeniden göndermek sonucu değiştirmez.

Sayfam indeksleniyor ama sıralanmıyor, neden?

İndekste olmak bir sorgu için seçilmeyi getirmez. Sıralama, sayfanın o sorgu için rakiplerine göre değerlendirilmesidir. Bakılacak yerler arama amacının karşılanıp karşılanmadığı, içeriğin derinliği ve o sorgudaki rekabet düzeyidir. Bu aşamada tarama ve indeksleme müdahalelerinin etkisi yoktur.

Kaynaklar ve Referanslar