Blog

Robots.txt Dosyası Yapılandırma: Arama Motoru Rehberi

Arama motorlarının bir web sitesini ziyaret etme biçimi, organik performansın temel taşıdır. Web sitenizin taranması, indekslenmesi ve arama sonuçlarında doğru şekilde listelenmesi, arama motoru botlarına verdiğiniz ilk talimatlarla başlar. Bu ilk iletişimi sağlayan en kritik protokol ise robots.txt dosyasıdır. Doğru kurgulanmış bir dosya, arama motoru botlarının sunucunuzu verimli kullanmasını ve sitenizin en değerli sayfalarına odaklanmasını sağlar. Hatalı yapılandırma ise binlerce sayfalık değerli içeriğin arama sonuçlarından silinmesine ya da sunucu kaynaklarının gereksiz yere tükenmesine yol açabilir.

İşletmeler dijital varlıklarını büyütürken genellikle görsel tasarıma ve içerik üretimine odaklanır; ancak altyapının arama motorları tarafından nasıl algılandığını göz ardı edebilir. Özellikle kapsamlı e-ticaret siteleri, portfolyolarını sunan mimarlar, teknik föylerini listeleyen endüstriyel üreticiler veya rezervasyon motoru çalıştıran oteller için tarama optimizasyonu hayati bir adımdır. Profesyonel bir seo ajansı ile çalışırken ele alınan ilk teknik unsurlardan birinin robots.txt olmasının temel sebebi de budur.

Robots.txt Nedir ve Arama Motorları İçin Neden Önemlidir?

Robots.txt, Robots Exclusion Protocol (Robot Dışlama Standardı) prensiplerine dayanan, web sitenizin kök dizininde yer alan sade bir metin dosyasıdır. Arama motoru örümcekleri (örneğin Googlebot, Bingbot), web sitenizdeki sayfaları taramadan önce doğrudan bu dosyayı okur. Dosyanın temel görevi, arama motorlarına hangi dizinlerin veya URL parametrelerinin taranabileceğini (Allow), hangilerinin ise taranmaması gerektiğini (Disallow) bildirmektir.

Bu dosya doğrudan sayfaların indekslenmesini engellemez; yalnızca taranmasını kısıtlar. Bu fark, teknik SEO'nun en çok karıştırılan noktalarından biridir. Bir sayfa robots.txt ile taranmaya kapatılmış olsa bile, harici bir kaynaktan bağlantı alıyorsa arama motoru dizinine içeriği olmadan girebilir. Bu nedenle dosyanın işlevini, bir kilit sistemi olarak değil, arama motoru botlarına sunulan bir rehber harita olarak değerlendirmek gerekir.

Web sitenizin teknik sağlığını korumak adına yapılan kapsamlı bir teknik seo denetimi sırasında robots.txt dosyasının satır satır incelenmesi gerekir. Zira sunucu kaynaklarının verimli kullanılması, botların gereksiz URL varyasyonlarında kaybolmasını engeller.

Temel Direktifler ve Doğru Sözdizimi (Syntax) Kuralları

Teknik SEO tarama bütçesi ve robots.txt kuralları analizi

Robots.txt dosyasının yapısı oldukça basittir ancak harf duyarlılığı ve sözdizimi hatalarına karşı toleransı yoktur. Dosya kurgulanırken belirli anahtar komutlar kullanılır. Bu komutların doğru hiyerarşiyle yazılması, botların yönlendirmeleri eksiksiz uygulayabilmesi için şarttır.

  • User-agent: Kuralın hangi arama motoru botu için geçerli olduğunu tanımlar. Tüm botları kapsamak için yıldız (*) sembolü kullanılır. Özel bir bot hedefleniyorsa adı açıkça belirtilmelidir.
  • Disallow: Belirtilen dizinin veya dosya yolunun taranmasını engeller. Değer boş bırakılırsa hiçbir engelleme yapılmadığı anlamına gelir.
  • Allow: Disallow ile kapatılmış bir üst dizinin içindeki belirli bir alt sayfanın veya kaynağın taranmasına izin vermek için kullanılır.
  • Sitemap: Web sitenize ait site haritasının tam URL adresini botlara bildirir. Bu direktifin dosyanın en altında yer alması sektör standardıdır.

Örnek bir yapılandırmada, yönetim paneli veya filtreleme parametreleri taranmaya kapatılırken, CSS ve JavaScript gibi stil dosyalarının erişime açık bırakılması beklenir. Örneğin, /admin/ dizinini engelleyip içerisindeki bir genel stil dosyasını açık bırakmak istediğinizde Allow komutu devreye girer. Yanlış bir eğik çizgi (slash) kullanımı tüm sitenin taranmasını durdurabilir.

Tarama Bütçesi (Crawl Budget) Yönetiminde Robots.txt Rolü

Arama motorlarının her web sitesine ayırdığı kaynak ve zaman sınırlıdır. Bu sınırlı tarama kapasitesine "tarama bütçesi" adı verilir. Özellikle yüzlerce veya binlerce sayfaya sahip kurumsal sitelerde, arama motoru botunun sitede geçirdiği her milisaniye stratejik öneme sahiptir. Botun gereksiz sayfalarda vakit kaybetmesi, yeni eklenen veya güncellenen kritik içeriklerin geç indekslenmesine sebep olur.

Arama sonuçları sayfaları, sepet sayfaları, oturum açma ekranları veya birden fazla filtre içeren parametreli URL'ler arama motorları açısından hiçbir katma değer üretmez. Bu tür sayfalar robots.txt yardımıyla engellendiğinde, bot doğrudan işletmenizin hizmetlerine, ürün detaylarına veya blog makalelerine yönelir. Bu durum, organik görünürlüğün düzenli artışına zemin hazırlar.

Kapsamlı bir dijital varlık oluşturulurken altyapının planlanması kritik bir süreçtir. Özel yazılımlar veya dinamik paneller tercih edildiğinde, kod yapısının botlar için temiz tutulması gerekir. Bu süreçte uzman bir web tasarım ajansı desteği almak, taranabilirlik sorunlarını daha tasarım ve kodlama aşamasındayken çözmenizi sağlar.

Yaygın Yapılan Robots.txt Hataları ve Çözümleri

Robots.txt dosyasında yapılan küçük bir yazım hatası, sitenin organik performansında büyük düşüşlere sebep olabilir. Sektör deneyimlerinde en sık karşılaşılan hataların başında, test aşamasında eklenen engelleme kodlarının canlı yayında unutulması gelir.

  • Tüm Siteyi Taramaya Kapatmak: Disallow: / komutu sitenin tamamını tüm botlara kapatır. Yeni bir web sitesi yayına alınırken bu kural kaldırılmazsa site arama motorlarında görünmez hale gelir. Yayından önce hazırlanan web sitesi yayına alma kontrol listesi bu nedenle hayati önem taşır.
  • CSS ve JS Dosyalarını Engellemek: Arama motorları sayfaları artık kullanıcıların gördüğü şekilde render etmektedir. Tasarım ve script dosyalarının engellenmesi, botun sayfa deneyimini ve mobil uyumluluğu hatalı puanlamasına yol açar.
  • Noindex Direktifini Robots.txt İçinde Kullanmak: Geçmişte bazı botlar bu komutu kabul etse de modern arama motorları robots.txt içerisindeki 'noindex' ifadesini desteklemez. İndekslenmesini istemediğiniz sayfalar için HTML meta noindex etiketi veya HTTP yanıt başlığı kullanılmalıdır.
  • Büyük/Küçük Harf Hataları: Linux tabanlı sunucularda URL'ler büyük/küçük harfe duyarlıdır. Disallow: /Giris/ kuralı, /giris/ sayfasını engellemez.

Bu hataların düzenli olarak izlenmesi gerekir. Özellikle Google Search Console üzerinden "Sayfa Dizine Ekleme" raporlarını takip etmek, robots.txt kaynaklı engellenen kritik sayfaları tespit etmenin en güvenilir yoludur.

Adım Adım Robots.txt Dosyası Oluşturma ve Test Etme

Bir robots.txt dosyası hazırlamak için karmaşık yazılımlara ihtiyaç yoktur. Temel bir metin düzenleyici (Notepad, VS Code vb.) kullanarak dosyanızı oluşturabilirsiniz. Hazırlanan dosya mutlaka UTF-8 formatında kaydedilmeli ve web sitenizin ana dizinine (root directory) yüklenmelidir. Erişilebilir adresiniz https://alanadiniz.com/robots.txt şeklinde olmalıdır.

Dosyayı oluştururken ilk olarak User-agent satırını belirleyin. Ardından gizli kalması gereken sistem klasörlerini Disallow satırları ile tanımlayın. Kritik kaynak dosyalarının taranabilmesi için gerekirse Allow kuralları ekleyin. Son satıra ise güncel site haritanızın bağlantısını Sitemap: https://alanadiniz.com/sitemap.xml formatında ekleyin.

Dosyayı sunucuya yükledikten sonra mutlaka test araçlarıyla doğrulayın. Google Arama Konsolu içerisindeki robots.txt test aracı veya modern denetim yazılımları, yazdığınız kuralların istediğiniz URL'leri engelleyip engellemediğini anlık olarak simüle eder. Test edilmeden yayına alınan kurallar, sitenizin en önemli dönüşüm sayfalarını farkında olmadan arama motorlarından gizleyebilir.

Robots.txt Yapılandırması Hakkında Sıkça Sorulan Sorular

Robots.txt dosyası olmazsa ne olur?

Web sitenizde robots.txt dosyası bulunmadığında, arama motoru botları sunucuya ulaştığında 404 (Bulunamadı) yanıtı alır ve sitede herhangi bir kısıtlama olmadığını varsayarak tüm açık bağlantıları tarar. Ancak bu durum, yönetici paneli veya gereksiz sayfaların taranarak sunucu kaynaklarının boşa harcanmasına yol açabilir.

Sayfamın Google'da görünmesini istemiyorum, robots.txt ile engelleyebilir miyim?

Hayır. Robots.txt yalnızca taramayı engeller. Bir sayfanın arama sonuçlarında kesinlikle yer almamasını istiyorsanız, sayfaya <meta name="robots" content="noindex"> etiketi eklemeli ve bu sayfanın taranmasına robots.txt üzerinden izin vermelisiniz ki bot noindex etiketini okuyabilsin.

Robots.txt dosyasında birden fazla site haritası belirtilebilir mi?

Evet. Web siteniz büyükse ve birden fazla sitemap dosyası kullanıyorsanız (örneğin ürünler, blog yazıları, görseller için ayrı ayrı), her bir site haritasını alt alta yeni bir Sitemap: satırı açarak belirtebilirsiniz.

Web sitenizin arama motorları nezdinde kusursuz bir teknik yapıya kavuşması, doğru tarama stratejileri ve düzenli optimizasyon süreçleriyle mümkündür. Dijital varlıklarınızın görünürlüğünü artırmak ve profesyonel teknik altyapı yönetimi sağlamak için ekibimizle bize ulaşın.

Projenize özel çözüm

Okuduğunuz konuda desteğe mi ihtiyacınız var? Birlikte konuşalım.