Skip to content

Varennes Forterre

Eine Stadt mit Charakter

Alles über die Organisation und den Inhalt der Sitemap einer Pariser Webseite

Eine XML-Sitemap beschränkt sich nicht auf eine automatisch von einem CMS generierte Liste von URLs. Auf einer Pariser Website, deren Inhalt sich entwickelt…

Développeuse web parisienne analysant un sitemap imprimé dans un espace de coworking haussmannien
Reading: 5 min

Eine XML-Sitemap ist nicht nur eine automatisch von einem CMS generierte Liste von URLs. Auf einer Pariser Website, deren Inhalte sich im Rhythmus lokaler Ereignisse, Aktualisierungen von Dienstleistungen oder Stadtteilnachrichten ändern, bestimmt die Qualität der Datei direkt, wie schnell Suchmaschinen neue Seiten entdecken und alte ignorieren.

Zuverlässigkeit von lastmod: das einzige Signal, das in einer Sitemap zählt

Wir beobachten zu oft Sitemaps, bei denen das lastmod-Tag das Erstellungsdatum der Datei für jede URL anzeigt, ohne Bezug zur redaktionellen Realität. Google hat seine Position klargestellt: Es nutzt dieses Datum nur, wenn es konstant und überprüfbar genau ist, das heißt, wenn es eine wesentliche Änderung des Hauptinhalts, der strukturierten Daten oder der Links widerspiegelt.

Die Änderung des Copyright-Jahres im Footer stellt keine wesentliche Aktualisierung dar. Auf einer Pariser Website, deren Öffnungszeiten, Preise oder Veranstaltungsseiten sich regelmäßig ändern, muss lastmod aus dem tatsächlichen redaktionellen Verlauf stammen, nicht aus dem Datum der Datei-Neuerstellung.

Ein CMS wie WordPress, kombiniert mit einem korrekt konfigurierten SEO-Plugin, kann jede URL mit dem Datum der letzten effektiven Sicherung des Artikels versehen. Ein selbstgeschriebenes Skript, das die Sitemap jede Nacht regeneriert und das aktuelle Datum auf alle Einträge anwendet, sendet hingegen ein verwirrendes Signal. Die Bots ignorieren schließlich die Daten vollständig, was den Nutzen der Datei für das gezielte Crawlen zunichte macht.

Bei der Analyse der Sitemap der Website Paris Astuce zeigt sich eine Struktur, die dieses Prinzip widerspiegelt: Die URLs sind nach Inhaltstyp organisiert, mit konsistenten Daten im Verhältnis zu den tatsächlichen Veröffentlichungen.

UX-Designer erklärt die Organisation einer Web-Sitemap auf einem Whiteboard in einer Pariser Agentur

Abweichungen zwischen Sitemap, CMS und Search Console auf einer Pariser Website

Der Vergleich zwischen den URLs der Sitemap, den tatsächlich vom CMS veröffentlichten Seiten und den in der Google Search Console indexierten Seiten stellt ein Audit dar, das die meisten allgemeinen Leitfäden ignorieren. Diese Abweichungen offenbaren jedoch konkrete Probleme.

Seiten in der Sitemap, aber nicht im Index

Eine Sitemap ist ein Entdeckungsignal, kein zwingendes Crawlanliegen. Eine im Dokument aufgeführte URL kann ausgeschlossen bleiben, wenn sie eine noindex-Direktive trägt, wenn ihr Inhalt als zu schwach erachtet wird oder wenn kein interner Link auf sie verweist. Auf einer Pariser Website mit Dutzenden von Seiten zu lokalen Dienstleistungen empfehlen wir, regelmäßig den Bericht „Seiten“ in der Search Console mit dem Inhalt der Sitemap abzugleichen, um diese Ausschlüsse zu erkennen.

Indexierte Seiten, aber nicht in der Sitemap

Der umgekehrte Fall ist ebenso häufig. Testseiten, versehentlich veröffentlichte Entwürfe oder URLs mit Tracking-Parametern können über das interne Linking gecrawlt werden, ohne jemals in der Sitemap zu erscheinen. Eine saubere Sitemap enthält nur die kanonischen URLs, die indexiert werden sollen. Jede URL, die Sie nicht in den Suchergebnissen sehen möchten, hat in dieser Datei nichts zu suchen.

Hier sind die Kontrollen, die regelmäßig durchgeführt werden sollten:

  • Die vollständige Liste der URLs aus der Sitemap extrahieren und mit dem Export der veröffentlichten Seiten des CMS vergleichen (nur Status „veröffentlicht“, keine Entwürfe und privaten Seiten)
  • In der Search Console überprüfen, dass jede URL der Sitemap entweder indexiert ist oder absichtlich durch eine explizite Direktive ausgeschlossen wird (noindex, kanonisch auf eine andere Seite)
  • Die von Google indexierten, aber in der Sitemap fehlenden, verwaisten URLs identifizieren, die oft auf veraltete Seiten oder nicht bereinigte technische Routen hinweisen

Organisation von Sitemaps für eine Pariser Website mit mehreren Sektionen

Eine Pariser Website, die mehrere Themen abdeckt (Bezirke, Ausflüge, gute Tipps, Nachrichten), profitiert davon, ihre Sitemap zu segmentieren, anstatt alles in einer einzigen Datei zu bündeln. Der Mechanismus des Sitemap-Index ermöglicht es, mehrere untergeordnete Dateien zu referenzieren, die jeweils einem Inhaltstyp gewidmet sind.

Diese Segmentierung ist nicht nur ästhetisch. Sie ermöglicht es, in der Search Console die Indexierungsrate nach Kategorie zu beobachten. Wenn die Seiten „Veranstaltungen“ eine deutlich niedrigere Indexierungsrate aufweisen als die Seiten „Stadtteilführer“, liegt das Problem wahrscheinlich in der Aktualität oder Tiefe des Veranstaltungsinhalts, nicht in der technischen Konfiguration.

Computerbildschirm, der eine XML-Sitemap einer Pariser Website auf einem klassischen Kaffeetisch in Paris anzeigt

Benennung und Strukturierung der untergeordneten Dateien

Wir empfehlen eine explizite Benennung: sitemap-posts.xml, sitemap-pages.xml, sitemap-categories.xml. Diese Konvention erleichtert das Lesen der Berichte in der Search Console und beschleunigt die Diagnose im Falle eines Rückgangs der Indexierung in einem bestimmten Segment.

Jede untergeordnete Datei sollte nur URLs enthalten, die einen HTTP-Statuscode 200 zurückgeben. 301-Weiterleitungen, 404-Fehler und Soft 404-Seiten verschmutzen die Datei und verschwenden das Crawl-Budget. Auf einer Website, deren Inhalte mit den aktuellen Pariser Nachrichten verbunden sind, sollten abgelaufene Seiten (vergangene Veranstaltungen, geschlossene Orte) aus der Sitemap entfernt werden, sobald sie nicht mehr relevant sind.

Interaktion zwischen robots.txt und XML-Sitemap

Die Datei robots.txt kann den Standort der Sitemap über die Direktive Sitemap deklarieren, was die einfachste Methode bleibt, damit die Bots sie ohne manuelle Einreichung finden. Eine Inkonsistenz zwischen den beiden Dateien schafft jedoch einen stillen Konflikt.

Wenn robots.txt ein ganzes Verzeichnis über Disallow blockiert und die Sitemap URLs aus diesem Verzeichnis enthält, erhalten die Suchmaschinen ein widersprüchliches Signal. Die Sitemap übertrumpft niemals eine Disallow-Regel in robots.txt. Die URL wird entdeckt, aber nicht gecrawlt, was Fehler in der Search Console erzeugt, ohne SEO-Vorteil.

Auf einer Pariser WordPress-Website tritt dieses Problem häufig mit Bildverzeichnissen, Autorenseiten oder Tag-Archiven auf, die einige SEO-Plugins standardmäßig in die Sitemap aufnehmen, während sie in robots.txt blockiert werden. Ein übergreifendes Audit der beiden Dateien vermeidet diese Widersprüche.

Die Sitemap einer Pariser Website ist keine Datei, die einmal generiert und dann vergessen wird. Sie ist ein kontinuierliches Diagnosewerkzeug, dessen Wert vollständig von der Sorgfalt abhängt, mit der sie den tatsächlichen Zustand der Website, URL für URL, Datum für Datum widerspiegelt.

Alles über die Organisation und den Inhalt der Sitemap einer Pariser Webseite