Skip to content

Varennes Forterre

Een stad met karakter

Alles wat u moet weten over de organisatie en inhoud van de sitemap van een Parijse website

Een XML-sitemap is niet slechts een lijst van URL's die automatisch door een CMS wordt gegenereerd. Op een Parijse site waarvan de inhoud evolueert…

Développeuse web parisienne analysant un sitemap imprimé dans un espace de coworking haussmannien
Reading: 5 min

Een XML-sitemap is niet slechts een lijst van URL’s die automatisch door een CMS wordt gegenereerd. Op een Parijse website waarvan de inhoud evolueert met de snelheid van lokale evenementen, updates van diensten of buurtactualiteiten, bepaalt de kwaliteit van het bestand rechtstreeks de snelheid waarmee zoekmachines nieuwe pagina’s ontdekken en oude negeren.

Betrouwbaarheid van lastmod: het enige signaal dat telt in een sitemap

We zien te vaak sitemaps waarvan de lastmod-tag de datum van bestandsgeneratie op elke URL weergeeft, zonder link met de redactionele werkelijkheid. Google heeft zijn standpunt verduidelijkt: het gebruikt deze datum alleen wanneer deze constant en verifieerbaar juist is, dat wil zeggen dat het een significante wijziging van de hoofdinhoud, gestructureerde gegevens of links weerspiegelt.

Het wijzigen van het copyrightjaar in de voettekst is geen significante update. Op een Parijse website waarvan de openingstijden, tarieven of evenementpagina’s regelmatig veranderen, moet lastmod afkomstig zijn van de werkelijke redactionele geschiedenis, niet van de datum van bestand reconstructie.

Een CMS zoals WordPress, gekoppeld aan een correct geconfigureerde SEO-plugin, kan elke URL dateren op basis van de laatste effectieve back-up van het artikel. Aan de andere kant, een zelfgemaakt script dat de sitemap elke nacht regenerert door de datum van de dag op alle vermeldingen toe te passen, stuurt een verstoord signaal. De robots eindigen er uiteindelijk mee om de data volledig te negeren, wat het nut van het bestand voor gerichte herindexering tenietdoet.

Bij het analyseren van de sitemap van de site Paris Astuce, zien we een structuur die dit principe weerspiegelt: de URL’s zijn georganiseerd op type inhoud, met consistente data in relatie tot de daadwerkelijke publicaties.

UX-designer die de organisatie van een web-sitemap uitlegt op een whiteboard in een Parijse bureau

Afwijkingen tussen sitemap, CMS en Search Console op een Parijse website

De vergelijking tussen de URL’s van de sitemap, de pagina’s die daadwerkelijk door het CMS zijn gepubliceerd en die in Google Search Console zijn geïndexeerd, vormt een audit die de meeste populaire gidsen negeren. Deze afwijkingen onthullen echter concrete problemen.

Pagina’s aanwezig in de sitemap maar afwezig in de index

Een sitemap is een ontdekking signaal, geen dwingend verzoek om te crawlen. Een URL die in het bestand is vermeld, kan uitgesloten blijven als deze een noindex-richtlijn heeft, als de inhoud als te zwak wordt beschouwd of als er geen interne link naar verwijst. Op een Parijse website met tientallen pagina’s van lokale diensten, raden we aan om regelmatig het “Pagina’s”-rapport van Search Console te vergelijken met de inhoud van de sitemap om deze uitsluitingen op te sporen.

Pagina’s geïndexeerd maar afwezig in de sitemap

Het omgekeerde komt ook vaak voor. Testpagina’s, per ongeluk openbaar gemaakte concepten of URL’s met trackingparameters kunnen via de interne linking worden gecrawld zonder ooit in de sitemap te verschijnen. Een schone sitemap bevat alleen de canonieke URL’s die geïndexeerd moeten worden. Elke URL die u niet in de zoekresultaten wilt zien, heeft niets in dit bestand te zoeken.

Hier zijn de controles die periodiek moeten worden uitgevoerd:

  • De volledige lijst van URL’s uit de sitemap extraheren en vergelijken met de export van de gepubliceerde pagina’s van het CMS (alleen status “gepubliceerd”, geen concepten en privé pagina’s)
  • Controleren in Search Console of elke URL in de sitemap ofwel geïndexeerd is, ofwel opzettelijk is uitgesloten door een expliciete richtlijn (noindex, canoniek naar een andere pagina)
  • De geïndexeerde wees-URL’s identificeren die door Google zijn geïndexeerd maar afwezig zijn in de sitemap, die vaak verouderde pagina’s of niet-opgeruimde technische routes signaleren

Organisatie van sitemaps voor een multi-sectie Parijse website

Een Parijse website die verschillende thema’s dekt (arrondissementen, uitjes, aanbiedingen, actualiteiten) profiteert van het segmenteren van zijn sitemap in plaats van alles in één enkel bestand te groeperen. Het mechanisme van sitemap index maakt het mogelijk om meerdere kindbestanden te refereren, elk gewijd aan een type inhoud.

Deze segmentatie is niet alleen esthetisch. Het stelt ons in staat om in Search Console het indexeringspercentage per categorie te observeren. Als de pagina’s “evenementen” een aanzienlijk lager indexeringspercentage vertonen dan de pagina’s “buurtgidsen”, ligt het probleem waarschijnlijk in de actualiteit of diepte van de evenementinhoud, niet in de technische configuratie.

Computer scherm dat een XML-sitemap van een Parijse site toont op een klassieke koffietafel in Parijs

Bestanden van kinderen benoemen en structureren

We raden een expliciete naamgeving aan: sitemap-posts.xml, sitemap-pages.xml, sitemap-categories.xml. Deze conventie vergemakkelijkt het lezen van de rapporten in Search Console en versnelt de diagnose in geval van een daling van de indexering op een specifiek segment.

Elk kindbestand mag alleen URL’s bevatten die een HTTP 200-code retourneren. 301-omleidingen, 404-fouten en soft 404-pagina’s vervuilen het bestand en verspillen het crawlbudget. Op een site waarvan de inhoud gerelateerd is aan het Parijse nieuws, moeten verouderde pagina’s (verlopen evenementen, gesloten locaties) uit de sitemap worden verwijderd zodra ze niet meer relevant zijn.

Interactie tussen robots.txt en sitemap XML

Het bestand robots.txt kan de locatie van de sitemap aangeven via de Sitemap-richtlijn, wat de eenvoudigste methode blijft voor robots om deze te vinden zonder handmatige indiening. Aan de andere kant creëert een inconsistentie tussen de twee bestanden een stille conflicten.

Als robots.txt een hele directory blokkeert via Disallow en de sitemap URL’s van deze directory bevat, ontvangen de zoekmachines een tegenstrijdig signaal. De sitemap overschrijft nooit een Disallow-regel in robots.txt. De URL zal worden ontdekt maar niet gecrawld, wat fouten in Search Console genereert zonder SEO-voordeel.

Op een Parijse WordPress-site komt dit probleem vaak voor met afbeeldingsdirectories, auteurpagina’s of tagarchieven die sommige SEO-plugins standaard in de sitemap opnemen terwijl ze in robots.txt worden geblokkeerd. Een kruiscontrole van de twee bestanden voorkomt deze tegenstrijdigheden.

De sitemap van een Parijse website is geen bestand dat eenmaal moet worden gegenereerd en vervolgens vergeten. Het is een continu diagnostisch hulpmiddel waarvan de waarde volledig afhankelijk is van de nauwkeurigheid waarmee het de werkelijke staat van de site weerspiegelt, URL voor URL, datum voor datum.

Alles wat u moet weten over de organisatie en inhoud van de sitemap van een Parijse website