Skip to content

Varennes Forterre

Uma cidade de caráter

Tudo sobre a organização e o conteúdo do sitemap de um site web parisiense

Um sitemap XML não se resume a uma lista de URLs gerada automaticamente por um CMS. Em um site parisiense cujo conteúdo evolui…

Développeuse web parisienne analysant un sitemap imprimé dans un espace de coworking haussmannien
Reading: 5 min

Um sitemap XML não se resume a uma lista de URLs gerada automaticamente por um CMS. Em um site parisiense cujo conteúdo evolui ao ritmo de eventos locais, atualizações de serviços ou notícias de bairro, a qualidade do arquivo condiciona diretamente a velocidade com que os motores de busca descobrem novas páginas e ignoram as antigas.

Confiabilidade do lastmod: o único sinal que conta em um sitemap

Observamos com muita frequência sitemaps cuja tag lastmod exibe a data de geração do arquivo em cada URL, sem relação com a realidade editorial. O Google esclareceu sua posição: ele utiliza essa data apenas quando é constantemente e verificavelmente exata, ou seja, refletindo uma modificação significativa do conteúdo principal, dos dados estruturados ou dos links.

Modificar o ano de copyright no rodapé não constitui uma atualização significativa. Em um site parisiense cujos horários, tarifas ou páginas de eventos mudam regularmente, lastmod deve vir do histórico editorial real, e não da data de reconstrução do arquivo.

Um CMS como o WordPress, combinado com um plugin SEO corretamente configurado, pode datar cada URL a partir do último backup efetivo do artigo. Por outro lado, um script caseiro que regenera o sitemap toda noite aplicando a data do dia a todas as entradas envia um sinal confuso. Os robôs acabam ignorando completamente as datas, o que anula o interesse do arquivo para o recrawl direcionado.

Ao analisar o sitemap do site Paris Astuce, constatamos uma estrutura que reflete esse princípio: as URLs estão organizadas por tipo de conteúdo, com datas coerentes em relação às publicações efetivas.

Designer UX explicando a organização de um sitemap web em um quadro branco em uma agência parisiense

Divergências entre sitemap, CMS e Search Console em um site web parisiense

A comparação entre as URLs do sitemap, as páginas realmente publicadas pelo CMS e aquelas indexadas no Google Search Console constitui uma auditoria que a maioria dos guias para o público geral ignora. Essas divergências revelam, no entanto, problemas concretos.

Páginas presentes no sitemap, mas ausentes do índice

Um sitemap é um sinal de descoberta, não um pedido imperativo de crawl. Uma URL listada no arquivo pode permanecer excluída se contiver uma diretiva noindex, se seu conteúdo for considerado muito fraco ou se nenhum link interno apontar para ela. Em um site parisiense com dezenas de páginas de serviços locais, recomendamos cruzar regularmente o relatório “Páginas” do Search Console com o conteúdo do sitemap para identificar essas exclusões.

Páginas indexadas, mas ausentes do sitemap

O caso inverso é igualmente frequente. Páginas de teste, rascunhos tornados públicos por engano ou URLs com parâmetros de rastreamento podem ser rastreadas através da malha interna sem nunca figurar no sitemap. Um sitemap limpo contém apenas as URLs canônicas a serem indexadas. Qualquer URL que você não deseja ver aparecer nos resultados de pesquisa não deve estar neste arquivo.

Aqui estão os controles a serem realizados periodicamente:

  • Extrair a lista completa das URLs do sitemap e compará-la com a exportação das páginas publicadas do CMS (status “publicado” apenas, excluindo rascunhos e páginas privadas)
  • Verificar no Search Console se cada URL do sitemap está indexada ou se foi intencionalmente excluída por uma diretiva explícita (noindex, canonical para outra página)
  • Identificar as URLs órfãs indexadas pelo Google, mas ausentes do sitemap, que frequentemente sinalizam páginas obsoletas ou rotas técnicas não limpas

Organização dos sitemaps para um site parisiense multi-seções

Um site web parisiense cobrindo várias temáticas (arrondissements, saídas, boas dicas, notícias) ganha ao segmentar seu sitemap em vez de agrupar tudo em um único arquivo. O mecanismo de sitemap index permite referenciar vários arquivos filhos, cada um dedicado a um tipo de conteúdo.

Essa segmentação não é apenas estética. Ela permite observar no Search Console a taxa de indexação por categoria. Se as páginas “eventos” exibem uma taxa de indexação significativamente inferior às páginas “guias de bairro”, o problema provavelmente reside na atualidade ou profundidade do conteúdo de eventos, e não na configuração técnica.

Tela de computador exibindo um sitemap XML de site parisiense em uma mesa de café clássica em Paris

Nomear e estruturar os arquivos filhos

Recomendamos uma nomenclatura explícita: sitemap-posts.xml, sitemap-pages.xml, sitemap-categories.xml. Essa convenção facilita a leitura dos relatórios do Search Console e acelera o diagnóstico em caso de queda de indexação em um segmento específico.

Cada arquivo filho deve conter apenas URLs que retornem um código HTTP 200. As redireções 301, os erros 404 e as páginas em soft 404 poluem o arquivo e desperdiçam o orçamento de crawl. Em um site cujo conteúdo está relacionado à atualidade parisiense, as páginas expiradas (eventos passados, locais fechados) devem ser removidas do sitemap assim que não forem mais relevantes.

Interação entre robots.txt e sitemap XML

O arquivo robots.txt pode declarar a localização do sitemap através da diretiva Sitemap, o que continua sendo o método mais simples para que os robôs o encontrem sem submissão manual. No entanto, uma incoerência entre os dois arquivos cria um conflito silencioso.

Se o robots.txt bloqueia um diretório inteiro via Disallow e o sitemap contém URLs desse diretório, os motores recebem um sinal contraditório. O sitemap nunca supera uma regra Disallow no robots.txt. A URL será descoberta, mas não rastreada, o que gera erros no Search Console sem benefício SEO.

Em um site WordPress parisiense, esse problema ocorre frequentemente com diretórios de imagens, páginas de autor ou arquivos de tags que alguns plugins SEO incluem por padrão no sitemap enquanto os bloqueiam no robots.txt. Uma auditoria cruzada dos dois arquivos evita essas contradições.

O sitemap de um site web parisiense não é um arquivo a ser gerado uma vez e depois esquecido. É uma ferramenta de diagnóstico contínuo cuja valor depende inteiramente da rigorosidade com que reflete o estado real do site, URL por URL, data por data.

Tudo sobre a organização e o conteúdo do sitemap de um site web parisiense