Archivo robots.txt perfecto para Blogs

Domingo, 11 de Noviembre de 2007 |

Blogosfera, Tutoriales, Wordpress

Como nos tienen acostumbrados, en SigT.net nos ayudan a mejorar nuestro espacio de comunicación. En esta ocasión han elaborado un fichero robots.txt con el que mejorar la visibilidad del blog y, de paso, evitar contenido duplicado en los buscadores (¡pecado mortal para Google!). Por descontado que lo he aplicado tal cual pues las reglas que proponen son del todo acertadas.

googlebot.jpg

Lo tienes aquí mismo y, por supuesto, no dejes de visita el blog de Armonth, un imprescindible.

#
# robots.txt para tu blog en WordPress.
#
# Usar bajo propia responsabilidad, que nos conocemos }:)
# http://sigt.net/archivo/robotstxt-para-wordpress.xhtml
#

# Primero el contenido adjunto.

User-Agent: *
Allow: /wp-content/uploads/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-includes/
Disallow: /wp-admin/

# También podemos desindexar todo lo que empiece
# por wp-. Es lo mismo que los Disallow de arriba pero
# incluye cosas como wp-rss.php

Disallow: /wp-

#
# Sitemap permitido, búsquedas no.
#

Sitemap: http://tu-web/sitemap.xml
Disallow: /?s=
Disallow: /search

#
# Permitimos el feed general para Google Blogsearch.
#
# Impedimos que permalink/feed/ sea indexado ya que el
# feed con los comentarios suele posicionarse en lugar de
# la entrada y desorienta a los usuarios.
#
# Lo mismo con URLs terminadas en /trackback/ que sólo
# sirven como Trackback URI (y son contenido duplicado).
#

Allow: /feed/$
Disallow: /feed
Disallow: /comments/feed
Disallow: /*/feed/$
Disallow: /*/feed/rss/$
Disallow: /*/trackback/$
Disallow: /*/*/feed/$
Disallow: /*/*/feed/rss/$
Disallow: /*/*/trackback/$
Disallow: /*/*/*/feed/$
Disallow: /*/*/*/feed/rss/$
Disallow: /*/*/*/trackback/$

#
# A partir de aquí es opcional pero recomendado.
#

# Lista de bots que suelen respetar el robots.txt pero rara
# vez hacen un buen uso del sitio y abusan bastante…
# Añadir al gusto del consumidor…

User-agent: MSIECrawler
Disallow: /

User-agent: WebCopier
Disallow: /

User-agent: HTTrack
Disallow: /

User-agent: Microsoft.URL.Control
Disallow: /

User-agent: libwww
Disallow: /

#
# Slurp (Yahoo!), Noxtrum y el bot de MSN a veces tienen
# idas de pinza, toca decirles que reduzcan la marcha.
# El valor es en segundos y podéis dejarlo bajo e ir
# subiendo hasta el punto óptimo.
#

User-agent: noxtrumbot
Crawl-delay: 50

User-agent: msnbot
Crawl-delay: 30

User-agent: Slurp
Crawl-delay: 10

(Inspiración: SigT.net)

Comparte este artículo:
  • TwitThis
  • Meneame
  • Facebook
  • Bitacoras.com
  • Wikio
  • del.icio.us
  • StumbleUpon
  • Google Bookmarks
  • Live
  • MySpace
  • Technorati
  • Turn this article into a PDF!
  • E-mail this story to a friend!
  • Print this article!

Puede que también te interese ...


¡Hay que soñar!
        “Yo camino diez pasos y la utopía se aleja diez...

La pifia de la semana: algunos medios de comunicación
        Pues sí, nos vemos en la obligación de darle tirón...

Todos los Como, nuevo blog de Entre Blogs
La familia sigue creciendo, y en esta ocasión se une a Entre Blogs un espacio singular, un sitio donde...

Todos los Como – Lo que no te puedes perder
La familia sigue creciendo, y en esta ocasión se une a Entre Blogs un espacio singular, un sitio donde...

Este artículo ha sido escrito por:

Fernando Tellado - que ha publicado 1511 artículos en CiberPrensa.


Contacta con el autor

1 Comentarios a este Artículo

  1. Guillermo (24 comentarios) Dijo:

    Hace tiempo tenía este post en favoritos, por suerte hoy puse un robots.txt como la gente!

Escribe una respuesta