El information gain (o ganancia de información) es la cantidad de información nueva que aporta una página más allá de lo que ya está posicionado para una consulta determinada. El término no nació en el SEO, sino en el machine learning, pero se popularizó a partir de una patente de Google presentada en 2018 y concedida en 2022.
Para las agencias que trabajan contenido a gran escala, este concepto se ha vuelto central: escribir «más de lo mismo» ya no es suficiente quiera o no la métrica esté oficialmente confirmada como factor de ranking.
¿Qué es exactamente el information gain?
El information gain mide cuánta información nueva agrega una página frente a lo que un usuario ya ha visto previamente en su sesión de búsqueda. La patente de Google que originó el término se llama «Contextual estimation of link information gain» y aborda un problema concreto: resultados de búsqueda donde todas las páginas dicen esencialmente lo mismo.
No hay confirmación oficial de que Google use un «score» de information gain como factor de ranking activo. Sin embargo, hay señales indirectas que sugieren que el concepto sí influye en cómo se recompensa el contenido:
- Las directrices de contenido útil de Google piden explícitamente evaluar si un contenido es original.
- Google declaró en marzo de 2024 haber reducido en un 45% el contenido de baja calidad y no original en sus resultados.
- Análisis de actualizaciones de algoritmo muestran que los sitios que ganan tráfico suelen tener más «activos propietarios» (datos y herramientas originales).
¿Cómo funciona el information gain según la patente?
Se calcula por usuario y por sesión
El information gain es contextual: compara un documento contra lo que un usuario individual ya ha visto en esa sesión. Un artículo puede resultar redundante para alguien que ya leyó cinco textos similares, y genuinamente útil para quien busca el tema por primera vez.
Compara significado, no palabras
El modelo detrás de la patente lee cada documento como una representación semántica. Esto significa que reescribir el artículo de un competidor con otras palabras no genera ganancia real: el sistema reconoce ideas parafraseadas como la misma información.
Es dinámico
Los puntajes se recalculan durante la sesión del usuario. A medida que consume más páginas, las páginas restantes se reordenan según lo que ya fue cubierto.
Elimina hechos duplicados, no solo páginas duplicadas
La patente se extiende explícitamente a chatbots y asistentes conversacionales: si diez fuentes dicen lo mismo, el sistema tiende a extraer cada hecho una sola vez, de la fuente que lo exprese mejor. Esto tiene una consecuencia directa:
En una lista de resultados tradicional, incluso el cuarto sitio que dice lo mismo obtiene una oportunidad de clic. En una respuesta sintetizada por IA, no existe una «posición cuatro».
¿Cómo se agrega information gain a un contenido?
| Método | Cómo aplicarlo |
|---|---|
| Estudiar la intención de búsqueda | Leer los resultados como buscador, no como redactor, e identificar qué pregunta nadie responde |
| Análisis de brechas de contenido | Comparar qué cubren las páginas mejor posicionadas y detectar huecos |
| Preguntas sin responder | Revisar foros, «la gente también pregunta» y comunidades para detectar dudas recurrentes sin respuesta en la primera página |
| Datos propios | Encuestas, entrevistas o datos internos de la empresa: la forma más defendible de originalidad |
| Actualización constante | El contenido reciente casi por definición aporta información que el resto del SERP aún no tiene |
Un hallazgo relevante de un estudio sobre páginas mejor posicionadas: las páginas con 15 o más puntos de datos únicos promediaron un puntaje de originalidad de 62 sobre 100, frente a solo 40 en páginas con uno o ningún dato propio, lo que convierte a los datos originales en el predictor más fuerte de diferenciación encontrado en ese análisis.
Por qué esto importa más ahora que antes
Desde que se popularizaron los modelos de lenguaje, cualquiera puede generar una «guía completa» en minutos. Eso ha vuelto la exhaustividad, por sí sola, un diferenciador insuficiente. El contenido que solo repite el consenso corre el riesgo de ser absorbido por una respuesta de IA sin ni siquiera recibir el crédito de la cita.
Este mismo principio conecta con la manera en que la agencia recomienda construir contenido informativo: partiendo de una intención de búsqueda clara y sumando ángulos que el resto del mercado no cubre, algo que se explica con más detalle en el artículo sobre qué es un insight de marketing, un concepto muy cercano a la lógica del information gain.
Preguntas frecuentes
¿El information gain es un factor de ranking confirmado por Google?
No hay confirmación oficial. Google tiene una patente sobre el concepto, pero nunca ha declarado que un «score» de information gain esté activo en su algoritmo de ranking.
¿Basta con agregar más datos y estadísticas para generar information gain?
No, si esos datos ya existen en otras fuentes. La ganancia real viene de datos, ejemplos o perspectivas que ningún otro resultado ya cubre.
¿Cómo se relaciona el information gain con el contenido generado por IA?
El contenido generado sin supervisión tiende a producir «contenido de consenso», que es exactamente lo opuesto a la ganancia de información, ya que reproduce lo más probable, no lo más original.
Data Trust integra investigación de intención de búsqueda y análisis de brechas de contenido en cada estrategia. El equipo de agencia SEO de Data Trust ayuda a marcas peruanas a identificar en qué temas realmente pueden diferenciarse, en lugar de competir por decir lo mismo que ya está en la primera página.