Blindstairs
Elegir idioma. Idioma actual: Español
Merified HRISSolicita una demo
Una figura humana de piedra se mantiene intacta mientras unas capas geométricas transparentes revelan su estructura

Nuestra postura

La IA debe ampliar lasoportunidades

Explora nuestra innovación

Sobre Blindstairs

La equidad no es una funcionalidad. Es la razón por la que construimos.

Creemos que toda persona, sea cual sea su origen, merece una oportunidad justa para acceder, avanzar y crecer en el trabajo. La tecnología debe ayudar a las personas a progresar mientras el criterio humano responsable orienta su futuro.

BlindStairs es una empresa impulsada por I+D. Convertimos preguntas de investigación sobre sesgo, repetibilidad y responsabilidad en una arquitectura de producto desplegable que las organizaciones pueden inspeccionar y gobernar.

El problema que decidimos abordar

La IA puede escalar una decisión. También puede escalar aquello que nunca debería influir en ella.

En People Operations, las decisiones relevantes determinan quién accede, progresa y prospera en el trabajo. También arrastran los sesgos de los entornos en los que se toman.

La IA de propósito general aprende de datos históricos y del mundo que la rodea. Cuando se le pide que evalúe directamente a una persona, el género, la edad, la nacionalidad, la etnia o variables indirectas pueden influir en el resultado aunque no sean relevantes para la decisión.

Si la evidencia profesional no cambia pero un nombre distinto modifica la puntuación, la automatización no ha eliminado el problema. Lo ha acelerado y lo ha hecho más difícil de inspeccionar.

01La misma evidencia profesional
02Cambia una señal irrelevante
03Un resultado diferente

Una señal irrelevante nunca debería cambiar el juicio profesional.

Experimentos controlados cambiando únicamente el nombre

La misma evidencia profesional. Nombres distintos. La puntuación no debería cambiar.

En cada prueba mantuvimos constante el CV base, cambiamos únicamente el conjunto de nombres y repetimos la evaluación. La puntuación directa del LLM produjo resultados dispersos y diferencias entre grupos de nombres. BlindStairs separó la interpretación del modelo de la agregación determinista.

Se muestran ejecuciones representativas · validación de invariancia más amplia sobre más de 10.000 pares de CV
Constante en cada pruebaUn CV base
Variable modificadaSolo el conjunto de nombres
Ejecuciones repetidas50 por grupo
Lectura correctaComparar dentro de cada panel

Cribado directo con LLM

Variable en esta prueba
Modelo de propósito general

Gemini 2.5 Pro

1.78 diferencia media
Distribución de densidad de puntuaciones de Gemini 2.5 Pro por grupo de nombresEjecución controlada independiente con cincuenta evaluaciones por grupo de nombres. En esta prueba, la evidencia profesional fija produjo distribuciones dispersas y una diferencia media de 1.78 puntos al cambiar el conjunto de nombres.
Media con nombres masculinos 51.53Media con nombres femeninos 53.31
Modelo de propósito general

GPT-OSS-120B

1.72 diferencia media
Distribución de densidad de puntuaciones de GPT-OSS-120B por grupo de nombresEjecución controlada independiente con cincuenta evaluaciones por grupo de nombres. En esta prueba, la evidencia profesional fija produjo distribuciones dispersas y una diferencia media de 1.72 puntos al cambiar el conjunto de nombres.
Media con nombres masculinos 59.51Media con nombres femeninos 61.23

La misma evidencia profesional produjo un rango de puntuaciones. Solo cambió el nombre.

BlindStairs

Estable por diseño
Nombre codificado como masculinoNombre codificado como femenino
Resultado de puntuaciones repetidas de BlindStairsEl sistema de BlindStairs devolvió 64 sobre 100 en cada ejecución repetida de ambos grupos de nombres.
64/100en todas las ejecuciones repetidas mostradas

Las señales irrelevantes se eliminan antes de la evaluación. Los resultados por criterio se agregan de forma determinista fuera del LLM.

Método. Cada panel de modelo externo es una prueba controlada independiente. En cada panel, se evaluó un CV base fijo 50 veces por grupo de nombres y solo se cambiaron nombres codificados por género. Las puntuaciones absolutas no deben compararse entre paneles. El programa de validación más amplio cubre más de 10.000 pares de CV.

Interpretación. El experimento muestra repetibilidad y sensibilidad ante una señal modificada en las condiciones indicadas. Por sí solo, no mide discriminación en el mundo real. BlindStairs está diseñado para que las señales sociodemográficas irrelevantes no determinen el resultado calculado, mientras la decisión final sigue siendo humana.

Lo que nos enseñó la investigación

El sesgo no es un ajuste que puedas desactivar.

Mejores datos, anonimización y auditoría son importantes. Ninguno garantiza de forma creíble que un modelo de lenguaje de propósito general vaya a ser neutral o determinista.
01

Diversificar los datos de entrenamiento

Una mejor representación importa, pero los patrones históricos, la desigualdad estructural y las variables indirectas pueden seguir integrados en el modelo.

02

Ocultar atributos protegidos

Eliminar identificadores directos ayuda, pero otros detalles pueden actuar como variables indirectas. Si se elimina demasiado, también desaparece contexto profesional valioso.

03

Auditar los resultados

Las auditorías pueden revelar fallos. No hacen que la puntuación directa de un LLM sea determinista ni impiden que cambie el siguiente resultado.

Dejamos de pedir a un modelo de propósito general que no tuviera sesgos. Rediseñamos la decisión para que su salida no pudiera controlar la puntuación.

Nuestra arquitectura

Comprensión dentro del modelo. Lógica de decisión fuera de él.

Los modelos de lenguaje ayudan a interpretar evidencias complejas. Los estándares explícitos, la agregación determinista y las personas responsables gobiernan el resultado.
01Eliminar señales irrelevantes

La identidad y las señales sociodemográficas no pertinentes se eliminan antes de la evaluación.

02Hacer explícito el estándar

La decisión se descompone en criterios sencillos y ponderados acordados por personas.

03Usar LLM para leer evidencias

Los modelos interpretan las fuentes criterio por criterio, nunca como responsables de la puntuación final.

04Calcular fuera del modelo

Las reglas deterministas agregan el resultado para una revisión humana responsable.

La autoridad humana no es una etapa más. Gobierna todo el proceso.

Investigación · alianzas · innovación aplicada

La IA centrada en las personas necesita algo más que buenas intenciones.

Necesita evidencias, una arquitectura responsable y colaboración entre investigación, políticas y práctica. Si ese también es tu trabajo, nos gustaría conocerte.

Hablemos

Con el apoyo de

  • Women TechEU
  • EPIC-X, financiado por la Unión Europea
  • AI on Demand
  • CDTI Innovación
  • Universitat de Barcelona
  • ACCIÓ, Generalitat de Catalunya