Blindstairs
Tria l’idioma. Idioma actual: Català
Merified HRISSol·licita una demo
Una figura humana de pedra es manté intacta mentre unes capes geomètriques transparents en revelen l’estructura

La nostra posició

La IA ha d’ampliar lesoportunitats

Explora la nostra innovació

Sobre Blindstairs

L’equitat no és una funcionalitat. És la raó per la qual construïm.

Creiem que tothom, sigui quin sigui el seu origen, mereix una oportunitat justa per accedir, avançar i créixer a la feina. La tecnologia ha d’ajudar les persones a progressar mentre el criteri humà responsable orienta el seu futur.

BlindStairs és una empresa impulsada per R+D. Convertim preguntes de recerca sobre biaix, repetibilitat i responsabilitat en una arquitectura de producte desplegable que les organitzacions poden inspeccionar i governar.

El problema que vam decidir abordar

La IA pot escalar una decisió. També pot escalar allò que mai no hi hauria d’influir.

En People Operations, les decisions rellevants determinen qui accedeix, progressa i prospera a la feina. També arrosseguen els biaixos dels entorns on es prenen.

La IA de propòsit general aprèn de dades històriques i del món que l’envolta. Quan se li demana que avaluï directament una persona, el gènere, l’edat, la nacionalitat, l’ètnia o variables indirectes poden influir en el resultat encara que no siguin rellevants per a la decisió.

Si l’evidència professional no canvia però un nom diferent modifica la puntuació, l’automatització no ha eliminat el problema. L’ha accelerat i l’ha fet més difícil d’inspeccionar.

01La mateixa evidència professional
02Canvia un senyal irrellevant
03Un resultat diferent

Un senyal irrellevant mai no hauria de canviar el criteri professional.

Experiments controlats canviant únicament el nom

La mateixa evidència professional. Noms diferents. La puntuació no hauria de canviar.

En cada prova vam mantenir constant el CV base, vam canviar únicament el conjunt de noms i vam repetir l’avaluació. La puntuació directa de l’LLM va produir resultats dispersos i diferències entre grups de noms. BlindStairs va separar la interpretació del model de l’agregació determinista.

Es mostren execucions representatives · validació d’invariància més àmplia sobre més de 10.000 parelles de CV
Constant en cada provaUn CV base
Variable modificadaNomés el conjunt de noms
Execucions repetides50 per grup
Lectura correctaComparar dins de cada panell

Cribratge directe amb LLM

Variable en aquesta prova
Model de propòsit general

Gemini 2.5 Pro

1.78 diferència mitjana
Distribució de densitat de puntuacions de Gemini 2.5 Pro per grup de nomsExecució controlada independent amb cinquanta avaluacions per grup de noms. En aquesta prova, l’evidència professional fixa va produir distribucions disperses i una diferència mitjana de 1.78 punts en canviar el conjunt de noms.
Mitjana amb noms masculins 51.53Mitjana amb noms femenins 53.31
Model de propòsit general

GPT-OSS-120B

1.72 diferència mitjana
Distribució de densitat de puntuacions de GPT-OSS-120B per grup de nomsExecució controlada independent amb cinquanta avaluacions per grup de noms. En aquesta prova, l’evidència professional fixa va produir distribucions disperses i una diferència mitjana de 1.72 punts en canviar el conjunt de noms.
Mitjana amb noms masculins 59.51Mitjana amb noms femenins 61.23

La mateixa evidència professional va produir un rang de puntuacions. Només va canviar el nom.

BlindStairs

Estable per disseny
Nom codificat com a masculíNom codificat com a femení
Resultat de puntuacions repetides de BlindStairsEl sistema de BlindStairs va retornar 64 sobre 100 en cada execució repetida dels dos grups de noms.
64/100en totes les execucions repetides mostrades

Els senyals irrellevants s’eliminen abans de l’avaluació. Els resultats per criteri s’agreguen de manera determinista fora de l’LLM.

Mètode. Cada panell de model extern és una prova controlada independent. En cada panell, es va avaluar un CV base fix 50 vegades per grup de noms i només es van canviar noms codificats per gènere. Les puntuacions absolutes no s’han de comparar entre panells. El programa de validació més ampli cobreix més de 10.000 parelles de CV.

Interpretació. L’experiment mostra repetibilitat i sensibilitat davant d’un senyal modificat en les condicions indicades. Per si sol, no mesura discriminació en el món real. BlindStairs està dissenyat perquè els senyals sociodemogràfics irrellevants no determinin el resultat calculat, mentre la decisió final continua sent humana.

Què ens va ensenyar la recerca

El biaix no és un ajust que puguis desactivar.

Dades millors, anonimització i auditoria són importants. Cap no garanteix de manera creïble que un model de llenguatge de propòsit general esdevingui neutral o determinista.
01

Diversificar les dades d’entrenament

Una representació millor importa, però els patrons històrics, la desigualtat estructural i les variables indirectes poden continuar integrats en el model.

02

Amagar atributs protegits

Eliminar identificadors directes ajuda, però altres detalls poden actuar com a variables indirectes. Si se n’elimina massa, també desapareix context professional valuós.

03

Auditar els resultats

Les auditories poden revelar errors. No fan que la puntuació directa d’un LLM sigui determinista ni impedeixen que canviï el resultat següent.

Vam deixar de demanar a un model de propòsit general que no tingués biaixos. Vam redissenyar la decisió perquè la seva sortida no pogués controlar la puntuació.

La nostra arquitectura

Comprensió dins del model. Lògica de decisió fora.

Els models de llenguatge ajuden a interpretar evidències complexes. Els estàndards explícits, l’agregació determinista i les persones responsables governen el resultat.
01Eliminar senyals irrellevants

La identitat i els senyals sociodemogràfics no pertinents s’eliminen abans de l’avaluació.

02Fer explícit l’estàndard

La decisió es descompon en criteris senzills i ponderats acordats per persones.

03Utilitzar LLM per llegir evidències

Els models interpreten les fonts criteri per criteri, mai per assignar la puntuació final.

04Calcular fora del model

Les regles deterministes agreguen el resultat per a una revisió humana responsable.

L’autoritat humana no és una etapa més. Governa tot el procés.

Recerca · aliances · innovació aplicada

La IA centrada en les persones necessita més que bones intencions.

Necessita evidències, una arquitectura responsable i col·laboració entre recerca, polítiques i pràctica. Si aquesta també és la teva feina, ens agradaria conèixer-te.

Parlem-ne

Amb el suport de

  • Women TechEU
  • EPIC-X, finançat per la Unió Europea
  • AI on Demand
  • CDTI Innovación
  • Universitat de Barcelona
  • ACCIÓ, Generalitat de Catalunya