Dátové skreslenie (Data Bias)
Vzniká pri zbere trénovacích dát, kde vzorka nereprezentuje cieľovú populáciu v pomere 1:1. Často ide o historické nerovnosti zachytené v databázach.
Čítať o ochrane dát →
Technická analýza algoritmickej predpojatosti (bias) a implementácia matematických rámcov pre zabezpečenie férovosti v prediktívnych systémoch.
Skreslenie v systémoch umelej inteligencie nie je náhodný jav, ale výsledok systémových chýb v životnom cykle dát. Rozlišujeme tri základné úrovne, kde dochádza k narušeniu objektivity modelu.
Vzniká pri zbere trénovacích dát, kde vzorka nereprezentuje cieľovú populáciu v pomere 1:1. Často ide o historické nerovnosti zachytené v databázach.
Čítať o ochrane dát →Chyba v matematickom návrhu, kde optimalizačná funkcia uprednostňuje väčšinové triedy na úkor presnosti pri minoritných skupinách pre dosiahnutie 99% globálnej presnosti.
Transparentnosť modelov →Vnášané inžiniermi počas fázy "feature engineering", kde subjektívny výber premenných ovplyvňuje výslednú váhu atribútov v neurónovej sieti.
Technický glosár →V rámci spoločnosti Terracotta Co pristupujeme k eliminácii skreslenia ako k striktne technickému inžinierskemu problému. Algoritmická predpojatosť nie je len etickou otázkou, ale priamym indikátorom nízkej kvality modelu a nedostatočnej generalizácie dát. Ak model vykazuje vysokú chybovosť pri špecifických demografických skupinách, jeho predikčná hodnota je v reálnom nasadení o 15-25% nižšia, než deklarujú syntetické testy.
Proces eliminácie začína fázou Pre-processing, kde aplikujeme techniky ako re-weighting (prevažovanie vzoriek) a sampling (vyvažovanie počtu záznamov). Cieľom je dosiahnuť stav, kedy chránené atribúty (napr. vek, lokalita) nemajú štatisticky významnú koreláciu s cieľovou premennou, pokiaľ to nie je kauzálne odôvodnené. Tento krok znižuje riziko nepriamej diskriminácie prostredníctvom zástupných premenných (proxies).
Následne v rámci In-processing fázy integrujeme do stratovej funkcie (loss function) penalizačné členy za nespravodlivosť. Používame matematické obmedzenia, ktoré nútia model minimalizovať rozdiel v chybovosti medzi jednotlivými podskupinami. Tento prístup je kritický najmä pri nasadzovaní LLM modelov, kde hrozí amplifikácia stereotypov prítomných v internetových textoch. Viac o ochrane v tejto oblasti nájdete v sekcii Kybernetická bezpečnosť LLM.
| Metrika | Definícia | Cieľová hodnota | Kedy použiť |
|---|---|---|---|
| Demographic Parity | Pomer pozitívnych výsledkov je rovnaký pre všetky skupiny. | Diff < 0.05 | Rozhodovacie procesy (pôžičky, nábor). |
| Equalized Odds | Rovnaká miera True Positive a False Positive výsledkov. | Ratio ≈ 1.0 | Klasifikačné modely s vysokým rizikom. |
| Disparate Impact | Pomer pravdepodobnosti výberu pre nechránenú vs. chránenú skupinu. | > 0.80 (80% rule) | Compliance a audit zhody s reguláciou. |
| Predictive Parity | Presnosť predikcie (Precision) je konzistentná naprieč skupinami. | Variance < 0.02 | Diagnostické a medicínske systémy. |
Poznámka: Dosiahnutie 100% parity vo všetkých metrikách súčasne je matematicky nemožné (Impossibility Theorem of Fairness). Prioritizácia metriky závisí od domény nasadenia.
Identifikácia chýbajúcich hodnôt a nevyváženého zastúpenia demografických segmentov v trénovacom súbore.
Simulácia extrémnych scenárov a meranie stability modelu pri zmene citlivých parametrov o +/- 30%.
Aplikácia korekčných algoritmov (napr. Adversarial Debiasing) na zníženie zistenej predpojatosti.
Nasadenie monitorovacích sond, ktoré v reálnom čase sledujú drift v spravodlivosti modelu po nasadení.
Zabezpečte súlad vašich AI riešení s prichádzajúcou legislatívou EU AI Act. Naši inžinieri vykonajú kompletnú diagnostiku vašich dátových modelov.