П

Предвзятость модели

Предвзятость модели — систематическая ошибка машинного обучения, при которой алгоритм даёт искажённые результаты из-за дефектов в данных или архитектуре. Это не случайный шум, а устойчивый перекос в предсказаниях.

Что это

Предвзятость модели (model bias) — систематическое отклонение предсказаний алгоритма от реальных значений, вызванное не случайным шумом, а структурными проблемами: некачественными обучающими данными, неверными допущениями или ошибками в архитектуре. В отличие от дисперсии, которая описывает разброс предсказаний, предвзятость — это устойчивый сдвиг в одну сторону. Модель может быть технически точной на обучающей выборке и при этом системно ошибаться на реальных данных — именно это делает предвзятость особенно опасной.

Зачем это нужно знать

Предвзятость модели стала критической темой после ряда резонансных случаев. В 2016 году система COMPAS, предсказывающая рецидивизм преступников в США, показала систематическую предвзятость против чернокожих обвиняемых — их риск рецидива завышался примерно вдвое чаще, чем у белых. В 2018 году Amazon закрыл внутренний инструмент найма на основе ML: он занижал рейтинг резюме женщин, потому что обучался на исторических данных, где большинство сотрудников были мужчинами. Понимание предвзятости нужно не только этикам, но и каждому, кто строит продукты на основе ML: ошибочная модель наносит репутационный и финансовый ущерб, а в чувствительных областях — медицине, кредитовании, найме — прямо влияет на жизни людей.

Как это работает

Предвзятость возникает на разных этапах жизненного цикла модели. Основные источники:

  • Предвзятость выборки (sampling bias) — обучающие данные не отражают реальное распределение. Например, медицинская модель, обученная только на данных европейских пациентов, хуже работает для других этнических групп.
  • Историческая предвзятость (historical bias) — данные отражают прошлые дискриминационные практики. Модель воспроизводит их, даже если признаки вроде пола или расы явно исключены из признакового пространства.
  • Предвзятость измерения (measurement bias) — ошибки в том, как собираются или размечаются данные. Если разметчики систематически ошибаются в одном направлении, модель усиливает эту ошибку.
  • Предвзятость алгоритма (algorithmic bias) — неверный выбор функции потерь или архитектуры, из-за которого модель оптимизируется под большинство и игнорирует меньшинства в данных.
  • Компромисс смещение-дисперсия (bias-variance tradeoff) — слишком простая модель (высокое смещение) систематически недообучается и не улавливает реальные закономерности в данных.

Примеры

  • Кредитный скоринг: модель обучена на данных 2000-х, когда женщины реже получали кредиты. В результате она занижает скоринг женщин-заявителей, даже при одинаковой финансовой истории с мужчинами.
  • Распознавание лиц: исследование MIT Media Lab (2018, Буоламвини и Гебру) показало, что коммерческие системы распознавания лиц ошибались на тёмнокожих женщинах в 34% случаев против менее 1% у светлокожих мужчин.
  • Медицинская диагностика: алгоритм предсказания пневмонии в 2015 году (Caruana et al.) присваивал пациентам с астмой низкий риск смерти — потому что таких пациентов госпитализировали чаще и они получали лучшее лечение. Модель выучила корреляцию, а не причинно-следственную связь.
  • Поисковые подсказки: автодополнение поисковых систем воспроизводило стереотипные ассоциации с профессиями по гендерному признаку, потому что обучалось на реальных запросах пользователей.
  • Рекомендательные системы: модели YouTube и TikTok склонны к радикализации контента — алгоритм оптимизирует вовлечённость, что систематически продвигает эмоционально заряженный и экстремальный контент.

Связанные понятия

  • Дисперсия модели (variance) — противоположная сторона компромисса: высокая чувствительность к шуму в данных.
  • Переобучение (overfitting) — модель слишком точно подстраивается под обучающую выборку и теряет обобщающую способность.
  • Fairness in ML — направление исследований, изучающее справедливость алгоритмов и методы измерения предвзятости.
  • Explainability (объяснимость) — способность модели давать интерпретируемые объяснения, что помогает обнаруживать скрытую предвзятость.
  • Data augmentation — техника расширения обучающей выборки для снижения предвзятости выборки.

Частые мифы

Главный миф: «если убрать чувствительные признаки (пол, расу, возраст), модель станет нейтральной». Это не так — предвзятость воспроизводится через прокси-признаки. Почтовый индекс коррелирует с расой, история покупок — с доходом, а частота обращений к врачу — с доступностью медицины. Второй распространённый миф: предвзятость — это только этическая проблема, а не техническая. На деле предвзятая модель хуже работает на реальных данных, что напрямую снижает бизнес-метрики: точность, конверсию, удержание пользователей.

Другие термины на букву «П»

Профессиональная переподготовка
Профессиональная переподготовка — форма дополнительного профессионального образования, которая даёт...
Профессиональный стандарт
Профессиональный стандарт — официальный документ, описывающий требования к знаниям, умениям и опыту...
Повышение квалификации
Повышение квалификации — это обучение, которое помогает специалисту углубить или обновить знания в р...
Портфолио обучающегося
Портфолио обучающегося — персональная коллекция работ, достижений и рефлексий студента, которая пока...
Педагогический работник
Педагогический работник — специалист, чья профессиональная деятельность связана с обучением, воспита...
Промежуточная аттестация
Промежуточная аттестация — официальная проверка знаний и навыков учащегося по итогам учебного период...
Практическое занятие
Практическое занятие — форма обучения, на которой студенты не слушают теорию, а применяют знания на...
Признание результатов обучения
Признание результатов обучения — официальное подтверждение знаний, навыков и компетенций человека, п...