Knigi-for.me

Главное про AI - Вадим Жартун

Тут можно читать бесплатно Главное про AI - Вадим Жартун. Жанр: Прочее издательство , год . Так же Вы можете читать полную версию (весь текст) онлайн без регистрации и SMS на сайте knigi-for.me (knigi for me) или прочесть краткое содержание, предисловие (аннотацию), описание и ознакомиться с отзывами (комментариями) о произведении.
и на этом же журнале строить запрет на AI в задачах с регуляторной ответственностью до тех пор, пока в компании не выстроен двухступенчатый контроль. Журнал защищает и клиента, и компанию при разборе инцидента.

ПРЕДВЗЯТОСТЬ AI: ПРОИСХОЖДЕНИЕ И ЦЕНА ДЛЯ БИЗНЕСА

В предыдущих разделах мы видели, что в судебных и академических кейсах модель фабриковала ссылки. Теперь посмотрим шире: откуда в модели берётся системное искажение, когда дело касается не конкретного факта, а целых групп людей.

В апреле 2025 года Кайра Уилсон (Kyra Wilson) и Айлин Калискан (Aylin Caliskan) из University of Washington опубликовали в Brookings исследование, которое получило широкий резонанс в деловых и технических СМИ. Три открытые LLM прогнали в режиме скрининга резюме (как в реальных HR-системах), и в каждом прогоне подменили имена кандидатов: белые имена встречались в обучающих данных в 5,5 раза чаще чёрных. Моделям предлагали выбрать 10% наиболее подходящих на вакансию. Получилось около 40 000 сравнений на каждую модель.

Результат по расовому признаку: белые имена выигрывают в 85,1% случаев, чёрные — в 8,6%. По гендеру: мужские имена выбираются на 51,9% чаще женских при сопоставимом опыте работы, и только в 11,1% случаев система отдавала предпочтение женщине. Самый жёсткий удар пришёлся по пересечению: чёрные мужчины выигрывали у белых мужчин в 0% случаев, ни одного раза из тысяч прогонов. Авторы отдельно подчёркивают: речь не о слабом сигнале, а о статистической невозможности для конкретной группы пройти фильтр.

Предвзятость — следствие обучающих данных. Если в корпусе белые имена встречаются в 5,5 раза чаще чёрных, модель выучивает, что белые имена «более вероятны» в деловом контексте, и при выборе «на кого это похоже» отдаёт им предпочтение. То же самое с гендером, национальностью, культурой, политической позицией.

Исследование Misinformation Review Гарвардской школы Кеннеди (сентябрь 2024) показало, что LLM фабрикуют положительную информацию о «своих» странах и негативную о «чужих» — асимметричное распространение, которое работает как мягкая пропаганда. Эта же механика работает в информационной войне: модели в обучающих данных унаследовали геополитические искажения западных источников и воспроизводят их в ответах.

Для российского офиса это означает конкретное следствие. YandexGPT, GigaChat, Kandinsky обучались на других корпусах, с другим балансом имён, культур, политических контекстов, и ведут себя в этих осях иначе, чем западные модели.

В апреле 2025 года команда AI, Data and Analytics Lab (AIDA-lab) Гентского университета опубликовала исследование «What Large Language Models Do Not Talk About» (arXiv 2504.03803). Они протестировали 14 frontier-моделей, включая GigaChat Max Preview и YandexGPT 4 Lite, на корпусе из 2371 политически активной персоны на шести языках ООН.

GigaChat и YandexGPT показали самый высокий процент «жёсткой цензуры» среди всех 14 моделей — выше китайских DeepSeek и Qwen, — причём отказываются отвечать преимущественно по персонам «своей» юрисдикции: война в Украине, оппозиция, «Мемориал», Афганистан, Сирия. Исследователи подчёркивают: цензура направлена на внутреннего русскоязычного пользователя, модели отказываются отвечать даже на запросы на русском языке. Это не языковой фильтр, а политика продукта, описанная академическим исследованием.

В январе 2025 года Meduza (издание внесено Минюстом РФ в реестр иностранных агентов) провела сравнительный эксперимент: одни и те же политически чувствительные вопросы про Китай и Россию задали DeepSeek, YandexGPT и GigaChat. Результат парадоксальный. DeepSeek подробно описал Евромайдан, аннексию Крыма, конфликт в Донбассе и упомянул «непризнанный референдум», а на Тяньаньмэнь отказался отвечать на пяти языках из шести. GigaChat и YandexGPT, наоборот, свободно описывали события 4 июня 1989 года в Пекине, но систематически отказывались обсуждать войну в Украине.

Вывод Meduza: российские модели более «пуганые» в политическом смысле, чем китайские, причём неравномерно — китайские темы обсуждают свободнее, чем российские. На запрос про «Xi Jinping и Винни-Пух» GigaChat выдаёт формальный отказ «некоторые темы временно ограничены» — это canned refusal (шаблонный отказ, встроенная заготовка из правил Sber), а не органический отказ модели.

В марте 2024 года команда исследователей во главе с Вероникой Григорьевой (источник: arXiv 2403.17553) выпустила бенчмарк RuBia — почти 2000 пар предложений по 19 подкатегориям в 4 доменах (гендер, социально-экономический статус, национальность, разнообразие).

RuBia показал то, что подтверждается любым русскоязычным: у русского языка нет устоявшегося гендерно-нейтрального местоимения, и почти любой контекст грамматически маркирован по роду («доктор наук находИЛСЯ» — мужской род, «доктор наук находИЛАСЬ» — женский). Модели усваивают связку «профессия — род» из обучающих текстов, и перекос «врач — мужчина, медсестра — женщина» в русском выражен сильнее, чем в английском.

Команда RuBia оценила девять LLM и обнаружила устойчивые паттерны гендерной предвзятости во всех. Для офиса это значит: попросите YandexGPT «назови 5 имён для инженера, 5 для учителя» — и с большой вероятностью получите «Александр, Дмитрий, Сергей» и «Наталья, Елена, Ольга», даже если дать явную инструкцию «используй разнообразные имена».

Важное отличие российской предвзятости от западной. Западная — статистическая: модель «переобучилась» на западной культуре, и эту предвзятость можно ослабить через промпт-инжиниринг и few-shot приёмы. Российская — институциональная: правила выставлены владельцем модели, встроены в ядро продукта и согласованы с регулятором. Команда GigaChat в техническом отчёте (препринт arXiv:2506.09440, «GigaChat Family», июнь 2025) прямо описывает, что пост-тренинг включает 250 000 размеченных примеров от профессиональных AI-тренеров с оценкой по критериям «adherence, context awareness, factual accuracy, safety», и слово «safety» в этом контексте — это и есть политическая и культурная фильтрация. Статистическую предвзятость можно обойти, институциональную — нельзя. Если вы думали, что «YandexGPT просто стесняется говорить о политике с иностранцами», то нет: это политика продукта, не языковой фильтр.

Что делать на практике. Во-первых, признать, что нейтральных моделей не бывает. Из этого следует выстраивать проверку, а не отказываться от AI. Во-вторых, для задач с регуляторной ответственностью (подбор персонала, кредитный скоринг, модерация контента) использовать AI только как первый фильтр с обязательной человеческой проверкой на «спорных» случаях.

В-третьих, тестировать модель на собственных примерах: 50–100 пар «правильного» и «неправильного» ответа, и если модель систематически ошибается в одну сторону — это сигнал, что у неё есть предвзятость в этой области. В-четвёртых, при международной работе помнить, что модель, обученная в основном на западных источниках, имеет западный уклон. Это уклон всей индустрии, в которой её обучали, а не баг конкретной модели.

И всё же четыре шага не закрывают проблему. Другое исследование (VoxDev/PNAS Nexus, май 2025) на 361 000 синтетических резюме с одинаковым опытом, но разными именами показало перевёрнутый перекос — в пользу женщин, с чёрными мужчинами в минусе. Просьба «будь нейтральным» в промпте не убирает bias, а иногда создаёт другой. Если вендор заявляет, что


Вадим Жартун читать все книги автора по порядку

Вадим Жартун - все книги автора в одном месте читать по порядку полные версии на сайте онлайн библиотеки kniga-for.me.