Предприятия по всему миру сталкиваются с серьезными операционными барьерами при попытке перевести проекты в сфере искусственного интеллекта (ИИ) из стадии экспериментов в коммерческую эксплуатацию. Согласно масштабному совместному исследованию компании Everpure и аналитического агентства Omdia, опубликованному на портале TechEdt, колоссальные 97% организаций в настоящее время не могут продвинуть свои ИИ-инициативы дальше пилотной стадии. Более того, 62% ИТ-руководителей заявляют об умеренных или серьезных препятствиях при внедрении этих технологий.
Масштабы и скрытые угрозы «темных данных»
Основной причиной застоя ИИ-проектов эксперты называют засилье «темных данных» (dark data) — информации, которую компании собирают и хранят в процессе деятельности, но никак не используют повторно. Около 99% опрошенных организаций признали наличие таких неиспользуемых массивов. У 37% респондентов «темные данные» составляют от 51% до 75% от общего объема корпоративной информации.
Значительная часть этих архивов представляет собой избыточные, устаревшие и тривиальные сведения (так называемые ROT-данные: Redundant, Obsolete, Trivial). К ним относятся дубликаты документов, неактуальные профили клиентов и системный мусор. Из-за отсутствия классификации эти файлы создают информационный шум, раздувают расходы на хранение и создают серьезные риски в области безопасности и комплаенса. В связи с этим 76% ИТ-директоров рассматривают «темные данные» как прямую угрозу для бизнеса.
Структурная сложность и дефицит видимости инфраструктуры
Для эффективного обучения ИИ требуются чистые и структурированные каналы данных. Однако, по данным отчета, 58% предприятий по-прежнему не имеют базового представления о структуре своих информационных активов. Специалисты не могут точно определить, какими данными располагает компания, где они хранятся и насколько они актуальны.
Ситуация осложняется фрагментацией инфраструктуры. Информация рассредоточена по гибридным облакам, SaaS-приложениям, локальным серверам и унаследованным (legacy) системам. В итоге 68% ИТ-лидеров называют управление данными своей главной операционной проблемой, а 63% указывают на разрозненность хранилищ как на ключевое препятствие для масштабирования ИИ.
Доверие к данным как основа надежного ИИ
Качество работы ИИ-систем напрямую зависит от входных данных. Ашиш Гупта, генеральный директор по управлению данными в Everpure, подчеркнул: «Невозможно построить заслуживающий доверия ИИ на недостоверных данных. ROT-данные создают шум на том самом уровне, который должен обеспечивать контекст, что повышает риск неточных выводов ИИ. Путь к лучшему ИИ лежит не через простое увеличение объемов информации, а через обеспечение точности и контекста».
По этой причине 75% ИТ-руководителей считают способность извлекать пользу из «темных данных» критически важным фактором для долгосрочного успеха ИИ-стратегии.
Стратегическая классификация по ценности и рискам
Чтобы преодолеть этот кризис, Everpure рекомендует оценивать корпоративные данные по матрице «ценность — риск» перед их интеграцией в ИИ-модели:
- Высокая ценность, низкий риск: такие данные должны немедленно направляться на обучение ИИ.
- Высокая ценность, высокий риск: требуют строгого контроля доступа и шифрования перед интеграцией.
- Низкая ценность, высокий риск: подлежат систематическому удалению или архивации для минимизации юридических рисков.
- Низкая ценность, низкий риск: удаляются для снижения затрат на хранение.
Только наведя порядок в многосредовой инфраструктуре и избавившись от цифрового мусора, бизнес сможет превратить пассивные «темные данные» в ценный ресурс для ИИ.

