Скачать статью (PDF)

Отечественные статистические пакеты обработки данных как элемент технологического суверенитета в концепции импортозамещения

Авторы
  • РУДЕНКО Максим Борисовичк.т.н., доцент, Восточно-Сибирский институт МВД России (г.Иркутск), профессор
  • ГОЛОДКОВ Юрий Эдуардовичк.т.н., доцент, Иркутский национальный исследовательский технический университет, доцент
  • ДОБРОВ Алексей Николаевичк.ю.н., доцент, Байкальский государственный университет
Аннотация и ключевые слова

В статье рассматривается необходимость государственной поддержки российских программных продуктов статистической обработки данных, способных использоваться в качестве импортозамещения зарубежным аналогам в условиях введенных санкций. Анализируются функциональные возможности, конкурентные преимущества современных отечественных статистических пакетов обработки данных и обосновывается необходимость их внедрения в контексте текущих геополитических и экономических вызовов.

Ключевые слова: статистические методы, статистические пакеты, импортозамещение, искусственный интеллект, государственная поддержка

Текст статьи

Вэпоху активного развития информационных технологий и экспоненциального увеличения объёма обрабатываемых данных статистический анализ превращается в ключевой компонент научных исследований, деловой аналитики и принятия эффективных управленческих решений. Современные компьютерные программы для статистической обработки данных применяют разнообразные методы анализа информации, начиная от традиционного регрессионного моделирования и машинного обучения [14-18] до визуализации многомерных данных, что многократно увеличивает потенциал исследователей и возможности компаний.

Сегодня статистические пакеты предоставляют пользователям инструменты автоматизации сложных расчётов, минимизации человеческого фактора и получения объективных, интерпретируемых результатов, существенно повышая эффективность принимаемых решений и качество выполняемых исследований.

В последние годы возрастает потребность в обеспечении технологической независимости российского государства, включая сферу программного обеспечения для статистической обработки данных. Западные санкции, направленные на ограничение доступа к иностранным продуктам, сделали развитие собственных отечественных разработок приоритетной задачей. Импортозамещение статистических пакетов приобретает особое значение, поскольку от их доступности, надежности, функциональности, скорости обработки информации и удобства представления данных зависят многие направления научного анализа, исследований и принятия управленческих решений.

Среди множества зарубежных программных продуктов для статистической обработки данных выделяется целый ряд широко известных и востребованных инструментов, используемых специалистами как за рубежом, так и в России. Несмотря на отсутствие общепринятых критериев измерения популярности каждого отдельного пакета, возьмем наиболее распространенные продукты, такие как IBM SPSS Statistics, язык программирования R (обычно применяется вместе с интерфейсом RStudio), а также аналитическую платформу SAS.

Сравним их по основным параметрам (таблица 1).

Таблица 1.

Сравнительная характеристика зарубежных статистических пакетов Критерий IBM SPSS Statistics R (RStudio) SAS Статистический анализ / Статистические методы Широкий спектр методов (включая машинное обучение) Огромный набор пакетов для любых задач Промышленные масштабы анализа, мощные алгоритмы Графики и визуализация Интерактивные графики, хорошая визуализация Гибкость (ggplot2, plotly), лучшая среди аналогов Мощные, но сложные в настройке Интерфейс Интуитивный, удобен для корпоративного использования Консольный (требует знания кода), но RStudio - лучший пакет, учитываюший потребности пользователей Сложный интерфейс, требует обучения Скриптовый язык Собственный синтаксис (SPSS Syntax), Python-интеграция Полноценный язык программирования Собственный язык (SAS Base), сложный для новичков Стоимость Дорого ($99+/мес. для лицензии) Бесплатный Очень дорогой (корпоративные лицензии) Поддержка и документация Отличная документация, большое сообщество пользователей большое сообщество пользователей, открытый код Профессиональная поддержка, но закрытый код Безопасность и импортозамещение Риск санкционных ограничений Открытый код, но зависимость от зарубежных репозиториев Санкционные риски, закрытый код Рассматривая каждый из этих пакетов, можно отметить следующее.

Система SAS отличается мощными статистическими алгоритмами (включая ANOVA, GLM, методы машинного обучения), поддержкой параллельных вычислений и способностью обрабатывать большие объемы данных. Она характеризуется высокой степенью надежности и успешно применяется в банковской системе, в медицинских учреждениях и страховых компаниях, демонстрируя отличную интеграцию с различными источниками данных. Среди минусов выделяют сложность освоения синтаксиса макрокоманд (SAS Macro), высокую стоимость лицензий и невысокую востребованность в России ввиду значительной стоимости.

Программный пакет IBM SPSS Statistics привлекает пользователей простым и удобным интерфейсом с привычными меню и окнами, наличием готовых сценариев для обработки социологических опросов. Пакет подходит начинающим специалистам, благодаря доступности базовых операций и богатству встроенных графиков (около 50 типов диаграмм). Тем не менее, возможности SPSS ограниченны при проведении сложных многоуровневых анализов, а дополнительные функции предоставляются отдельно, что увеличивает конечную стоимость продукта.

R - это бесплатный открытый язык программирования с богатым набором статистических пакетов, поддерживающий широкий спектр методик анализа данных, включая продвинутые методы машинного обучения. Платформа предлагает мощные библиотеки для построения качественных графиков (например, ggplot2) и трёхмерных изображений (plot3D). Помимо стандартных статистических процедур, R реализует сложные методы, такие как ARIMA-модели (авторегрессионное интегрированное скользящее среднее) и GARCH-модели (обобщённая авторегрессионная условная гетероскедастичность), используемые для анализа временных рядов. Этот инструмент свободно распространяется, удобен для написания индивидуальных алгоритмов и стал фактически стандартом в академическом сообществе.

Вместе с тем R требует определенных навыков программирования, что затрудняет освоение инструмента пользователями без опыта. Также обработка в R больших объёмов данных возможна лишь при их оптимизации, без чего скорость работы может оказаться очень низкой.

По представленным данным видно, что зарубежные программные продукты обладают широким функционалом, способны адаптироваться под решение определенных задач, имеют удобный и информативный графический интерфейс, в том числе по представлению результатов обработки данных, имеют широкий круг пользователей, которые знают, как применять и способны помочь в использовании статпакетов.

Такие программы зачастую используют собственные языки программирования или уникальный синтаксис команд, что даёт большую свободу действий и широкие возможности для расширения функционала, но одновременно создаёт трудности для начинающих пользователей, не обладающих соответствующими навыками. Зарубежные пакеты отличаются широким спектром статистических методов, возможностью глубокого анализа данных и зрелостью экосистемы, доступной корпоративным пользователям. Существуют и свободные платформы с открытым исходным кодом (например, R), позволяющие разработчикам создавать индивидуальные решения для специфических исследовательских задач. Однако иностранные программы характеризуются высокой стоимостью лицензий (например, SAS и SPSS), сложной структурой интерфейса и высокими барьерами для освоения специалистами без опыта программирования.

Говоря о возможностях отечественных программных продуктов для статистической обработки данных [1-11,14,15], отметим такие, как: Polymatica, Stadia, Stattech. Данные продукты вызывают интерес с точки зрения сходства их функциональных возможностей с популярными зарубежными пакетами, которые нами были рассмотрены ранее. Сравним их в общих чертах друг с другом и с пакетами иностранного происхождения [1-15] (таблицы 2-5).

Таблица 2.

Сравнение функциональных возможностей зарубежных и отечественных статистических пакетов (Статтех) SAS SPSS R Статистический анализ / Статистические методы Средние Полные Очень полные Максимальные Базовые Максимальные Возможности обработки Больших данных (Big Data) Да (до 250млн строк) Нет Нет Да Нет С ограничениями Графики и визуализация Интерактивная Устаревшая Продвинутая Средняя Отличная Гибкая Стоимость По запросу Низкая Высокая Очень высокая Высокая Бесплатно Язык Русский Русский Русский/ английский Английский Многоязычный Английский Таблица 3.

Использование аналитических методов в обработке информации зарубежными и отечественными статистическими пакетами Метод Polymatica Stattech Stadia SAS SPSS R Описательная статистика + + + + + + t-тесты, ANOVA + + + + + + Регрессионный анализ + + + + + + Кластерный анализ + + Слабо реализовано + + + Факторный анализ + + Слабо реализовано + + + Методы машинного обучения + (ограничено) (XGBoost, нейросети) - + Слабо реализовано (Python-интеграция) + (лучшая поддержка) Прогнозирование (ARIMA, ETS) + (сильная сторона) + - + + + Анализ выживаемости - + + + + + Байесовская статистика - Слабо реализовано - Слабо реализовано - + Таблица 4.

Работа с данными зарубежных и отечественных статистических пакетов Возможность Polymatica Stattech Stadia SAS SPSS R Big Data (обработка 1M строк) + (оптимизировано) Слабо реализовано - + - (с пакетами) Визуализация + (интерактивная) Слабо реализовано Генерация отчётов + + + + + Интеграция с + (основан на R) Таблица 5.

Удобство использования зарубежных и отечественных статистических пакетов Критерий Polymatica Stattech Stadia SAS SPSS R Графический Интерфейс + (удобный) + + Слабо реализовано (устаревший) - (требует кода) Скриптовая поддержка Слабо реализовано (ограничена) + (Python) - (SAS язык) + (синтаксис) (R язык) Поддержка русского языка + + + - - - Polymatica [3-6] выделяется рядом уникальных преимуществ, среди которых высокая скорость обработки больших данных (до 250 миллионов записей) и поддержка анализа потоков данных в реальном времени. Программа располагает возможностью визуального представления информации без привязки к фиксированным шаблонам, что удобно для формирования аналитических отчётов.

Важным достоинством Polymatica является интеграция с отечественными операционными системами (например, «Альт»), поддержка API для включения в корпоративные инфраструктуры. Полностью российская разработка, Polymatica фокусируется на применении бизнес-анализа (BI) и технологий машинного обучения. При этом, делается упор на удобстве использования широкой аудитории пользователей, включая тех, кто не обладает специальными знаниями в статистике. Программа превосходит аналоги по скорости работы (до 80 раз быстрее), подходит для масштабируемых проектов с применением распределенных серверов. Вместе с тем Polymatica уступает иностранным аналогам по количеству используемых статистических методов обработки данных и имеет более узкую специализацию по осуществлению бизнес-аналитики (BI) и интерактивной аналитики.

Stadia [7-9] представляет собой универсальный статистический пакет с реализацией возмож- ностей описательной статистики, многомерного анализа (факторный, кластерный), непараметрических методов.

Приложение традиционно применяется в медико-биологических и социальных исследованиях, однако страдает устаревшей системой отображения данных.

Главное преимущество Stadia заключается в полном охвате классического набора статистических методов, что выделяет его среди остальных отечественных разработок. Однако приложение ограничено производительностью при анализе больших массивов данных (ограничено несколькими сотнями тысяч записей), слабо развито в плане визуализации и практически не располагает современными функциями машинного обучения.

Stattech [10, 11] выделяется большим арсеналом статистических инструментов (более 250 методов, включая временные ряды, дискриминантный анализ и нейронные сети), качественным графическим модулем (2D-, 3D-визуализация, анимированные графики) и удобной функцией подготовки отчетов. Преимущества программы включают сбалансированный набор профессиональных инструментов, русскоязычный интерфейс и обширные учебные ресурсы.

Тем не менее, основным недостатком Stattech является высокая цена приобретения, а также ограниченность в гибкости при решении нестандартных задач по сравнению с платформами типа R или SAS.

Говоря о недостатках отечественных статистических пакетов по сравнению с западными аналогами, можно отметить реализацию меньшего количества методов, чем в зарубежных пакетах (R и SAS), в том числе методов машинного обучения (кроме Stattech), отсутствие широкой поддержки сообщества пользователей (нет аналога CRAN для R) и менее развитый графический интерфейс.

Тем не менее, они демонстрируют уверенную динамику роста и приближаются по возможностям к ведущим мировыми продуктам вроде SPSS, SAS и R. Преимущества российских решений очевидны: полная адаптация под условия работы в современных условиях, поддержка родного языка, соответствие государственным стандартам и повышенное внимание к информационной безопасности. Всё это превращает отечественные пакеты в важный стратегический ресурс для государственных органов и коммерческих организаций страны.

Переход на программное обеспечение отечественной разработки становится ключевым направлением развития российских научно-исследовательских и производственных процессов.

Замещение иностранных программ решает задачу обеспечения технологической самостоятельности и снижает зависимость от внешних факторов риска, таких как международные санкции.

При этом отечественные разработки пока уступают зарубежным аналогам по объёму статистических методов, поддержке машинного обучения и уровню международной поддержки сообщества. Основной проблемой остаётся невысокая распространённость отечественных пакетов и низкая осведомлённость пользователей о доступных инструментах.

Российским компаниям и организациям необходимо активнее инвестировать в отечественное программное обеспечение, учитывая перспективы дальнейшей изоляции от глобального рынка. Параллельно необходима государственная поддержка отечественных разработчиков, популяризация их решений и продвижение образовательных инициатив, направленных на подготовку квалифицированных кадров.

Развитие российских статистических пакетов станет важной составляющей укрепления цифрового суверенитета страны и обеспечит устойчивое функционирование научных, производственных и бизнес процессов в условиях реализации негативной политики недружественных стран.

Список литературы

  1. https://www.sas.com/ru_ru/software/stat. html
  2. https://ru.statisticseasily.com/глоссарий/ что-такое-система-статистического-анализа-sas/
  3. https://www.tadviser.ru/index.php/ Продукт:Polymatica_Analytics_Аналитическая_ платформа
  4. https://www.allware.ru/polimatika_dashboards
  5. https://нашсофт.рус/soft/bi/polymatica
  6. https://slsoft.ru/products/polymatica/
  7. http://protein.bio.msu.ru/~akula/Podr2~1. htm
  8. https://neurobiology.ru/doc/index.php?ID=79
  9. https://intuit.ru/studies/courses/3632/874/ lecture/14309?page=4
  10. https://stattech.ru/
  11. https://www.profmedobr.ru/articles/ ispolzovanie-otechestvennogo-programmnogo-obespecheniya-pri-osvoenii-aspirantami-navykov-statisticheskoj-obrabotki-dannyh/
  12. Руденко М.Б. Развитие российского программного обеспечения для статистической обработки данных // М.Б. Руденко, Ю.Э. Голодков, А.Н. Добров. Образование и право. 2024. № 11. С. 511- 515.
  13. Руденко М.Б. Cравнительная оценка бесплатных статистических пакетов обработки данных западных производителей программного обеспечения // М.Б. Руденко, Ю.Э. Голодков. Образование и право. 2024. № 8. С. 186-191.
  14. Руденко М.Б. Искусственный интеллект в образовании: возможности и риски // М.Б. Руденко, Ю.Э. Голодков, А.Г. Карелин. Образование и право. 2023. № 10. С. 363-366.
  15. Руденко М.Б. Искусственный интеллект как эффективный инструмент в служебной деятельности ОВД // М.Б. Руденко, Ю.Э. Голодков. Образование и право. 2022. № 10. С. 449-452.
  16. Суходолов А.П. Искусственный интеллект в противодействии преступности, ее прогнозировании, предупреждении и эволюции / А. П. Суходолов, А. М. Бычкова. — DOI: 10.17150/2500- 4255.2018.12(6).753-766 // Всероссийский криминологический журнал. — 2018. — Т. 12, № 6. — С. 753–766.
  17. Степаненко А.С. Перспективы развития искусственного интеллекта в научном освоении мира / А.С. Степаненко, Д.А. Степаненко. — DOI: 10.17150/2411-6262.2019.10(4).1 // Baikal Research Journal. — 2019. — Т. 10, № 4. — С. 1–1.
  18. Хисамова З.И. Правовое регулирование искусственного интеллекта / З. И. Хисамова, И. Р. Бегишев. — DOI: / 10.17150/2411- 6262.2019.10(2).19 // Baikal Research Journal. — 2019. — Т. 10, № 2. — С. 190–195. Spisok literatury:
  19. https://www.sas.com/ru_ru/software/stat. html
  20. https://ru.statisticseasily.com/glossarij/ chto-takoe-sistema-statisticheskogo-analiza-sas/
  21. https://www.tadviser.ru/index.php/Produkt:Polymatica_Analytics_Analiticheskaya_platforma
  22. https://www.allware.ru/polimatika_dashboards
  23. https://nashsoft.rus/soft/bi/polymatica
  24. https://slsoft.ru/products/polymatica/
  25. http://protein.bio.msu.ru/~akula/Podr2~1. htm
  26. https://neurobiology.ru/doc/index.php?ID=79
  27. https://intuit.ru/studies/courses/3632/874/ lecture/14309?page=4
  28. https://stattech.ru/
  29. https://www.profmedobr.ru/articles/ ispolzovanie-otechestvennogo-programmnogo-obespecheniya-pri-osvoenii-aspirantami-navykov-statisticheskoj-obrabotki-dannyh/
  30. Rudenko M.B. Razvitie rossijskogo programmnogo obespecheniya dlya statisticheskoj obrabotki dannyh // M.B. Rudenko, YU.E. Golodkov, A.N. Dobrov. Obrazovanie i pravo. 2024. № 11. S. 511-515.
  31. Rudenko M.B. Cravnitel’naya ocenka besplatnyh statisticheskih paketov obrabotki dannyh zapadnyh proizvoditelej programmnogo obespecheniya // M.B. Rudenko, YU.E. Golodkov. Obrazovanie i pravo. 2024. № 8. S. 186-191.
  32. Rudenko M.B. Iskusstvennyj intellekt v obrazovanii: vozmozhnosti i riski // M.B. Rudenko, YU.E. Golodkov, A.G. Karelin. Obrazovanie i pravo. 2023. № 10. S. 363-366.
  33. Rudenko M.B. Iskusstvennyj intellekt kak effektivnyj instrument v sluzhebnoj deyatel’nosti OVD // M.B. Rudenko, YU.E. Golodkov. Obrazovanie i pravo. 2022. № 10. S. 449-452.
  34. Suhodolov A.P. Iskusstvennyj intellekt v protivodejstvii prestupnosti, ee prognozirovanii, preduprezhdenii i evolyucii / A. P. Suhodolov, A. M. Bychkova. — DOI: 10.17150/2500-4255.2018.12(6).753- 766 // Vserossijskij kriminologicheskij zhurnal. — 2018. — T. 12, № 6. — S. 753–766.
  35. Stepanenko A.S. Perspektivy razvitiya iskusstvennogo intellekta v nauchnom osvoenii mira / A.S. Stepanenko, D.A. Stepanenko. — DOI: 10.17150/2411-6262.2019.10(4).1 // Baikal Research Journal. — 2019. — T. 10, № 4. — S. 1–1.
  36. Hisamova Z.I. Pravovoe regulirovanie iskusstvennogo intellekta / Z. I. Hisamova, I. R. Begishev. — DOI: / 10.17150/2411-6262.2019.10(2).19 // Baikal Research Journal. — 2019. — T. 10, № 2. — S. 190–195.

Скачать