Выдержка из работы:
Введение
Актуальность исследования обусловлена тем, что анализ и визуализация данных на основе открытых источников являются важной частью современной аналитики. Открытые данные становятся все более доступными и широко используются в различных областях, таких как бизнес, наука, образование, государственное управление и многие другие. Открытые источники данных представляют собой информацию, которая доступна для свободного использования, распространения и модификации без ограничений авторских прав или лицензий.
Для анализа данных из открытых источников используются различные методы и инструменты. Один из основных этапов анализа данных — это сбор и обработка информации. Одним из примеров успешного анализа данных из открытых источников является проект по анализу данных об уровне загрязнения воздуха в различных городах. Используя открытые данные о содержании вредных веществ в атмосфере, специалисты смогли выявить причины загрязнения и предложить меры по его уменьшению.
……………..
1. Теоретические основы визуализации данных на основе открытых источников
1.1 Общая характеристика и этапы интеллектуального анализа данных
Интеллектуальный анализ данных – это процесс, который помогает извлекать информацию из заданного набора данных для выявления тенденций, закономерностей и полезных данных. Целью использования интеллектуального анализа данных является принятие поддерживаемых данными решений на основе огромных наборов данных .
Интеллектуальный анализ данных работает совместно с прогностическим анализом, отраслью статистической науки, которая использует сложные алгоритмы, предназначенные для работы со специальной группой задач. Прогностический анализ сначала выявляет закономерности в огромных объемах данных, которые интеллектуальный анализ данных обобщает для прогнозов. Также интеллектуальный анализ данных служит уникальной цели, которая заключается в распознавании шаблонов в наборах данных для определения проблем, относящихся к определенной области.
Он делает это, используя сложный алгоритм для обучения модели для конкретной проблемы. Когда аналитик знает область проблемы, с которой имеет дело, он может использовать машинное обучение для моделирования системы, способной идентифицировать закономерности в наборе данных.
Итак, интеллектуальный анализ данных – это процесс поиска больших наборов данных для поиска закономерностей и тенденций, которые не могут быть найдены с помощью простых методов анализа. Он использует сложные математические алгоритмы для изучения данных, а затем оценки возможности событий, происходящих в будущем, на основе полученных результатов. Это также называется обнаружением знаний данных или KDD (Knowledge Discovery Data). Интеллектуальный анализ данных используется организациями для извлечения конкретной информации из больших объемов данных для поиска решений своих бизнес-проблем. После понимания определения интеллектуального анализа данных следует разобраться в самом процессе интеллектуального анализа данных. До того, как осуществляется фактический Data Mining, в подготовке к его реализации участвует несколько процессов (на рисунке 1 представлен весь процесс) .
1. Бизнес-исследование. Прежде чем начать интеллектуальный анализ, необходимо иметь полное представление о поставленных целях, доступных ресурсах и текущих сценариях в соответствии с имеющимися требованиями. Это поможет создать подробный план осуществления интеллектуального анализа данных, который эффективно достигает поставленных организацией целей.
2. Проверка качества данных. Поскольку данные собираются из различных источников, они должны быть проверены и сопоставлены, чтобы убедиться, что нет узких мест в процессе интеграции данных.
Рисунок 1 – Процесс интеллектуального анализа данных
Обеспечение качества помогает выявлять любые основные аномалии в данных, такие как отсутствующая интерполяция данных, сохраняя данные в отличной форме до того, как они подвергнутся интеллектуальному анализу.
3. Очистка данных. Считается, что 90% времени уходит на выбор, очистку, форматирование и анонимизацию данных перед майнингом.
4. Преобразование данных. Здесь задействованные процессы, состоящие из пяти подэтапов, которые делают данные готовыми к окончательным наборам данных. Она включает в себя:
? Сглаживание данных: здесь шум удаляется из данных. Шумные данные – это информация, которая была повреждена при передаче, хранении или манипуляции до такой степени, что она непригодна для анализа данных. Помимо потенциального искажения результатов любого исследования интеллектуального анализа данных, хранение зашумленных данных также увеличивает объем пространства, которое должно быть выделено для набора данных.