Notice: Function _load_textdomain_just_in_time was called incorrectly. Translation loading for the acf domain was triggered too early. This is usually an indicator for some code in the plugin or theme running too early. Translations should be loaded at the init action or later. Please see Debugging in WordPress for more information. (This message was added in version 6.7.0.) in /home/user/web/mal.scrum360.ru/public_html/wp-includes/functions.php on line 6260

Notice: Функция _load_textdomain_just_in_time вызвана неправильно. Загрузка перевода для домена cyr2lat была запущена слишком рано. Обычно это индикатор того, что какой-то код в плагине или теме запускается слишком рано. Переводы должны загружаться при выполнении действия init или позже. Дополнительную информацию можно найти на странице «Отладка в WordPress». (Это сообщение было добавлено в версии 6.7.0.) in /home/user/web/mal.scrum360.ru/public_html/wp-includes/functions.php on line 6260
Batch обработка с Apache Spark

Ведутся технические работы. Это может временно повлиять на скорость работы сайта. Приносим извинения за неудобства и благодарим за ваше понимание!

Batch обработка с Apache Spark


Warning: Undefined array key 1 in /home/user/web/mal.scrum360.ru/public_html/wp-content/themes/malitikov/single.php on line 15
Лектор: Егор Пахомов

Егор — Spark сontributor. Занимался интеграцией Spark в Яндекс Островах и Yandex Data Factory. Работает в AlpineNow, компания занимающаяся разработкой BI инструмента для Apache Spark.

Аннотация: На лекции рассматривается технология для batch и streaming обработки больших данных Apache Spark. Существует ряд проблем, с которыми инженеры сталкиваются, работая с большими данными: нехватки объёма диска одной машины для хранения данных, сложность разработки параллельных алгоритмов, etc. На протяжении долгого времени стандартом в индустрии для решения этих проблем являлся Hadoop, но ряд архитектурных недостатков этого фреймворка не позволяет ему справляться с новыми вызовами больших данных: machine learning, streaming, интерактивная работа с данными. Spark предложил новую вычислительную модель — RDD, в которой это всё стало возможно. Рассматриваются основные принципы этой модели и примеры кода. Важной частью любого big data framework является инфраструктура вокруг него. Обзорно рассматриваются основные библиотеки, написанные в рамках RDD: GraphX для графовой обработки данных, MLLib для machine learning, Spark Streaming для стриминга, SparkSQL, а также виды деплоинга spark кластера и тулы, облегчающие работу дата аналитиков.

Warning: foreach() argument must be of type array|object, null given in /home/user/web/mal.scrum360.ru/public_html/wp-content/themes/malitikov/single.php on line 44