Получи случайную криптовалюту за регистрацию!

DataEng

Логотип телеграм канала @dataeng — DataEng D
Логотип телеграм канала @dataeng — DataEng
Адрес канала: @dataeng
Категории: Технологии
Язык: Русский
Количество подписчиков: 2.37K
Описание канала:

Канал про Data Engineering & Distributed Systems.
Всё, что вы хотели знать про построение инфраструктуры для хранения, обработки и эффективного анализа гигантского объёма данных.
Автор @adilkhash

Рейтинги и Отзывы

2.50

2 отзыва

Оценить канал dataeng и оставить отзыв — могут только зарегестрированные пользователи. Все отзывы проходят модерацию.

5 звезд

0

4 звезд

0

3 звезд

1

2 звезд

1

1 звезд

0


Последние сообщения 7

2021-11-11 17:58:08 Компания Altinity (та, которая теперь активно развивает ClickHouse) 2 ноября провела конференцию под названием Open Source Analytics Conference, в качестве спикеров были такие звёзды как Maxime Beauchemin, Andy Pavlo, Пётр Зайцев. Доклады уже доступны в сети бесплатно и без смс.

Наиболее заметные:

— Analytic Trends & Data Engineering
— Do We Still Need People To Write Database Systems?
— Distributed Tracing Using ClickHouse at eBay
— Data Rivers — The New Analytics Architecture
— Managing Transactional and Analytical Workloads with Open Source Databases
— Effective Dashboard Design Using Apache Superset
— Succeeding with Apache Druid and Clickstream Data
1.0K views14:58
Открыть/Комментировать
2021-11-01 19:55:25 Откопал свежее видео про Dagster от его автора на очередном митапе:


У меня никак руки не дойдут его пощупать, уж больно привлекательно он выглядит. Есть кто уже пробовал его в деле?
639 views16:55
Открыть/Комментировать
2021-10-29 14:08:05 Неплохой гайд по подготовке к интервью по SQL с примерами от «Тамби Масаева»:

777 views11:08
Открыть/Комментировать
2021-10-27 15:51:52
LAST CALL

11 ноября в robot_dreams стартует курс для начинающих BI-аналитиков, data-/product-аналитиков и SQL-разработчиков, которые хотят научиться проектировать Data Warehouse и предлагать бизнес-решения на основе аналитики.

После курса вы:
пишете и оптимизируете SQL-запросы;
проектируете хранилища данных разных типов в зависимости от задач;
умеете управлять данными и разбираетесь в отличиях ETL- и ELT-подходов;
визуализируете результаты анализа и собираете данные в понятные дашборды;
находите аномалии в данных, валидируете гипотезы и делаете прогнозы для бизнеса.

В результате ― получите полный стек знаний и навыков для развития в BI-аналитике и BI-разработке.

Чтобы зарегистрироваться на курс, перейдите по ссылке и заполните форму
https://bit.ly/2ZwUUUN
880 views12:51
Открыть/Комментировать
2021-10-21 11:31:20 На сайте ain вышла небольшая обзорная статья про дата-инженеров: http://bit.ly/article_for_dataenginners3
В ней есть краткое описание кто такие дата-инженеры, чем они занимаются, а также небольшая подборка полезных ресурсов откуда можно почерпнуть дополнительные знания. В этом списке в том числе есть ссылка и на мой канал
707 views08:31
Открыть/Комментировать
2021-10-19 11:00:36 ​​Компания Wunder Fund ищет дата инженера/питониста в свою команду. Мы занимаемся высокочастотной алгоритмической торговлей на биржах по всему миру последние 7 лет.

Для того, чтобы у наших квантов была возможность тестировать свои торговые идеи, им необходимы исторические данные торгов. Эти данные мы собираем в несколько этапов. Сначала онлайн, прямо во время торгов, сохраняем данные максимально надежным и простым способом. Данные с разных бирж приходят в разных форматах, они могут быть очень разными. Поэтому после сохранения мы ежедневно преобразовываем данные в наш внутренний единый формат. После этого качество полученных данных проверяется по множеству параметров специальной программой-чекером.

Мы постоянно выходим на новые биржи, и у каждой биржи есть свои особенности в данных. А старые биржи систематически делают изменения в своих форматах, и они должны быть отражены в нашем софте. Нам нужен человек, который возьмет на себя работу по поддержке уже существующих пайплайнов обработки и разработке новых.

✦ Пишите за подробностями @georgy или сразу открывайте нашего бота — в нем будут подробности и короткий тест знаю/не знаю, для того, чтобы оценить, насколько мы друг другу подойдем.
665 views08:00
Открыть/Комментировать
2021-10-12 11:29:27
Вебинар Бесплатный ML Space на базе инструментов Intel oneAPI для всех желающих.

У нас отличные новости, инструменты Intel oneAPI на облачной платформе ML Space стали доступны для физических лиц. Это значит, что любой желающий может бесплатно использовать набор программных инструментов для ускорения машинного обучения, анализа данных, разработки ПО.

На вебинаре вы узнаете:

— подробности об инструментах Intel oneAPI;
— сценарии применения этих инструментов для построения ML-моделей;
— как получить бесплатный доступ к инструментам на платформе ML Space.

Вебинар будет полезен всем, кто интересуется data science.
Регистрируйтесь по ссылке.

Вебинар пройдёт — 14 октября 2021, четверг, 12:00

*SberCloud — облачный провайдер услуг и сервисов для физлиц, бизнеса и государственных организаций.
550 views08:29
Открыть/Комментировать
2021-10-11 13:42:15 Ребята из Notion поделились личным опытом шардинга PostgreSQL: https://www.notion.so/blog/sharding-postgres-at-notion

Шардинг это всегда про компромисс. PostgreSQL из коробки не умеет в шардинг, поэтому зачастую реализация подразумевает участие самого приложения в распределении данных между шардами. Шардинг это всегда индивидуальный подход для конкретного приложения. Не существует универсального способа реализации шардинга для всех. Индивидуальный подход подразумевает понимание предметной области приложения, моделирования данных и нагрузки.

Я не так давно шардировал PostgreSQL с 1 жирной ноды на 32 физических сервера. Безусловно получили колоссальный буст в производительности запросов, клиенты довольны, но ценой усложнения архитектуры (мониторинг, репликация данных, избыточность и т.д.). Не говоря уже про решардинг данных в случае добавления новых узлов в кластер баз.

Если вам интересно как в Notion моделируют данные, то читайте https://www.notion.so/blog/data-model-behind-notion. Центральной сущностью является Block за которым следует всё остальное.
558 viewsedited  10:42
Открыть/Комментировать
2021-10-10 17:16:01 Прошла небольшая конференция по data engineering — DataEngBytes 2021. Я собрал список наиболее интересных докладов:

- What is a Data Mesh - And How Not To Mesh it Up
- Data Quality with Great Expectations and Airflow in a Reverse-ETL World
- Shift-left testing : Building reliable Data Pipelines
- Data quality: the key to long term happiness
- Reliable data engineering made easy
- Data quality: the key to long term happiness
- Gone Streaming: dbt+Materialize
- Streaming data analytics with Apache Flink

Сам ещё не всё посмотрел, список формировал по привлекательности названия докладов Учтите, что среди докладчиков есть представители data-компаний (Databricks, Materialize, Monte Carlo Data и т.д.), так что слушайте с небольшой толикой скептицизма к их словам
420 viewsedited  14:16
Открыть/Комментировать
2021-10-10 10:58:23 Интересный keynote от создателя Apache Airflow про тренды в области data engineering:


Также Макс вскользь упоминает 2 своих статьи:

The Rise of the Data Engineer
https://www.freecodecamp.org/news/the-rise-of-the-data-engineer-91be18f1e603/
The Downfall of the Data Engineer https://maximebeauchemin.medium.com/the-downfall-of-the-data-engineer-5bfb701e5d6b

Смотреть удобно на скорости ×1.25, ×1.5
590 views07:58
Открыть/Комментировать