Data Scientist (Специалист по обработке, анализу и хранению больших массивов данных)
Data Scientist (дата-сайентист или датасаентист) обрабатывает и анализирует массивы больших данных (Big Data), чтобы с использованием алгоритмов машинного обучения найти в них новые связи и закономерности и построить прогнозную алгоритмическую модель, которую можно использовать для решения задач бизнеса, науки, повседневной жизни. Профессия подходит людям с аналитическим складом ума и способностями к математике. Кстати, недавно центр профориентации ПрофГид разработал точный тест на профориентацию, который сам расскажет, какие профессии вам подходят, даст заключение о вашем типе личности и интеллекте.
Data Science – наука о данных на стыке разных дисциплин: математика и статистика; информатика и компьютерные науки; бизнес и экономика.
С. Мальцева, В. Корнилов. НИУ ВШЭ
Профессия новая, актуальная и чрезвычайно перспективная. Термин Big Data появился в 2008 году. А профессия Data Scientist – «учёный по данным» официально зарегистрирована как академическая и межотраслевая в начале 2010 г. Хотя первое упоминание термина data science было отмечено в книге Петера Наура 1974 г., но в ином контексте.
Профессия «Специалист по Big Data»

Работа с большими массивами данных, которые накапливаются и хранятся в компаниях, — современное, востребованное направление. Человек самостоятельно не в состоянии обработать большое количество информации. Для этого есть определенные программы, а вот с ними уже взаимодействуют специалисты. Кто и как работает в этой сфере, а также где учиться на аналитика данных, мы рассмотрим в статье.
Рекомендую посмотреть подборку специализированных программ: топовые курсы для аналитиков Big Data
Советую также обратить внимание на эти варианты: актуальные предложения курсов по аналитике больших данных (Big Data)
Специалист по Big Data: подробное описание и разбор
Big Data Analyst, или аналитик больших данных — это специалист, работает в области изучения больших массивов данных — структурированных и неструктурированных: банковские транзакции, телефонные номера в колл-центре, количество посещений клиента и сделанных им покупок и др. Аналитик больших данных ищет закономерности и связи между критериями в производственных процессах различных фирм. На основе этого анализа происходит разработка различных подходов и готовых решений в бизнесе в любых сферах. В своей работе специалист по анализу Big Data выполняет следующие функции:
- занимается сбором данных;
- выбирает, сортирует информацию для анализа;
- ищет закономерности в наборе данных;
- визуализирует данные, чтобы быстро понимать результаты и тенденции анализа;
- формулирует гипотезы по совершенствованию бизнес-процессов за счет изменений разных показателей;
- разрабатывает и тестирует различные модели машинного обучения;
- осуществляет анализ настроений (настраивает стимулы для улучшения клиентского сервиса).
Выполнение этих задач нужно, чтобы достичь основную цель — извлечь из больших массивов данных именно те сведения, которые помогут оптимизировать управленческие процессы.
Что должен знать и уметь специалист по Big Data
Профессионал в области обработки данных обладает следующими навыками:
- способен быстро разобраться в сфере, для которой проводит анализ данных;
- знает методики статистического анализа и умеет их применять;
- способен использовать в работе алгоритмы построение математических моделей;
- может извлечь и преобразовать данные из различных источников;
- владеет базовыми знаниями Python и командной строки Bash;
- имеет знания о фреймворках, способен применить их на практике;
- умеет работать с Data Lakes (озёрами данных);
- использует приемы цифровой безопасности;
- управляет данными (Data Governance);
- применяет типовые сценарии цифровой трансформации;
- использует технологии больших данных (use cases) в разнообразных областях.
Помимо этого, специалисту по работе с большими данными необходимо умение работать в команде, так как он взаимодействует с коллегами смежных направлений.
Личные качества аналитика больших данных
У специалиста по Big Data развиты следующие качества:
- аналитическое мышление,
- усидчивость,
- ответственность,
- внимательность к мелким деталям,
- пунктуальность,
- желание развиваться.
Также профессионалу важно уметь подолгу концентрироваться на выполнении одной задачи, так как она может потребовать много времени.
Плюсы и минусы профессии
Профессия аналитика Big Data, как и многие другие специальности, имеет позитивные и негативные стороны.
- востребованная профессия
- высокая зарплата
- возможность работать на фрилансе
- престижная специальность
- отлично подойдет любителям математики
- сидячая работа
- нагрузка на спину и зрение
- профессиональное выгорание
Зарплата в Москве и по России
Чтобы узнать, сколько зарабатывает специалист по работе с данными в Москве, ниже ознакомьтесь со скриншотом с сайта trud.com . На изображении представлены усреднённые данные:

По России в целом:

Согласно сайту hh.ru, для специалиста в области больших данных без опыта, но с багажом практических знаний, есть вакансии, даже от крупных компаний. Они отлично подойдут слушателям курса от Skillbox. Например, такое предложение от сети «Лента».

Зарплата не указана, но если специалист умеет правильно себя презентовать , можно договориться о хороших условиях.
С опытом работы от года соискатель может претендовать на зарплату от 70 тыс. рублей.

Высокая планка по зарплате начинается для специалистов с опытом работы от 3-х лет:

Специалист по базам данных может брать несколько проектов, работая на удалённом доступе. Это позволит расширить возможности для заработка.
Как стать специалистом по Big Data
Чтобы стать профессионалом в области обработки данных, можно поступить в ВУЗ на соответствующий факультет, но там изучается большое количество «ненужных» предметов и учёба займёт всё ваше время. После диплома вам придётся самостоятельно нарабатывать практический опыт, так как основной упор в ВУЗах идёт на теорию.
Есть другой способ освоить профессию аналитика больших данных: пройти онлайн-курс , за короткий срок научиться обрабатывать данные и начать зарабатывать уже во время обучения. Мы подобрали курсы для аналитиков big data — смотрите и выбирайте подходящий.
Курс «Big data для менеджеров» от ProductLive

Практический курс для топ-менеджеров и предпринимателей. Вы научитесь внедрять технологии искусственного интеллекта и больших данных для решения бизнес-задач. Вы освоите основные подходы к оцифровке бизнеса и поймёте, как спланировать проект и собрать команду, сформулировать и проверить гипотезы, оценить ресурсы и результат. Вы разберётесь в юридических аспектах работы с большими данными и научитесь презентовать проекты руководителю.
Срок обучения: 6 месяцев
Профессия «Data Scientist» от Skillbox

Практический курс для новичков, будет полезен программистам и начинающим аналитикам. Вы научитесь применять аналитические системы и алгоритмы машинного обучения для решения бизнес-задач, анализировать данные на Python и обрабатывать статистику и графики на языке R. Вы поймёте, как формировать и тестировать бизнес-сценарии и сможете давать рекомендации по развитию бизнеса.
Срок обучения: 12 месяцев
Профессия «Дата-инженер с нуля до PRO» от Нетологии

Курс для новичков, но подойдёт администраторам и разработчикам. Вы узнаете, как автоматизировать работу с данными и сможете создавать конвейеры обработки и схемы хранения данных. Вы научитесь обрабатывать события в режиме реального времени, пояснять и обогащать данные отчётов, дашбордов и других источников информации, строить работающий пайплайн в облачной среде и включать в него модели машинного обучения.
Срок обучения: 12 месяцев
Подробнее об этих курсах читайте в нашей подборке
лучших курсов для аналитиков Big Data
Если вас заинтересовала профессия — ставьте плюс в комментариях, расскажем, как в ней легко стартануть.
Data Scientist – работа настоящего и будущего

Специалисты по данным последние годы становятся все востребованнее. А количество данных, с обработкой и визуализацией которых не справляется простой разработчик – все больше. Множество сервисов и программ собирают данные, которые можно использовать для поиска решений, составления прогнозов и аналитики. И для работы с ними нужны профильные специалисты. Разбираемся, кто такой Data Scientists, чем он занимается и как им стать.
Кто такой Data Scientist?
Давайте начнем наше знакомство с профессией с области, в которой работают Data Scientists. Data Science – это наука о данных, которая занимается изучением данных, их анализом различными методами и последующим преобразованием данных в полезные знания. Раньше обработать данные человек мог вручную, но сейчас их количество стало настолько огромным, что для обработки часто требуется искусственный интеллект. Поэтому наука активно взаимодействует с машинным обучением, математикой, статистикой и анализом данных.
Нас постоянно окружают результаты работы Data Scientists, например, мы ежедневно смотрим прогноз погоды, реклама предлагает нам определенные товары, авиасервисы прогнозируют стоимость билетов, врачи с помощью программ могут предсказать диагнозы, а голосовые помощники выполняют множество наших просьб. Всем этим и многими другими вещами управляет специалист по данным. Data Scientist – это специалист, который занимается поиском закономерностей в больших массивах данных, анализирует и хранит их. Профессия Data Scientist считается одной из самых высокооплачиваемых и сложных в мире ИТ.
Стоит обратить внимание на то, что Data Science стала неотъемлемой частью будущего. Сейчас ее активно используют в стартапах, IT компаниях, различных бизнесах, чтобы предоставлять наиболее точные данные и прогнозы, быть ближе к пользователю, автоматизировать свои решения и повысить маржинальность бизнеса.
Спрос на Data Scientists ежегодно растет. Например, по информации веб-сайта по поиску работы Indeed, за 2019 год вакансий Data Scientists стало на 29% больше.
Data Scientists постоянно ищут паттерны и тренды в огромных наборах данных, используя многообразные тулы, техники и критическое мышление, чтобы найти практическое решение для реальных data-centric проблем. Давайте подробнее поговорим о том, что входит в обязанности специалистов по данным.

Чем занимается специалист Data Science?
Задачи специалиста по данным:
- находит скрытые закономерности и связи во время изучения данных;
- анализирует данные по необходимому критерию, который покажет эффективность создаваемой модели;
- визуализирует данные;
- программирует и тренирует модель машинного обучения;
- оценивает с коллегами модель с точки зрения экономики;
- выявляет богатые источники данных, присоединяется к ним с другими потенциально неполными источниками данных и очищает полученный набор;
- анализирует риски;
- анализирует внутренние процессы;
- занимается внедрением моделей в существующие инфраструктуры;
- дорабатывает модель и следит за процессами;
- предлагает новые направления для развития бизнеса клиента;
- занимается разработкой отчетов и прогнозированием;
- консультирует руководителей и менеджера по продукту, основываясь на полученных данных.
Благодаря работе Data Scientist бизнес принимает правильные решения и опережает своих конкурентов, продукты становятся ближе к пользователям, а жизнь людей становится удобнее.
Чтобы специалистам по обработке и управлению данными преуспеть в этой области, им часто недостаточно быть эффективными просто в преобразовании массы неструктурированных данных в форму, удобную для анализа. Желательно также уметь анализировать сами обработанные объемы данных, проводить фактический анализ.
Data Scientist не равно Data Engineer
Часто в разговорах о Data Scientist упоминают и Data Engineer? Нужно понимать, что это не одно и тоже.
Data Engineers обеспечивают на проектах качественную инфраструктуру данных и уделяют внимание интеграции, моделированию, оптимизации и качеству данных. Эти специалисты влияют и на прикладные программы в оперативном контексте в области аналитики, микросервисной архитектуры и операционной аналитики. Получается, что Data Engineers разрабатывают, тестируют и поддерживают инфраструктуру данных, а также занимаются данными: их очисткой, обработкой и трансформацией. Уже очищенные данные попадают к аналитикам и Data Scientists.
У двух специалистов разные цели: Data Engineers работают над созданием пайплайна обслуживания алгоритма машинного обучения. А Data Scientists проверяют гипотезы в системе данных, и пишут алгоритмы. Оба специалиста хотят сделать данные доступными и качественными и часто работают вместе. Отсюда и постоянная путаница в их обязанностях и ответственности.
Так, Data Scientists извлекают инсайты из данных для стратегии компании, принятия решений и внедрения алгоритмов. А Data Engineers работают в команде над тем, чтобы повысить продуктивность аналитиков и быть связующим звеном между разными участниками разработки ПО.
Говорят, чтобы стать Data Science специалистом нужно постоянно учиться, но так можно сказать про многие профессии. Давайте разберемся, какие знания вам пригодятся в этой профессии, если вы только в нее попали, а также если вы уже работаете на позиции junior и планируете расти.

Что должен знать начинающий Data Scientist?
- Программирование.
Data scientist должен уметь писать код. Специалист по данным занимается написанием модели для оценки гипотез, аналитики или оценки данных. Этого никак не сделать без знаний основных языков программирования, применяемых в области Data Science. Вам пригодятся знания:
- Java, Hive для работы с Hadoop;
- Python – его основы и понимание того, как работать с ним в анализе данных. Также познакомьтесь с инструментами Matplotlib, Numpy, Scikit, Skipy;
- SQL – для извлечения данных;
- C++ с инструментами BigARTM, Vowpel Wabbit, XGBoost;
- языка R, который пригодится для расчетов статистики.
- Математика.
Аналитик данных должен пройти курсы математического анализа, математической статистики, линейной алгебры, а также знать, что такое теория вероятности. Эти знания пригодятся, для того чтобы составлять прогнозы, работать над поиском закономерностей и построением математических моделей.
В математическом анализе вам понадобятся производные, правило дифференцирования сложной функции и градиенты. Описательная статистика, планирование эксперимента и машинное обучение нужно будет изучить в курсе математической статистики. Линейная алгебра нужна для понимания механизмов машинного обучения, там обратите внимание на векторы и пространства, матричные преобразования.
- Машинное обучение.
Без него в вашей работе никуда. Машинное обучение нужно для создания новых моделей и переобучения существующих. Также оно связано не только с искусственным интеллектом, но и с генетическими, эволюционными алгоритмами, кластерными задачами и так далее. Благодаря машинному обучению работа Data Scientist с большими объемами данных становится эффективной.
- Deep Learning.
Чтобы руководить проектами машинного обучения, вам нужно будет разобраться, как устроены нейронные сети и изучить основы глубокого обучения.
- Специфику домена.
Для того чтобы понимать, как работает продукт и создавать подходящую модель, необходимы знания о домене, в котором вы работаете. Data Scientists трудятся во всевозможных отраслях, самыми популярными из которых являются маркетинг, здравоохранение и экономика. Если у вас нет нужных профильных знаний заранее, не переживайте, вы точно приобретете их на проекте.
- Английский язык.
Обязательный пункт для любой специальности в ИТ. Английский пригодится вам в работе при общении с зарубежными клиентами и коллегами в многонациональной команде. Также вы столкнетесь с английским во время работы с различными фреймворками и технологиями, и в своем развитии: много технической литературы выпускается только на английском языке.
Если вы уже работаете в Data Science, то наверняка знакомы со всеми этими требованиями. Для опытных аналитиков данных они, конечно же, другие.
Требования к опытному специалисту по данным
Некоторые специалисты описывают успешного Data Scientist как хакера, аналитика, коммуникатора или доверенного консультанта. Давайте разберемся, какие скиллы вам пригодятся.
Кроме hard skills, которые мы описывали выше, вам нужно иметь:
- Опыт разработки моделей машинного и глубинного обучения с фреймворками Hadoop, TensorFlow, Keras, PyTorch, Scikit-Learn, Pytorch, MLLib и другими;
- Глубокие знания одной из областей обучения по прецедентам Machine Learning;
- Опыт работы с SQL и инструментами BigData, как Spark/Hive;
- Опыт работы с инструментами визуализации Pandas, Matplotlib, Seaborne.
Конечно, работа в команде требует развитых гибких навыков для Data Scientist. Давайте рассмотрим, какие навыки вам помогут.
Soft skills для Data Scientist
- Ассоциативное мышление.
- Способность излагать свои мысли так, чтобы их понял другой человек.
- Любопытство для погружения в проблему и дальнейшей работы с гипотезами.
- Умение находить эффективные решения проблем.
- Внимательность.
- Умение работать в команде и находить подход к каждому.
- Умение задавать хорошие вопросы.
- Дотошность.
- Умение визуализировать данные.
С требованиями и навыками разобрались. А теперь давайте узнаем, какие нам пригодятся курсы, видео и материалы, чтобы развиваться в Data Science?

Полезные для развития материалы
Книги:
- Учебник “Машинное обучение. Наука и искусство построения алгоритмов, которые извлекают знания из данных”, Петер Флах. Книг на русском языке мало, учебник достойный вариант для погружения в машинное обучение.
- Тем, кто только погружается в тему, пригодится книга “Математический анализ” Липмана Берса.
- “Наука о данных. Базовый курс”, Джон Келлехер, Брендан Тирни. Книга Массачусетского технологического института познакомит вас с базой науки о данных.
- Книга “Machine Learning: A Bayesian and Optimization Perspective” Сергиос Теодоридис.
Онлайн-ресурсы:
-
. Там вы найдете много публичных дата-сетов, которые грех не опробовать в домашней практике по машинному обучению. с лекциями по машинному обучению профессора Меллона университета Карнеги. Можно включить русские субтитры.
- На Хабре можно найти много интересных материалов по тегам Data Mining, Data Science и Big Data. Советуем, заглянуть и почитать.
- Плейлист Deep Learning Семена Козлова, разработчика стартапа Instrumental, бывшего сотрудника Dropbox и Microsoft. курса по машинному обучению с Юрием Кашницким. машинного обучения от Яндекса. Внутри есть главы, можно скачать pdf, посмотреть презентации, видео и сделать упражнения.
Курсы:
-
. На ресурсе много курсов по анализу данных, в котором есть подразделение на теорию вероятности, статистику и машинное обучение.
- Google. У платформы есть сайт, который полностью посвятили машинному обучению и искусственному интеллекту. Там вы найдете много полезного. Также предлагаем обратить внимание на курс Machine Learning Crash Course от Google. . Образовательная платформа предлагает несколько десятков программ по машинному обучению, например. . Бесплатный курс от Stepik. – курс, который поможет разобраться в статистике.
Возможно ли, изучив все материалы и требования, найти работу как junior Data scientist? Как стать Data Scientist и нужно ли на него учиться в вузе? Разберемся дальше.
Где учиться на Data Scientist?
Для того чтобы работать Data Scientist, желательно иметь высшее техническое образование. Мы уже говорили, что для освоения профессии пригодятся математика и программирование, а на гуманитарных специальностям эти дисциплины, увы, не изучают. Но не стоит опускать руки, на самом деле в мире много известных профессиональных Data Scientists, которые оканчивали вуз с гуманитарным уклоном. Поэтому при большом желании можно пойти на специализированные курсы, где вас сначала познакомят с математикой, затем с программированием, и все получится.
В вузах Беларуси нет факультета, который целенаправленно готовит Data Science специалистов, но многие из них приходят в профессию с прикладной математики и информатики. На ФПМИ БГУ однако есть магистратура по профилю “Алгоритмы и системы обработки больших данных”. Поэтому советуем вам обучиться на одном из математических факультетов, чтобы дальше вам было проще вливаться в профессию.
Не стоит забывать о практике. Благо такая возможность есть у всех на платформе Kaggle. Там регулярно проводятся соревнования по машинному обучению. Информацию об участии в таких соревнованиях можно смело вносить в резюме. Также рекомендуем вам присоединиться к сообществу Open Data Science, у которого есть свои проекты, конференции, курсы и соревнования.

Как пройти собеседование специалиста Data Science?
- У вас должен быть опыт.
Даже если вы начинающий Data Scientist, вы должны показать, что уже умеете работать с данными и участвовали в соревнованиях, делали что-то сами и принимали участие в хакатонах. Так работодатель поймет, что вы увлечены профессией, готовы развиваться, уже умеете работать в команде и применять знания.
- Вы должны будете ответить на вопросы про машинное обучение и статистику.
- Разработка ПО: массивы, хэш-таблицы, всевозможные алгоритмы, связные списки, бинарный поиск, рекурсия.
- Прикладная статистика: теория вероятности, описательная статистика, регрессии, проверка гипотез, байесовский вывод.
- Машинное обучение: метрики классификации, регрессии, выбор статистической модели, переобучение, смещение-дисперсия, сэмплирование, проверка гипотез, модели классификации, модели кластеризации, регрессионные модели.
- Обработка и визуализация данных: организация, профайлинг, визуализация, обработка, стандартизация, нормализация.
- Глубинное обучение.
- Языки программирования.
- Записывайте, что вы изучали и приходите уверенным в своих знаниях.
Надеемся, что профессия Data Scientist стала вам ближе и интереснее, а наш материал поможет вам стать лучше и ближе к своей цели. Желаем, успехов! А также приглашаем на собеседование в департамент Data & Analytics ISsoft. Если вы начинающий специалист без опыта работы, приглашаем на курсы IT, организованные на базе нашей компании.
Работа в Data Science: что важно знать и как этому научиться
Сегодня словосочетания вроде Data Science, Machine Learning, Artificial Intelligence очень популярны. При этом нередко под ними понимаются довольно разные вещи. Это зачастую смущает и запутывает людей, желающих войти в специальность: трудно разобраться, с чего начать, что действительно нужно, а что необязательно для начала. Не претендуя на общность, расскажем, как это видится на основе десятка лет опыта c решением такого рода задач для крупных клиентов со всего мира (сервис / заказная разработка / аутсорс – подставьте термин по вкусу).

Источник: https://timoelliott.com/blog/quick-somebody-find-me-a-data-scientist-jpg
Data scientist – кто такой, что умеет?
В наших реалиях data scientist – это человек, решающий бизнес-проблемы заказчика, опираясь на нетривиальные манипуляции с данными. Такая работа требует различных навыков, которые можно примерно разделить на три большие группы:
Математика и машинное обучение
Soft skills: коммуникация, презентация, английский
Технические: программирование, базы данных, облачные технологии и т.п.
Конечно, необходимо погружаться и в предметную область, но в каждом проекте она своя, поэтому абстракная подготовка вряд ли имеет смысл. Есть и общие для бизнеса соображения, которыми важно овладеть, хотя для начального уровня это менее актуально.
«А может, сразу к сеточкам?»
Обычно начинающие больше внимания уделяют машинному обучению и особенно нейронным сетям, что вполне объяснимо: эти области кажутся более «крутыми» и привлекательными. Ну и, конечно, делать что-то прикольное (например, отличать тех же котиков от собачек, хоть бы и по шаблону) намного веселее, чем разбираться с основами. Тем более, что доступность инструментов, решений и примеров создает впечатление, что задачи решаются достаточно легко, надо лишь найти подходящий образец. Такой подход (грубо говоря, copy-paste) вполне возможен и даже работает, пока не перестаёт. А вот чтобы понять, что сломалось и как чинить (не говоря уже о создании чего-то нового), требуется фундаментальное понимание идей и механизмов, основанное на математической базе.
Матан и его друзья
Необходимый минимум математических знаний выглядит вполне посильно:
Начала анализа: пределы, дифференцирование, интегрирование (без фанатизма)
Линейная алгебра: операции над матрицами, ранг, определитель, собственные вектора и значения, сингулярное разложение
Вероятность и статистика: случайные величины и их распределения, характеристики распределений, условная вероятность и формула Байеса, предельные теоремы, основные понятия статистики, оценка параметров и проверка статистических гипотез
Конечно, это лишь базовые темы, более глубокие и/или широкие знания будут полезны, но для старта хватит и этого.
«Что, еще и кодить?»
Ещё более недооценённым навыком для data scientist кажется программирование. Распространено мнение, что анализ данных и построение моделей сводятся к библиотечным вызовам, для которых особой квалификации не нужно. Наш опыт эту точку зрения не подтверждает: даже для достаточно типичных задач большая часть работы – это манипуляции с данными (зачастую весьма нетривиальные), что уж говорить о нестандартных проблемах.
Если переходить к конкретным языкам, это, конечно, в первую очередь Python. R в наши дни все же достаточно нишевый инструмент, MATLAB – тем более. Julia пока что не слишком популярная штука. Где-то можно встретить Java, C++ или Lua, но это, скорее, исключения.
«Python? Там же все понятно!»
Следует отметить, что Python при всей своей простоте всё же требует определенных знаний и навыков, чтобы писать хороший идиоматичный код и избегать подводных камней. Понимание алгоритмов и структур данных тем полезнее, чем более нестандартные задачи вы решаете. Ну и, разумеется, необходим собственно навык программирования (способность быстро преобразовать идею в грамотный код).
Из питоновских библиотек в обязательную программу входят numpy и pandas. Там тоже хватает нюансов для вдумчивого освоения (особенно если данных становится побольше, а трансформации – позатейливее).

Источник: https://xkcd.com/2054/
«И это еще не все?»
Само собой, важных технических областей намного больше. В некоторых проектах необходимо знание SQL (и вообще навык программирования в декларативной парадигме много где может пригодиться). Облачные вычисления давно уже норма, а не экзотика. Да и Big Data – это не просто модное словосочетание, а вполне востребованный комплекс технологий (если говорить о конкретных инструментах, это чаще всего Spark). Если есть время и желание, изучить все это будет полезно, но начинать работать можно и просто с устойчивым навыком программирования на Python (плюс numpy/pandas, конечно).
«Но теперь-то уже к сеточкам, правда?»
Что касается машинного обучения, сейчас многие сразу принимаются за нейронные сети. Это возможный подход, да и само по себе глубокое обучение практически незаменимо в работе с текстами или изображениями. Однако базовые вещи эффективнее разбирать на более простых моделях. Важно хорошо понять, что из себя представляет собственно задача обучения, переобучение и методы борьбы с ним, способы оценки предсказаний. Ну и, конечно, разобраться с классическими подходами: kNN, линейными моделями, деревьями и их ансамблями, а также методами кластеризации и понижения размерности. Этого уже будет достаточно для решения целого ряда задач (тем более, что на практике нейронные сети нечасто показывают лучший результат на структурированных данных, требуя при этом радикально больше ресурсов).

Источник: https://www.meme-arsenal.com/create/meme/6070052
Это отнюдь не значит, что глубокое обучение вредно для начинающих. Проблема в том, что часто люди начинают разбрасываться, перебирая модные архитектуры, при этом толком их не понимая (что естественно при нехватке фундаментальных знаний). Конечно, основательное и последовательное освоение предмета будет очень полезно, но на это, увы, мало у кого хватает времени и дисциплины.
«А вот я еще слышал про. »
Есть немало других тем (например, исследование операций, рекомендательные системы, ассоциативные правила и т.д.), которые необходимы в соответствующих задачах, а также достаточно интересны и поучительны сами по себе, но для старта как правило необязательны.
Ну и, last but not least, то, про что нередко забывают вообще: навыки коммуникации, визуализации и презентации. Важно понимать, что работы с людьми в этой профессии лишь немногим меньше, чем с данными, и объяснить результат зачастую не менее важно, чем его получить. Само собой, поскольку многие заказчики по-русски не понимают, английским надо владеть на достаточном уровне.

Источник: https://timoelliott.com/blog/2016/02/cartoon-data-story-telling.html
«Мыши, станьте ежиками!»
Все и сразу?
Многих привлекает идея получить нужные знания и навыки «пакетом» записавшись на курсы по data science. Увы, не все из них одинаково полезны. Условно курсы можно разделить на три группы:
Где компании зарабатывают на учащихся
Где компании ищут себе сотрудников
Как правило, во втором случае обучение будет заметно серьезнее (хотя и отбор строже).
Иногда спрашивают и об университетских программах (благо, сейчас несложно найти варианты удаленного обучения как на русском, так и на английском). Безусловно, надо внимательно смотреть на каждый конкретный случай, но в целом это скорее имеет смысл, если по каким-то причинам важен именно диплом. В наше время бесплатно доступны материалы ведущих мировых университетов (уровня Stanford и MIT), так что если в приоритете собственно знания, можно как минимум не хуже подготовиться самостоятельно (конечно, при наличии достаточной мотивации и самодисциплины). Для многих работодателей «корочки» глубоко вторичны: если человек знает и умеет то, что нужно в работе, какая разница, что он заканчивал? Ну а если нет – тем более. Конечно, сертификат Stanford Graduate Program может вызывать уважение, но если вы действительно к такому готовы, непонятно, зачем вы досюда дочитали.
Также надо понимать, что практически никакой курс сам по себе не гарантирует вам реальной квалификации и успешного трудоустройства (доводилось встречать людей, которым и ШАД не впрок, и полученная в западноевропейском ВУЗе степень PhD не помогает).
Как есть слона
Для тех, кто готов осваивать нужные темы самостоятельно, порекомендуем некоторые материалы. Конечно, список этот далеко не полон, и если вам нравится что-то другое – отлично, при условии, что это дает вам необходимые знания и навыки. Все ресурсы на английском (если вам трудно их воспринимать, значит в первую очередь нужно подтягивать язык – это заметно дольше и сложнее, чем разобраться с нейронными сетями). Какие-то из них есть и в переводе, но не всегда можно быть уверенным в его качестве. Ну и, естественно, владение англоязычной терминологией очень поможет в чтении статей, когда доберетесь от классических вещей до переднего края прогресса.
Кодил, кожу и буду кодить
Хрестоматийной книгой по Python считается Learning Python, хотя, конечно, с выхода последнего издания утекло много воды. Те, кто уже знаком с основами языка, могут предпочесть что-то вроде Clean Python. Если с программированием как таковым опыта немного, важно набить руку (например, на сайтах вроде https://www.hackerrank.com/, https://leetcode.com/, https://exercism.org/ и т.п.).
По numpy и pandas очень достойно выглядит книга «от создателей»: Python for Data Analysis. Потренироваться можно тут: https://github.com/guipsamora/pandas_exercises.
Если замахнетесь на алгоритмы и структуры данных, очень неплох курс Принстонского университета (правда, на Java, хотя освоение этого языка в достаточном для курса объеме не должно занять много времени): https://www.coursera.org/learn/algorithms-part1. Кому лучше заходят книжки, может прочитать первые пять глав из Grokking Algorithms. Есть материалы и для Питона: https://runestone.academy/runestone/books/published/pythonds/index.html. Однако в любом случае эта область кажется менее приоритетной (то есть, наличие знаний по теме будет полезно, но отсутствие вряд ли окажется решающим, если в остальном всё хорошо).
«Сколько выучить формул?»
Говоря о математической базе, стоит начать с линейной алгебры. Базовые представления можно получить тут: https://programmathically.com/linear-algebra-for-machine-learning/. Если захочется чуть углубиться, подойдут первые семь глав из книги No Bullshit Guide to Linear Algebra.

Источник: https://mathwithbaddrawings.com/2018/03/07/matrix-jokes/
Не менее важны основы анализа. Для начала хватит вот этого: https://programmathically.com/calculus-for-machine-learning/. Желающим разобраться, почему и как, можно порекомендовать книгу Calculus Made Easy.
Для знакомства с теорией вероятностей и математической статистикой достаточно будет следущих материалов: https://programmathically.com/probability-and-statistics-for-machine-learning-and-data-science/. Наглядно некоторые вопросы разобраны тут: https://seeing-theory.brown.edu/.
Если вам ближе ваши университетские конспекты – замечательно, только стоит убедиться, что все упомянутые выше темы ими охвачены.

Источник: https://xkcd.com/552/
Важно, чтобы на выходе было глубокое понимание базовых вещей. В порядке самопроверки можно попробовать не глядя в материалы объяснить себе или другому, что там и, главное, почему. Так, например, намного лучше не помнить навскидку формулу Байеса, но при этом быть в состоянии её вывести, чем наоборот.
Ng or not Ng?
Вводных материалов по машинному обучению много. Для понимания базовых идей и подходов очень хорош стэнфордский Statistical Learning (тут можно найти и книгу, и видеокурс: https://www.statlearning.com/). Единственный существенный минус – практические задания на R (есть смысл делать их на Python – как раз хорошее упражнение получится). Какое-то время был очень популярен Эндрю Ын (Andrew Ng) со своим Machine Learning. Содержание актуально до сих пор, а в обновленной версии курса MATLAB / Octave заменили на Python. Также можно отметить очень подробное объяснение базовых вещей, что для условных гуманитариев несомненный плюс, а вот людям с математической подготовкой может показаться избыточным.
Переходя от идей и подходов к их актуальной реализации, полезно проработать книгу Hands-On Machine Learning with Scikit-Learn, Keras, and TensorFlow. Для начала можно ограничиться первой частью, но упражнения пропускать не стоит.
Для закрепления навыков хорошо подойдет mlcourse.ai (в первую очередь именно как набор практических задач).
Если решите охватить и нейронные сети, можно начать с Deep Learning Specialization от того же Ына. Но, повторимся, лучше более основательно освоить классические методы.
Практика на Kaggle тоже будет полезна. Представляется разумным выбирать соревнования со структурированными данные не слишком большого объема, чтобы поменьше отвлекаться на технические сложности. Tabular Playground Series – отличный вариант для начала.
Хотя, безусловно, целый ряд важных в работе аспектов Kaggle не покрывает. Если интересно получить о них представление, можно почитать книги, освещающие вопросы бизнеса и коммуникации, например, Data Science for Business и Storytelling with Data. Однако для начального уровня это, скорее, факультативные вещи.

Источник: https://timoelliott.com/blog/2016/02/cartoon-data-story-telling.html
«А вдруг это не мое?»
В заключение хотелось бы отметить, что связанные с data science проекты подразумевают целый спектр ролей, а не просто условных data scientists. Так, например, востребованы data BA и data DM (бизнес-аналитики и менеджеры с глубоким пониманием специфики работы с данными и машинным обучением), data QA (тестирование различных аспектов обработки данных, включая и прогнозные модели), ML engineer («продукционализация» запрототипированных решений), MLOps (тут вообще можно встретить широкое разнообразие трактовок) и т.д. Так что если по ходу освоения предложенных материалов вам заметно более привлекательной покажется какая-то конкретная область, это не значит, что data science не для вас. Скорее, наоборот: есть неплохие шансы найти интересную вам нишу, особенно в крупных компаниях / проектах.

Источник: https://me.me/i/i-know-machine-learning-83cc8d4b173a47a3991085f3146cc360