World Wide GRID- — будущее уже рядом
ХXI век, возможно, станет эпохой массового внедрения грид-технологий. Счастливое человечество стоит на пороге очередной компьютерной революции, в результате которой произойдет трансформация привычного для нас сегодня WWW (World Wide Web — интернета) в WWG (World Wide GRID — всемирную грид-сеть).
Магическая грид-среда, способная виртуализировать процессоры, память и коммуникации, обещает превратить все компьютерные ресурсы мира в своего рода гигантский мультипроцессор, обладающий практически неограниченными вычислительными возможностями.
Информатизация сегодня выходит на четвертый этап своего развития. Первый был связан с появлением больших компьютеров (мейнфреймов), второй — с персональными компьютерами, третий — с появлением интернета, объединившего пользователей в единое информационное пространство. Первое же десятилетие XXI века, по мнению многих специалистов, знаменуется началом перехода на новые грид-технологии.
Впрочем, конкретные формы и механизмы этого «великого перехода к WWG» пока еще четко не определены. Среди апологетов грид-технологий до сих пор нет единства взглядов относительно того, будет ли WWG создан на базе уже существующих интернет-мощностей или же вообще «в чистом поле» — как универсальная система эмуляции персональных компьютеров, пользователям которой не потребуется ни полнофункционального компьютера, ни собственного программного обеспечения. Масса нерешенных вопросов остается и в области стандартизации протоколов, интеграции разнородных вычислительных ресурсов, обеспечения безопасности хранения и передачи данных.
Суперкомпьютер из розетки
Грид-компьютинг начал формироваться прежде всего как интегратор вычислительных ресурсов для решения различных «ресурсоемких» научных задач. Идея более эффективного использования вычислительных мощностей путем соединения множества компьютеров в единую структуру возникла в научном сообществе сравнительно давно — в эпоху мейнфреймов (больших ЭВМ). Уже в 80е годы ученые (прежде всего физики-ядерщики) для решения сложных математических задач пытались комбинировать друг с другом различные рабочие станции и использовать свободные центральные процессоры для сокращения времени обработки.
В 1994 году стартовал проект создания всемирной компьютерной сети GLORIAD (аббревиатура от Global Ring Network for Advanced Application Development, Глобальная кольцевая сеть для развития прикладных исследований) — волоконно-оптического кольца в Северном полушарии, объединяющего вычислительные ресурсы различных научно-исследовательских организаций США, Канады, Европы, России, Китая и Южной Кореи (опять-таки главным образом физических центров). Россия присоединилась к этому проекту в 1996 году, и сегодня нашу страну в нем представляют Российский научный центр «Курчатовский институт» и Российский НИИ развития общественных сетей.
Тем не менее формально авторами концепции грид считаются Ян Фостер из Арагонской национальной лаборатории Чикагского университета и Карл Кессельман из Института информатики Университета Южной Калифорнии. Именно Фостер и Кессельман в 1998 году впервые предложили термин grid computing для обозначения универсальной программно-аппаратной инфраструктуры, объединяющей компьютеры и суперкомпьютеры в территориально-распределенную информационно-вычислительную систему. Согласно их ставшему уже классическим определению, «Грид (grid) — согласованная, открытая и стандартизованная среда, которая обеспечивает гибкое, безопасное, скоординированное разделение ресурсов в рамках виртуальной организации».
Термин grid computing был введен по аналогии с термином power grid (электросеть).
Пользователи компьютерных мощностей получат возможность прямого подключения к удаленной вычислительной сети (так же как к электроэнергии через бытовые розетки), не озадачиваясь вопросом, откуда именно приходят требуемые для работы вычислительные ресурсы, какие для этого используются линии передачи и т. п.
Основные ресурсные элементы грид-систем — суперкомпьютеры и суперкомпьютерные центры, а важнейшая инфраструктурная составляющая — высокоскоростные сети передачи данных.
Суперкомпьютеры, не объединенные в территориально-распределенную систему, обладают как минимум тремя существенными недостатками. Во-первых, это очень дорогостоящая техника, которая быстро морально устаревает (суперкомпьютеры из первой сотни рейтинга Top-500 уже через два-три года, как правило, оказываются в самом хвосте этого списка или вообще выпадают из него). Во-вторых, это «статичность» вычислительных мощностей суперкомпьютеров, которые практически не поддаются серьезной модернизации, зачастую она не позволяет использовать их для решения задач нового уровня сложности. И, наконец, третий «большой минус» — низкий КПД суперкомпьютеров вследствие неравномерности загрузки CPU.
В идеале от этих недостатков можно избавиться при объединении суперкомпьютеров в грид-сеть. Однако для эффективной эксплуатации грид-систем вначале необходимо прийти к консенсусу в сфере стандартизации (определение стандартов сервисов, интерфейсов, баз данных и т. д.).
Распределение вычислительных сред
Авторы идеи грид-компьютинга Фостер и Кессельман стояли и у истоков разработки первого стандарта конструирования грид-систем, свободно распространяемого программного инструмента с открытым кодом Globus Toolkit.
Для дальнейшего развития Globus Toolkit в 1999 году была создана специальная организация Global Grid Forum (GGF), в которую наряду с академическими организациями вошли многие производители компьютерных систем и программного обеспечения.
В 2002 году GGF и корпорацией IBM в рамках версии Globus Toolkit 3.0 была представлена новая системная разработка Open Grid Services Architecture (OGSA), инкорпорировавшая в грид понятия и стандарты веб-сервисов. В этой архитектуре грид-сервис определяется как специальный тип веб-сервиса, благодаря чему становится возможной работа с ресурсами грид на базе стандартных интернет-протоколов.
В настоящее время адаптацией Globus Toolkit к своим основным продуктам, использующим технологию бизнес-вычислений, активно занимаются ведущие игроки компьютерного рынка, в частности та же IBM и два кита ERP-технологий, Oracle и SAP.
В то же время помимо наиболее популярного сегодня проекта Globus параллельно разрабатываются и другие грид-стандарты — например, Legion, Condor и Unicore. Так, в 2004 году у GGF появился новый серьезный конкурент — консорциум Enterprise Grid Alliance (EGA), в который в числе прочих вошли такие «монстры», как Fujitsu Siemens Computers, Hewlett-Packard, Intel, NEC, Oracle, Sun Microsystems, EMC.
Причем если основной задачей GGF была выработка требований к грид для производителей ИТ-решений, то EGA изначально была «заточена» под удовлетворение запросов корпоративных пользователей.
В конце июня 2006 года GGF и EGA, которые успели порядком попортить друг другу нервы, официально объявили о своем слиянии и создании открытого Форума по распределенным вычислениям (Open Grid Forum, OGF). Как отметил новоиспеченный президент и исполнительный директор OGF Марк Линеш, ранее занимавший пост председателя совета директоров GGF, «этот шаг позволит консолидировать сообщество сторонников идей грид и более эффективно сотрудничать с основными участниками этого рынка в разных странах. Мы сможем выступать единым фронтом во всех вопросах, связанных с разработкой и внедрением грид и распределенных вычислительных сред».
Разумеется, это счастливое слияние еще не означает, что всеобщая стандартизация грид-технологий — теперь дело решенное. Одной из серьезнейших преград на пути победоносного распространения грид-сетей была и остается традиционная модель лицензирования ПО, согласно которой клиенты платят в зависимости от числа процессоров, на которых работает приложение. Грид фактически уничтожает эту модель, так как внутри грид-сети ни один центральный процессор не имеет устойчивой связи с определенным приложением.
До сих пор ни один поставщик ПО открыто не объявил о намерении изменить свою модель расчета цены с учетом новой специфики grid computing.
Еще один «провисающий» элемент глобальной грид-конструкции — практически полное отсутствие стандартизации коммерческого программного обеспечения грид. Дело в том, что одна из характеристик ранних приложений для grid computing (используемых в научных вычислениях) — независимость одной выполняемой задачи от результата решения другой. Например, в больших грид-приложениях для сложных математических расчетов вычисления разбиваются на независимые части, которые в любое время могут быть «сложены». Однако многие корпоративные приложения жестко зависимы: одно вычисление или процесс не может продвигаться до тех пор, пока не закончится другое.
По мнению Яна Фостера, «подходы на основе открытых стандартов (подобные Globus Toolkit) в конечном счете превратят грид в господствующее направление развития корпоративных информационных инфраструктур», но давать точные прогнозы относительно времени наступления этого «корпоративного ИТ-перелома» эксперты пока не рискуют.
Поиски внеземного разума
Намного успешнее продвигаются грид-технологии в научно-образовательной сфере, что в значительной мере объясняется активной финансовой поддержкой разнообразных грид-проектов государственными структурами.
Грид-сети сегодня используются в самых разных фундаментальных научных исследованиях и проектных работах. Эволюция протопланетного вещества, планет и Земли, геномика и протеомика, общее метеорологическое прогнозирование и прогноз различных стихийных бедствий (цунами, землетрясений, извержений вулканов), моделирование и анализ экспериментов в ядерной физике, ядерное оружие, нанотехнологии, проектирование аэрокосмических аппаратов и автомобилей т. д. — наверное, скоро проще будет назвать научную дисциплину, где суперкомпьютеры и распределенные вычисления еще не применяются.
Поэтому далее мы ограничимся лишь перечнем наиболее серьезных грид-проектов, уже осуществленных за последние несколько лет или находящихся в стадии реализации.
В 2001 году в США стартовал проект TeraGrid, финансируемый Национальным научным фондом науки (NSF), основной задачей которого стало создание распределенной инфраструктуры для проведения высокопроизводительных (терафлопных) вычислений.
В мае 2004 года Европейским союзом был создан аналог американской TeraGrid — консорциум DEISA (Distributed European Infrastructure for Supercomputing Applications),
частично финансируемый в рамках программы 6th Framework, который объединил в грид-сеть ведущие национальные суперкомпьютерные центры ЕС.
В конце марта 2004 года завершился трехлетний проект European DataGrid (EDG), в рамках которого была построена тестовая инфраструктура вычислений и обмена данными для нужд европейского научного сообщества.
На основе этих наработок был начат новый международный проект организации высокопроизводительной грид-сети Enabling Grids for E-sciencE (EGEE), который выполняется под руководством швейцарского ЦЕРНа (Европейского центра ядерных исследований, Женева) и финансируется Европейским союзом и правительствами стран-участниц. В настоящее время в проект входят 70 научных учреждений из 27 стран мира, объединенных в 12 федераций. В рамках этого проекта должен быть построен самый крупный в мире грид с суммарной вычислительной мощностью 20 000 CPU.
Ведущая роль ЦЕРНа определяется тем, что в 2007 году там планируется запуск крупнейшего в мире ускорителя элементарных частиц (LHC, большого адронного коллайдера), который будет источником огромного объема информации. Создающаяся в первую очередь под LHC новая компьютерная инфраструктура должна будет обеспечить эффективную обработку информации, ожидаемый среднегодовой объем которой оценивается в 10 петабайт (1 петабайт =
10 15 байт). Задача EGEE, однако, далеко не ограничена ядерной физикой и состоит в том, чтобы реализовать потенциал грид и для многих других научно-технологических областей. Так, в ближайших планах руководства проекта создание отдельного биоинформационного «грид-блока».
В тесном взаимодействии с проектом EGEE развивается и магистральная европейская сеть для образования и науки — GEANT. В середине прошлого года межправительственная организация DANTE объявила о запуске научно-образовательной сети нового поколения GEANT 2, которая охватывает 3 млн пользователей из 3,5 тыс. академических учреждений, расположенных в 34 европейских государствах (в том числе и в России). Новая сеть качественно изменит обработку информации радиоастрономических комплексов, регистрирующие системы которых расположены на значительном удалении друг от друга, а также будет обслуживать часть процессов по передаче данных после запуска LHC.
Под руководством Пенсильванского университета США на базе грид-технологий создан Национальный цифровой центр маммографии с общим объемом данных (маммограмм) 5,6 петабайта, который предоставляет медикам возможность мгновенного доступа к записям миллионов пациентов.
Стоит упомянуть и о проекте SETI@home, инициированном астрономами Университета Калифорнии — Беркли. В рамках этого проекта была создана виртуальная грид-сеть, которая регулярно анализирует данные, поступающие с радиотелескопа Arecibo в Пуэрто-Рико с целью поиска внеземного разума. Посредством интернета SETI объединил вычислительную мощность более 5 млн персональных компьютеров и уже проделал вычислительную работу, эквивалентную более чем 600 тыс. лет работы ПК (правда, до сих пор никакой информации о найденных инопланетянах от координаторов проекта еще не поступило).
Китай начинает и может выиграть
Соединенные Штаты сегодня — безусловный мировой лидер по части практического строительства грид-сетей. В 2004 году Джордж Буш официально объявил о начале работы президентской стратегической GRID-программы (Strategic Grid Computing Initiative), основной целью которой является «создание единого национального пространства высокопроизводительных вычислений» (National High Performance Computing Environment).
К настоящему времени в США уже успешно функционируют четыре национальные грид-сети, находящиеся под заботливой опекой ключевых государственных ведомств: компьютерная сеть национального фонда научных исследований (NSF Comp. Grid), информационная сеть поддержки НАСА (NASA Information Power Grid), глобальная информационная сеть министерства обороны (DOD GI Grid) и сеть суперкомпьютерной инициативы министерства энергетики (DOE ASCI Grid).
Свою немалую лепту в процесс «всеобщей гридизации» вносят и частные американские компании. Весьма оригинален проект Sun Grid компании Sun Microsystems, стартовавший в прошлом году: машинное время сети центров обработки данных, содержащей суммарно около 10 тыс. процессоров, сдается компанией в аренду с оплатой из расчета 1 доллар за пользование одним процессором в час. Продажа времени Sun Grid осуществляется компанией по договору через чикагскую электронную фондовую биржу Archipelago Holdings. Через нее же покупатель может продать неиспользованные часы. Дополнительно в Sun предлагают услуги хранения данных по цене 1 доллар за гигабайт в месяц. Услуга предлагается организациям, имеющим эпизодические потребности в значительных вычислительных мощностях.
Концепция грид-компьютинга компании Oracle предполагает использование грид-сети как универсальной системы управления данными на основе базы данных Oracle 10G. Специальная функция ASM (Automatic Storage Manager) позволяет виртуализировать наборы дисков в единый виртуальный диск с возложением на Oracle функций менеджера файлов и томов. Oracle сама работает с этой группой дисков (виртуальными дисками), размещая на них свои файлы и управляя ими. Oracle разбивает все пространство этого виртуального диска на равные кусочки размером в 1 Мб и создает из кусочков виртуальные файлы БД, табличные пространства, тома и т. д.
Особняком в длинном списке грид-проектов стоит проект построения глобальной грид-системы, продвигаемый корпорацией Google. Модель Google — это превращение компьютинга в потребительскую услугу по типу электроснабжения (что во многом перекликается с идеей, реализуемой Sun Microsystems). В определенном смысле Google возвращается к архитектуре большой ЭВМ. В рамках этого проекта все компьютерные устройства (ПК, мобильный телефон, телевизор и т. п.) становятся просто терминалами, которые будут включены в серверный грид Google с услугами приложений.
Иными словами, Google сегодня пытается позиционировать себя в качестве универсальной системы доставки приложений на любое устройство в любой точке мира и тем самым стать реальной альтернативой привычного персонального компьютера. Стратегически важное конкурентное преимущество проекта Google — понижение себестоимости обработки бита информации. Для решения этой задачи Google активно продвигается в формировании корневой транспортной системы и подготовке площадей для размещения огромных серверных ферм с прямым выходом к ведущим мировым телекоммуникационным операторам. (По неподтвержденной информации, в 2005 году в условиях повышенной секретности Google провел крупномасштабную работу по установке в различных точках мирового океана 4 тыс. морских контейнеров с серверными стойками CPU.) Это позволит компании существенно сократить телекоммуникационные расходы и обеспечить контроль над доставкой большей части контента и мировым интернет-трафиком.
Комментируя операции Google, один из ведущих российских экспертов в области грид-технологий Владимир Рубанов в беседе с корреспондентом «Эксперта» отметил: «Финансовый результат от этих усилий “гугловцев” уже налицо: если еще в декабре 2004 года рыночная капитализация Google составляла 28 миллиардов долларов, то уже в декабре 2005го она возросла до 138 миллиардов! Этот рост наглядно демонстрирует, насколько укрепилась на Западе вера в перспективы грид-технологий. Иными словами, крупный бизнес сегодня делает большую ставку на развитие этих технологий и готов вкладывать в них колоссальные финансовые ресурсы».
Большое внимание грид-технологиям в последние годы уделяет и руководство Евросоюза, серьезно озабоченного наметившимся отставанием в этой области от США. В 2005 году Еврокомиссия подготовила специальную программу стоимостью 13 млрд евро, в рамках которой грид-компьютингу отводится роль стимулятора и важнейшего ресурса для превращения Евросоюза в «самую конкурентоспособную в мире экономику знаний».
C 2000 года ведутся работы по освоению грид-технологий и в Китае. Долгое время информация о том, на какой стадии находится реализация проекта ChinaGrid, была фактически засекречена. Информационная бомба взорвалась в середине июля 2006 года, когда китайские СМИ во всеуслышание объявили о завершении работы над Китайским образовательным грид-проектом (China Educational Grid Project, CEGP).
CEGP объединил компьютерные сети нескольких десятков крупнейших университетов страны и предоставил миллионам китайских студентов прямой доступ к базам данных, онлайновым учебным курсам и сервисным приложениям по самым разным направлениям и дисциплинам.
Как полагает Владимир Рубанов, «китайцы уже создали материальную и инфраструктурную базу для рывка в образовательной сфере. Им теперь уже не нужно регулярно тратить тысячи долларов на покупку новых компьютеров взамен устаревших — достаточно приобрести всего за 150–200 долларов интернет-коммуникаторы (PIC) и получать далее все необходимые ресурсы из грид-сети. Например, подключиться к реализации Программы 50–15, активно продвигаемой сегодня американской компанией AMD (обеспечить к 2015 году доступ в интернет при помощи дешевых интернет-приставок для 50% населения Земли. — “Эксперт”)».
В январе 2006 года в Афинах было официально объявлено о начале выполнения финансируемого Европейской комиссией проекта EUChinaGRID. Главная его цель — объединение европейских и китайских грид-инфраструктур для повышения эффективности совместного использования различных научных приложений, работающих в грид-среде. Наметившийся стратегический альянс ЕС и Китая вполне можно рассматривать как одну из первых попыток создания сильного «грид-противовеса» претензиям США на мировое лидерство в этой крупномасштабной технологической гонке.
В скором времени к этому альянсу может подключиться и Индия, которая также объявила о начале реализации собственной Национальной грид-компьютинговой инициативы GARUDA, предусматривающей объединение в грид-сеть 17 крупнейших научно-исследовательских центров страны.
Зеленый свет для русского грид
К настоящему времени национальные программы по развитию грид-технологий в той или иной форме реализуются практически всеми технологически развитыми странами. В России такой программы по грид до сих пор нет.
Вплоть до середины этого года все, чем могла похвастаться в сфере государственной поддержки развития грид-технологий Россия, по сути ограничивалось двумя ведомственными программами — Минатома и Российской академии наук, принятыми еще в 2003 году.
В июне 2006 года правительство России наконец одобрило предложение Министерства образования и науки о разработке проекта новой суперкомпьютерной программы «СКИФ-ГРИД» Союзного государства России и Белоруссии. Распоряжением Михаила Фрадкова от 7 июня Минобрнауки было поручено внести предложение о разработке проекта программы «Разработка и использование программно-аппаратных средств ГРИД-технологий и перспективных суперкомпьютерных вычислительных систем семейства СКИФ» в совет министров Союзного государства.
Благодаря этому решению головные разработчики суперкомпьютеров семейства СКИФ — Институт программных систем Российской академии наук (ИПС РАН) в Переславле-Залесском и Объединенный институт проблем информатики Национальной академии наук Белоруссии (ОИПИ НАН Белоруссии) — наконец получили добро на проведение дальнейших исследований.
Однако даже этот проект, предусматривающий в течение ближайших нескольких лет создание старших моделей персональных кластеров-серверов, имеет лишь косвенное отношение к грид-технологиям. Персональные кластеры-серверы — объединения вычислительных мощностей компьютеров и суперкомпьютеров внутри высокоскоростной локальной сети, — несмотря на целый ряд безусловных преимуществ по сравнению с «обычными» суперкомпьютерами, гомогенны (состоят из систем, имеющих одинаковую базовую структуру). В этом заключается их принципиальное отличие от компьютерных грид-сетей, которые позволяют объединять в единую вычислительную цепь гетерогенные вычислительные ресурсы, формально не связанные общим ПО и не требующие централизованного администрирования.
Мощности глобальной новой грид-системы будут такими, что — по крайней мере в теории — у ее координаторов появится возможность отслеживать и анализировать любой «клик мышкой» на каждом отдельно взятом компьютере, подключенном к грид-сети. А это — прямая дорога к перехвату интеллектуальной собственности, к быстрой утечке идей и т. п.
По мнению г-на Рубанова, единственным разумным ответом на вызов такой глобальной грид-инфраструктуры должно стать «построение национальной грид-сети, которую мы сделаем целостной и управляемой, взаимодействующей по определенным правилам с глобальной, — иными словами, между национальной и глобальной грид-инфраструктурой должна быть создана контролируемая зона обмена информацией».
Для создания такой национальной грид-системы необходимо наличие трех важнейших компонентов: программных продуктов, вычислительных мощностей и коммуникаций. Причем самым критическим элементом этой новой инфраструктуры сегодня являются именно коммуникации.
Все реализуемые сегодня концепции и подходы к построению глобальной грид-системы (грид как вычислительная услуга — Sun Microsystems; грид как система эмуляции персонального компьютера и его замены интернет-коммуникатором — AMD; грид как единая операционная система, объединяющая вычислительные мощности в глобальный суперкомпьютер, — Google; грид как виртуальная организация, формирующая однородное пространство ИКТ-взаимодействия, — Oracle) требуют высокоскоростных сетей.
Создание выделенной высокоскоростной сети передачи данных для грид-систем — это ключевой элемент снижения себестоимости обработки бита информации и главное преимущество в ценовой конкуренции глобальных проектов. И именно участие в создании коммуникационной инфраструктуры для глобального грид-компьютинга — возможно, последний шанс для достойного включения России в преобразование мирового инфокоммуникационного пространства.
52. Грид
Грид-вычисления (англ. grid — решётка, сеть) — это форма распределённых вычислений, в которой «виртуальный суперкомпьютер» представлен в виде кластеров соединённых с помощью сети, слабосвязанных, гетерогенных компьютеров, работающих вместе для выполнения огромного количества заданий (операций, работ). Эта технология применяется для решения научных, математических задач, требующих значительных вычислительных ресурсов. Грид-вычисления используются также в коммерческой инфраструктуре для решения таких трудоёмких задач, как экономическое прогнозирование, сейсмоанализ, разработка и изучение свойств новых лекарств.
Грид с точки зрения сетевой организации представляет собой согласованную, открытую и стандартизованную среду, которая обеспечивает гибкое, безопасное, скоординированное разделение вычислительных ресурсов и ресурсов хранения[1] информации, которые являются частью этой среды, в рамках одной виртуальной организации.
Концепция грид
Грид является географически распределённой инфраструктурой, объединяющей множество ресурсов разных типов (процессоры, долговременная и оперативная память, хранилища и базы данных, сети), доступ к которым пользователь может получить из любой точки, независимо от места их расположения.[3]
Идея грид-компьютинга возникла вместе с распространением персональных компьютеров, развитием интернета и технологий пакетной передачи данных на основе оптического волокна (SONET, SDH и ATM), а также технологий локальных сетей (Gigabit Ethernet). Полоса пропускания коммуникационных средств стала достаточной, чтобы при необходимости привлечь ресурсы другого компьютера. Учитывая, что множество подключенных к глобальной сети компьютеров большую часть рабочего времени простаивает и располагает ресурсами, большими, чем необходимо для решения их повседневных задач, возникает возможность применить их неиспользуемые ресурсы в другом месте.
Типы грид-систем
В настоящее время выделяют три основных типа грид-систем:
Добровольные гриды — гриды на основе использования добровольно предоставляемого свободного ресурса персональных компьютеров;
Научные гриды — хорошо распараллеливаемые приложения программируются специальным образом (например, с использованием Globus Toolkit);
Гриды на основе выделения вычислительных ресурсов по требованию (коммерческий грид, англ. enterprise grid) — обычные коммерческие приложения работают на виртуальном компьютере, который, в свою очередь, состоит из нескольких физических компьютеров, объединённых с помощью грид-технологий.
53. Виртуализация
Виртуализа́ция в вычислениях — процесс представления набора вычислительных ресурсов, или их логического объединения, который даёт какие-либо преимущества перед оригинальной конфигурацией. Это новый виртуальный взгляд на ресурсы составных частей, не ограниченных реализацией, физической конфигурацией или географическим положением. Обычно виртуализированные ресурсы включают в себя вычислительные мощности и хранилище данных. По-научному, виртуализация — это изоляция вычислительных процессов и ресурсов друг от друга.
Примером виртуализации являются симметричные мультипроцессорные компьютерные архитектуры, которые используют более одного процессора. Операционные системы обычно конфигурируются таким образом, чтобы несколько процессоров представлялись как единый процессорный модуль. Вот почему программные приложения могут быть написаны для одного логического (виртуального) вычислительного модуля, что значительно проще, чем работать с большим количеством различных процессорных конфигураций.
Виртуализация — это общий термин, охватывающий абстракцию ресурсов для многих аспектов вычислений. Типы виртуализации приводятся ниже.[1]
При динамической трансляции (бинарной трансляции) проблемные команды гостевой OC перехватываются гипервизором. После того как эти команды заменяются на безопасные, происходит возврат управления гостевой ОС.
Паравиртуализация — техника виртуализации, при которой гостевые операционные системы подготавливаются для исполнения в виртуализированной среде, для чего их ядро незначительно модифицируется. Операционная система взаимодействует с программой гипервизора, который предоставляет ей гостевой API, вместо использования напрямую таких ресурсов, как таблица страниц памяти.
Метод паравиртуализации позволяет добиться более высокой производительности, чем метод динамической трансляции.
Метод паравиртуализации применим лишь в том случае, если гостевые ОС имеют открытые исходные коды, которые можно модифицировать согласно лицензии, или же гипервизор и гостевая ОС разработаны одним производителем с учетом возможности паравиртуализации гостевой ОС (хотя при условии того, что под гипервизором может быть запущен гипервизор более низкого уровня, то и паравиртуализации самого гипервизора).
Впервые термин возник в проекте Denali.
Совместное использование ресурсов обеими ОС (каталоги, принтеры и т.д. ).
Удобство интерфейса для окон приложений из разных систем (перекрывающиеся окна приложений, одинаковая минимизация окон, как в хост-системе)
При тонкой настройке на аппаратную платформу производительность мало отличается от оригинальной нативной ОС. Быстрое переключение между системами (менее 1 сек.)
Простая процедура обновления гостевой ОС.
Двухсторонняя виртуализация (приложения одной системы запускаются в другой и наоборот)
BlueStacks Multi-OS (MOS)
Основная статья: Аппаратная виртуализация
Упрощение разработки программных платформ виртуализации за счет предоставления аппаратных интерфейсов управления и поддержки виртуальных гостевых систем. Это уменьшает трудоемкость и время на разработку систем виртуализации.
Возможность увеличения быстродействия платформ виртуализации. Управление виртуальными гостевыми системами осуществляет напрямую небольшой промежуточный слой программного обеспечения, гипервизор, что дает увеличение быстродействия.
Улучшается защищённость, появляется возможность переключения между несколькими запущенными независимыми платформами виртуализации на аппаратном уровне. Каждая из виртуальных машин может работать независимо, в своем пространстве аппаратных ресурсов, полностью изолированно друг от друга. Это позволяет устранить потери быстродействия на поддержание хостовой платформы и увеличить защищенность.
Гостевая система становится не привязана к архитектуре хостовой платформы и к реализации платформы виртуализации. Технология аппаратной виртуализации делает возможным запуск 64-битных гостевых систем на 32-битных хостовых системах (с 32-битными средами виртуализации на хостах).
Режим виртуального 8086 — старая
Intel VT (VT-x) — Intel Virtualization Technology for x86
Платформы, использующие аппаратную виртуализацию:
Виртуализация на уровне ОС
Виртуализация на уровне операционной системы — виртуализирует физический сервер на уровне ОС, позволяя запускать изолированные и безопасные виртуальные серверы на одном физическом сервере. Эта технология не позволяет запускать ОС с ядрами, отличными от типа ядра базовой ОС. При виртуализации на уровне операционной системы не существует отдельного слоя гипервизора. Вместо этого сама хостовая операционная система отвечает за разделение аппаратных ресурсов между несколькими виртуальными серверами и поддержку их независимости друг от друга.
Грид-технологии: статус и перспективы Текст научной статьи по специальности «Компьютерные и информационные науки»
Аннотация научной статьи по компьютерным и информационным наукам, автор научной работы — Кореньков В. В.
В статье представлены базовые понятия концепции грид и перспективы использования современных грид технологий для различных отраслей науки, промышленности и бизнеса. Дано краткое описание проектов по созданию гридинфраструктур. Особое внимание уделено участию России в глобальных проектах EGEE и WLCG и созданию российского грид консорциума РДИГ.
Похожие темы научных работ по компьютерным и информационным наукам , автор научной работы — Кореньков В. В.
GRID-Technologies: Status and Prospectives
The conception of grid and perspectives of the usage of modern grid technologies for various fields of science, commerce and business are presented. Current projects on creation of grid infrastructures are shortly described. A special attention is paid to the participation of Russia in the EGEE and WLCG global projects and the creation of Russian grid consortium RDIG.
Текст научной работы на тему «Грид-технологии: статус и перспективы»
ГРИД-ТЕХНОЛОГИИ: СТАТУС И ПЕРСПЕКТИВЫ
Объединенный институт ядерных исследований, Дубна
GRID-Technologies: Status and Prospectives
V. V. Korenkov Joint Institute for Nuclear Research, Dubna
В статье представлены базовые понятия концепции грид и перспективы использования современных грид-техноло-гий для различных отраслей науки, промышленности и бизнеса. Дано краткое описание проектов по созданию грид-инфраструктур. Особое внимание уделено участию России в глобальных проектах EGEE и WLCG и созданию российского грид-консорциума РДИГ.
The conception of grid and perspectives of the usage ofmodern grid technologies for various fields of science, commerce and business are presented. Current projects on creation of grid-infrastructures are shortly described. A special attention is paid to the participation of Russia in the EGEE and WLCG global projects and the creation of Russian grid-consortium RDIG.
Развитие научных исследований в физике высоких энергий, астрофизике, биологии, науках о Земле, химии, а также в медицине, нанотехнологиях, промышленности, бизнесе и других направлениях человеческой деятельности требуют совместной работы многих организаций по обработке большого объема данных в относительно короткие сроки. Для этого необходимы географически распределенные вычислительные системы, способные передавать, обрабатывать и хранить огромные массивы данных.
В настоящее время в мире информационных технологий интенсивно развивается грид (название по аналогии с электрическими сетями — electric power grid) — это компьютерная инфраструктура нового типа, обеспечивающая глобальную интеграцию информационных и вычислительных ресурсов [1, 2]. Суть инициативы грид состоит в создании набора стандартизированных служб для обеспечения надежного, совместимого, дешевого и безопасного доступа к географически распределенным высокотехнологичным информационным и вычислительным ресурсам — отдельным компьютерам, кластерам и суперкомпьютерным центрам, хранилищам информации, сетям, научному инструментарию и т. д.
Миссия Интернет состояла в глобализации обмена информацией, а всемирная паутина WWW стандартизовала поиск и доставку документов. Грид стал следующим этапом в этой цепочке революционных преобразований — стандартизации и глобализации использования всех видов компьютерных ресурсов.
Грид — это система, которая координирует использование ресурсов при отсутствии централизованно-
го управления этими ресурсами; использует стандартные, открытые, универсальные протоколы и интерфейсы; обеспечивает высококачественное обслуживание.
Грид предлагает технологию доступа к общим ресурсам и службам в рамках виртуальных организаций. Виртуальная организация (УО) — является сообществом пользователей грид-системы, объединённых для решения проблем в режиме скоординированного распределения ресурсов. В каждой виртуальной организации имеется своя собственная политика поведения ее участников, которые должны соблюдать установленные правила. Виртуальная организация может образовываться динамически и иметь ограниченное время существования.
Первоначально технологии грид использовались для научных и инженерных приложений. Однако теперь они становятся основой для координированного совместного использования ресурсов в динамических, охватывающих многие предприятия виртуальных организациях в государственном управлении, в медицине, в промышленности, в бизнесе. Появились и активно используются новые термины е-Бстепсе, е-НеакЬ, е-Соттегсе, которые подчеркивают теснейшую связь в развитии науки, медицины, бизнеса с современными информационными технологиями, в первую очередь, с грид-технологиями (см. рис. 1). Таким образом, грид служит универсальной эффективной инфраструктурой для высокопроизводительных распределенных вычислений и обработки данных. Общая схема взаимодействия пользователей, программной среды и ресурсов показана на рис. 2
К приложениям грид относятся:
• сложное моделирование на удаленных суперкомпьютерах;
• вычисления с привлечением больших объемов географически распределенных данных, например, в метеорологии, астрономии, физике высоких энергий, медицине, науках о земле;
• коллективные вычисления, в которых одновременно принимают участие пользователи из различных организаций.
Таким образом, грид — это соединение технологии, инфраструктуры и стандартов. Здесь технология — это специальное программное обеспечение, которое позволяет предоставлять ресурсы (компьютеры, хранилища данных, сети и другие) в общее пользование, а потребителям — использовать их, когда необходимо. Инфраструктура состоит из аппаратных средств и служб (на основе человеческих и программных ресурсов), которые должны быть организованы и должны постоянно поддерживаться для того, чтобы ресурсы могли совместно использоваться. Наконец, стандарты должны определять формат и протоколы обмена сообщениями как между службами, так и между службами и пользователями, а также правила работы грида [3].
Проекты развития грид-технологий
В мире накоплен большой опыт создания программной среды (middleware) для реализации распределенной грид-инфраструктуры. Одним из первых и наиболее популярных программных решений, которое стало стандартом де-факто на реализацию грид-систем — это Globus Toolkit [4]. Данный инструментарий реализует механизмы сервисов, которые охватывают вопросы защиты, обнаружения информации, управления данными и ресурсами, коммуникации, обнаружения ошибок и т. д. В настоящее время этот инструментарий применяется во многих проектах по всему миру. Кроме Globus Toolkit существуют много других программных сред (middleware) для реализации грид-систем Legion, Condor, Unicore, ARC, gLite [5] и т. д.
В этом веке было создано большое количество масштабных грид-инфраструк-тур, среди которых — DEI SA (Европа), NAREGI (Япония), Open Science Grid («Открытый научный грид») и TeraGrid в США, GridPP (Великобритания), INFN GRID (Италия), NorduGRID (Скандинавия).
Особое место среди этих проектов занимают EGEE (Enabling Grids for E-sciencE)[6] и WLCG (Worldwide LHC Computing GRID) [7].
Проект EGEE («Развёртывание грид-систем для развития е-науки») воплотил в действительность замысел превратить мировые компьютерные ресурсы в единую однородную среду, где ими можно пользоваться совместно в мировом масштабе.
Проект финансируется Европейским Рис. Z. Общая схема взаимодействия пользователей, программной г -г rj г
среды и ресурсов в грид-инфраструктуре. Сообществом и странами-участниками. В
Рис. 1. Грид: наука, медицина и коммерция, использующие ресурсы глобальной информационно-вычислительной инфраструктуры на основе современных грид-технологий.
• совместная визуализация очень больших наборов научных данных;
• распределенная обработка в целях анализа данных;
• соединение научного инструментария с удаленными компьютерами и архивами данных.
Среди основных направлений использования грид на данный момент можно выделить:
• организация эффективного использования ресурсов для небольших задач, с утилизацией временно простаивающих компьютерных ресурсов;
• распределенные супервычисления, решение очень крупных задач, требующих огромных процессорных ресурсов, памяти и т. д.;
Рис. 3. Общая инфраструктура проекта EGEE и родственных проектов.
результате появилась высокопроизводительная всемирная инфраструктура, намного превосходящая по своим возможностям локальные кластеры и отдельные центры.
В консорциум EGEE входят свыше 140 организаций из более чем 50 стран, которые объединены в 13 федераций, одна из которых «Russia», и представляют почти все основные европейские международные и национальные грид-проекты, а также проекты в США и Азии. Кроме того, множество родственных проектов (более 50 ассоциированных участников) распространяют грид-инфраструктуру на Средиземноморье, Балтику, Латинскую Америку, Индию и Китай (рис. 3).
Грид-инфраструктура EGEE уже стала повседневным рабочим средством для целого ряда больших и малых исследовательских сообществ. В ней работают приложения для физики высоких энергий, биологических наук и смежных дисциплин, наук о Земле, астрофизики, вычислительной химии, термоядерной энергетики и других. Число пользователей инфраструктуры EGEE более 14000, и они объединены в более чем 200 виртуальных организациях. В настоящее время в день выполняется более 400 тысяч заданий (более 12 миллионов в месяц), и с каждым месяцем эти показатели растут.
Проект WLCG (Worldwide LHC Computing GRID) принят в 2001 году в ЦЕРНе с целью создания глобальной информационно-вычислительной инфраструктуры для обработки, хранения и анализа данных, полученных во время экспериментов, проводимых на Большом адронном коллайдере. Для реализации этой грандиозной задачи построена масштабная глобальная грид-инфраст-руктура на основе региональных центров различного уровня, обеспечивающая моделирование, хранение, передачу данных с Большого адронного коллайдера.
Пользователи и виртуальные организации EGEE
Сообщество ученых, занимающихся физикой высоких энергий (ФВЭ) — главный пользователь инфраструктуры EGEE.
Биомедицинские науки представляют другое основное сообщество пользователей инфраструктуры EGEE. Эта сфера чётко делится на три области. Прежде всего, это разработка систем регистрации, надежного хранения и оперативного анализа 2D и 3D медицинских изображений (различные томограммы, «мамограммы», «виртуальные биопсии», кардиограммы и т. д.). Далее следуют различные направления биоинформатики — от анализа белковых цепочек до оптимизации обработки биологических данных. Наконец, Грид-инфраструктура используется в разработке лекарств для ускорения расчёта пристыковки молекул (молекулярного докинга): исследователи быстро просматривают многие тысячи вариантов и отбирают наиболее перспективные соединения, что снижает высокую стоимость разработки препаратов.
Исследователи наук о Земле решают широкий круг проблем в рамках виртуальной организации ESR (Earth Science Research, «Исследования в области наук о Земле»).
В инфраструктуре EGEE работают несколько приложений для исследований в области термоядерного синтеза. Для демонстрации принципиальной и технической возможности термоядерного синтеза учреждён ITER — международный проект соответствующих исследований и разработок.
Главным пользователем грид-инфраструктуры в области вычислительной химии является GEMS — приложение для молекулярного моделирования. В грид-ин-фраструктуре размещены и используются на промышленном уровне несколько приложений для расчёта химических реакций, моделирования молекулярной динамики сложных систем и расчёта электронной структуры молекул.
Чтобы обеспечить полномасштабное участие России в осуществлении проектов EGEE и WLCG в 2003 году был образован консорциум РДИГ (Российский ГРИД для интенсивных операций с данными, Russian Data Intensive GRID, RDIG) [8,9]. Меморандум о создании консорциума был подписан руководителями восьми крупных институтов: Института физики высоких энергий (Протвино), Института математических проблем биологии (Пущино), Института теоретической и экспериментальной физики (Москва), Объединенного института ядерных исследований (Дубна), Института прикладной математики им. М.В. Келдыша (Москва), НИИ ядерной физики МГУ (Москва), Петербургского института ядерной физики (Санкт-Петербург) и РНЦ «Курчатовский институт» (Москва), а с 2008 года — Геофизического центра РАН (Москва). Схематическая карта состава РДИГ представлена на рис. 4.
Рис. 4. Консорциум РДИГ.
Консорциум РДИГ входит в структуру EGEE в качестве региональной федерации «Россия», и его целью является создание действующей грид-инфраструк-туры в России, что включает в себя:
• наращивание вычислительных ресурсов и ресурсов хранения данных российского сегмента грид-среды;
• обеспечение надежной сетевой инфраструктуры;
• обеспечение работы базовых грид-сервисов в российском сегменте;
• создание Регионального операционного центра (Regional Operations Center — ROC);
• помощь ресурсным центрам в установке ППО и поддержка его функционирования;
• поддержка пользователей грида;
• участие в предоставлении ресурсов для исследований в важных прикладных областях (в области биомедицины, термоядерного синтеза, физики высоких энергий, космофизики);
• управление функционированием инфраструктуры: регистрация пользователей, региональных виртуальных организаций и мониторинг;
• популяризация технологий и вовлечение новых пользователей из научных и производственных кругов, а также обучение пользователей и администраторов.
В 2009 году была создана распределенная инфраструктура для обучения грид-технологиям [10], в которую на данный момент включены грид-сайты Москов-
1. Foster I, Kesseîman C (eds), «The Grid, Blueprint for a New computing Infrastructure», Morgan Kaufmann Publishers, 1998.
2. Foster I, Kesseîman C (eds), «The Grid 2: Blueprint for a New Computing Infrastructure», Morgan Kaufmann Publishers, 2004.
3. Демичев А. П, Ильин В. А, Крюков А. П., Шамардин Л. В. Грид-технологии
на службе компьютинга для Большого адронного коллайдера// Информатизация образования и наукию — М., 2009. 4: 158.
ской области (Дубна и Протвино) и грид-сайты в Узбекистане (Ташкент), Болгарии (София) и Украине (Киев). Эта инфраструктура не только успешно используется для обучающих целей, но и способствует развитию международного сотрудничества РДИГ.
В настоящее время в рамках РДИГ работают более 100 ученых и специалистов в области компьютерных технологий, подключено 17 ресурсных центров, предоставляющих ресурсы для грид-среды, с общим числом процессорных узлов более 3000 и с общим объемом хранилищ данных около 2 Петабайт.
Российские ученые уже сейчас активно используют грид-инфраструктуру для своих исследований, но не все направления науки включились в процесс освоения этой новой инновационной технологии.
Перспективы развития грид-технологий
Грид-технологии вступают в пору зрелости — происходит переход от пилотных приложений к постоянной устойчивой работе по обслуживанию самых разнообразных прикладных областей науки и производства Масштаб внедрения грид-технологий в значительной степени будет зависеть от способности новых и существующих приложений быть развернутыми в этой среде. Поэтому важно обеспечить простые (графические, основанные на технологии веб-порталов) интерфейсы к системам запуска и мониторинга заданий и управления данными в гриде.
Создание удобных интерфейсов для конкретных приложений является важным для того, чтобы сделать грид-технологии доступными широкому кругу пользователей в области промышленного производства и других бизнес-приложений.
Что касается проекта EGEE, то планируется, что с 2010 года начнет функционировать Европейская грид инфраструктура (EGI — European Grid Infrastructure). В основе этой инициативы лежит сотрудничество между национальными грид инфраструктурами (National Grid Initiatives, NGIs) и координирующей организацией (the EGI Organisation, EGI.eu). Это сотрудничество должно обеспечить дальнейшее развитие устойчивой и постоянно действующей глобальной грид-инфраструк-туры, обеспечивающей оптимальное использование вычислительных ресурсов и ресурсов хранения данных.
5. Промежуточное программное обеспечение gLite: http://glite.web.cern.ch/glite
6. Европейский проект EGEE http://www.eu-egee.org
7. Проект WLCG: http://lcg.web.cern.ch/LCG
8. Проект РДИГ: http://egee-rdig.ru.
9. Ильин В., Кореньков В., Солдатов А. Российский сегмент глобальной инфраструктуры LCG// Открытые системы, 2003. 1.
10. Кореньков В., Кутовский Н. Инфраструктура обучения грид-технологи-ям// Открытые системы, 2009. 11: 48—51.
Лекция 4. Грид-технологии и Большие данные.
Грид—технология не является технологией параллельных вычислений, она предназначена для удаленного запуска отдельных задач на территориально распределенные ресурсы. Поэтому если громоздкая задача, которую необходимо решить, может быть разбита на большое количество маленьких, независимых (не обменивающихся никакими данными) частей, — грид—технология оказывается особенно эффективным и относительно дешевым решением. . · массовая обработка потоков экспериментальных данных большого объема (зачастую изучаемое явление можно разделить на отдельные независимые события и экспериментальные результаты по каждому событию обрабатывать независимо от других)
Просмотр содержимого документа
«Лекция 4. Грид-технологии и Большие данные.»

Лекция 4 . Грид-технологии и Большие данные
Курс лекций
© М.Е. Никитин, 2022 https://multiurok.ru/nikitin-me/blog

Что такое грид-вычисления?
Грид-вычисления ( от grid – решетка, сеть ) :
— форма распределенных вычислений, в которой «виртуальный суперкомпьютер» представлен в виде кластеров соединённых с помощью сети, слабосвязанных, гетерогенных компьютеров, серверов, СХД, ЦОД, работающих вместе для выполнения очень большого объема вычислений (заданий, операций, работ).
— географически распределённая инфраструктура, объединяющая множество ресурсов разных типов (процессоры, долговременная и оперативная память, хранилища и базы данных, сети), доступ к которым пользователь может получить из любой точки, независимо от места их расположения.
Преимущество распределённых вычислений — отдельная ячейка вычислительной системы может быть приобретена как обычный неспециализированный компьютер, т.е. вычислительные мощности суперкомпьютера, можно получить с гораздо меньшей стоимостью.
Распределенный характер грид-систем роднит их с распределенными информационными системами.
© М.Е. Никитин, 2022 https://multiurok.ru/nikitin-me/blog

История и примеры
Обосновали Я.Фостер, К.Киссельман, С.Тики в начале 90-х годов. Их определение: «грид-компьютинг — это скоординированное разделение ресурсов и решение задач в динамически меняющихся виртуальных организациях со многими участниками».
Метафора , обозначавшая возможность простого доступа к вычислительным ресурсам, как к электрической сети (аналог power grid )
Применяется преимущественно для научных исследований, требующих громадных вычислительных ресурсов.
- большой адронный коллайдер самый большой в мире ускоритель элементарных частиц ( 85 % всех вычислительных задач сейчас выполняется вне ЦЕРНа ) ;
- проект Fusion — разработка метода получения электроэнергии с помощью термоядерного синтеза на экспериментальном реакторе (ТОКАМАК).
В России: Дубна (ОИЯИ), Москва (НИИЯФ МГУ, ФИАН, ИТЭФ), Протвино (ИФВЭ), Гатчина (ПИЯФ). В единую сеть с этими центрами связаны и центры других стран-участниц ОИЯИ — в Харькове, Минске, Ереване, Софии, Баку, Тбилиси.
© М.Е. Никитин, 2022 https://multiurok.ru/nikitin-me/blog
Критерии грид-системы
Отцы-основатели видят 3 критерия. C истема называется грид, если она:
- координирует использование ресурсов при отсутствии централизованного управления этими ресурсами (если это не так, мы имеем дело с локальной системой управления);
- использует стандартные, открытые, универсальные протоколы и интерфейсы (если это не так, мы имеем дело со специализированной прикладной системой);
- нетривиальным ( точнее, неаддитивным) образом обеспечивает высококачественное обслуживание (выгода от использования комбинированной системы значительно выше, чем от суммы ее отдельных частей) .
Грид-системы и суперкомпьютер
В обоих случаях используется принцип распараллеливания вычислений и имеется некоторое управляющее ПО .
В суперкомпьютерах – большое число процессоров объединяется локальной высокоскоростной шиной.
В грид-системах – вычислительные ресурсы, сконцентрированные в различных ЦОД (серверы со стандартными процессорами, СХД, ИБП и т. д. объединяются через сети (локальные и/или глобальные) при помощи стандартных протоколов.
© М.Е. Никитин, 2022 https://multiurok.ru/nikitin-me/blog
Грид-системы и облако ( grid & cloud)
Я.Фостер: «Облака выросли из грид-вычислений и основываются на концепции инфраструктуры грид. Эволюция подхода заключается в том, что вместо предоставления «сырых» вычислительных ресурсов и ресурсов хранения данных, в облаках обеспечивается предоставление более абстрактных ресурсов в виде сервисов».
- одна сложная задача распределяется на несколько вычислительных узлов, что обеспечивает высокую загрузку вычислительных ресурсов;
- используются для исполнения задач за ограниченный промежуток времени;
- ориентированы на решение отдельных научных задач посредством суперкомпьютерных систем;
- строятся на базе нескольких компаний с четкими правилами взаимодействия и предоставления программно-аппаратных ресурсов;
- предоставляют программно-аппаратную базу для развертывания вычислительной инфраструктуры;
- интерфейсы ориентированы на взаимодействие посредством специального интерфейса, которым может воспользоваться только профессиональный программист.
- нескольких задач выполняются на одном физическом сервере, разделенном на виртуальные машины;
- ориентированы на предоставление «долгоживущих» сервисов;
- ориентированы на непрерывное предоставление определенных сервисов конечным пользователям;
- позволяют любой компании использовать сервисы, оплачивая только те ресурсы, которые необходимы для решения ее собственных задач;
- предоставляют интегрированный подход для всех моделей информационных услуг: IaaS, PaaS, SaaS;
- для каждой модели (IaaS, PaaS, SaaS) предоставляется свой интерфейс, что позволяет удовлетворить потребности, как отдельных пользователей, так и корпоративных клиентов.
- © М.Е. Никитин, 2022 https://multiurok.ru/nikitin-me/blog
Big Data : Новое слово в ИТ?
Большие Данные — серия подходов, инструментов и методов обработки структурированных и неструктурированных данных огромных объёмов и значительного многообразия для получения результатов, доступных для восприятия человека. Этот подход актуален в условиях непрерывного прироста информации, увеличения ее неоднородности и распределенности по узлам вычислительной сети. Данный подход сформировался в конце 2000-х годов, как альтернативных традиционным СУБД и решениями класса бизнес аналитики ( BI — Business Intelligence ).
Характеризуются тремя большими « V » :
- volume – объем ( терабайты — 2 40 , петабайты — 2 50 , экзабайты — 2 60 );
- velocity – скорость ( и прироста данных, и их обработки, и выдачи по запросу; в идеале – в реальном масштабе времени);
3. v ariety — многообразие ( возможность одновременной обработки различных типов структурированных и неструктурированных данных — информации с сенсоров, поисковых систем, социальных сетей, медицинская и финансовая информация, SMS, мультимедиа: фотографии, презентации с графикой, музыкой, аудио и видео).
Есть еще две характеристики «Больших данных» — их ценность (принятие верного решения в нужный момент времени) и возможность работы с ними без предварительной подготовки данных.
© М.Е. Никитин, 2022 https://multiurok.ru/nikitin-me/blog
![История: статья Клиффорда Линча «Как могут повлиять на будущее науки технологии, открывающие возможности работы с большими объёмами данных?» в журнале « Nature » от 03.09.2008г. Метафоры: аналог «Большой нефти», «Большой руде» и т.д. По итогам 2011 года - явление номер два в информационной инфраструктуре после виртуализации. Актуальность: в 2013 году объем мировых данных превысил 1,2 зеттабайт (2 70 ), в 201 5 ожидалось уже 8 зеттабайт [ для справки, есть еще 1 йотабайт = 2 80 ] . Т.е. почти удвоение по закону Мура. Если записать 8 ZB на диски, то это будет примерно 20 стопок высотой от Земли до Луны. Google - 31 миллиард запросов в месяц, в день обрабатывает более 1 петабайта. Facebook – 750 миллионов пользователей, 10 млн. загрузок фотографий ежечасно. «Нравится» – 3 млрд. раз в день. Twitter – 400 млн. обращений в день в 2012г. С увеличением в год на 200%. © М.Е. Никитин, 2022 https://multiurok.ru/nikitin-me/blog](https://fsd.multiurok.ru/html/2022/06/05/s_629c58e35888f/img6.jpg)
История: статья Клиффорда Линча «Как могут повлиять на будущее науки технологии, открывающие возможности работы с большими объёмами данных?» в журнале « Nature » от 03.09.2008г.
Метафоры: аналог «Большой нефти», «Большой руде» и т.д.
По итогам 2011 года — явление номер два в информационной инфраструктуре после виртуализации.
Актуальность: в 2013 году объем мировых данных превысил 1,2 зеттабайт (2 70 ), в 201 5 ожидалось уже 8 зеттабайт [ для справки, есть еще 1 йотабайт = 2 80 ] . Т.е. почти удвоение по закону Мура. Если записать 8 ZB на диски, то это будет примерно 20 стопок высотой от Земли до Луны.
Google — 31 миллиард запросов в месяц, в день обрабатывает более 1 петабайта.
Facebook – 750 миллионов пользователей, 10 млн. загрузок фотографий ежечасно. «Нравится» – 3 млрд. раз в день.
Twitter – 400 млн. обращений в день в 2012г. С увеличением в год на 200%.
© М.Е. Никитин, 2022 https://multiurok.ru/nikitin-me/blog

Области применения
- военные применения (космическая и аэроразведка, мониторинг ситуации)
- научные исследования (мониторинг среды, зондирование атмосферы, расшифровка генома человека);
- медицина (обследование организма в целом, анализ аномалий генов конкретного человека, статистика);
- коммерция (анализ влияния большого числа факторов на объемы продаж большого числа товаров).
Основные тренды развития
- Сложность данных (данные могут быть как структурированными, так и неструктурированными).
- Сложность анализа (могут анализироваться одновременно изображения, видео, тексты, производиться распознавании образов т.д.).
- Растущие требования к бизнес аналитике (прогнозирование в реальном масштабе времени).
- Меняющаяся экономика вычислений (облачные вычисления снижают стоимость хранения и обработки данных).
- Легкость и дешевизна распараллеливания обработки.
© М.Е. Никитин, 2022 https://multiurok.ru/nikitin-me/blog

1. Анализируются все данные, а не статистические выборки
Для определения зоны распространения гриппа N1H1 специалисты Google выявили 45 из 50 миллионов условий поиска определенных лекарств и сравнив их с зонами распределения гриппа за 2003-2008 годы. Точность определения территорий распространения заболевания составила 97%.
Стив Джобс продлил себе жизнь на несколько лет проанализировав свою ДНК полностью , что позволило врачам менять лекарства при мутациях его раковой опухоли.
Компания Xoom , специализирующаяся на денежных переводах, проанализировав все данные по операциям с кредитными картами, обнаружила действия преступной группировки.
Анализ результатов всех боев в борьбе сумо позволил выявить наиболее вероятные договорные бои.
© М.Е. Никитин, 2022 https://multiurok.ru/nikitin-me/blog
2. Отсутствие точности
В мире БД высокая точность невозможна – данные постоянно меняются, неупорядочены, разного качества, разбросаны по разным серверам иногда по всему миру.
Переводы Google охватывали миллионы страниц переводимых документов различного качества, взятых из интернет-контента. Система содержала триллион слов в 95 миллиардах англоязычных предложений сомнительного качества. К середине 2012 года служба охватила более 60 языков и способна принимать голосовой ввод с 14 языков для моментального перевода.
Индекс потребительских цен – опрос по ценам на 23 000 товаров в 90 городах США. Сканирование Web- страниц позволяет учесть стоимость 5 млн. товаров, хотя точность сведений гораздо ниже, чем при опросах.
Отсутствие жесткого структурирования записей в базах данных.
3. Корреляция, а не причинность
Отход от поиска причинностей: вместо причинностей – корреляции. Если мы знаем, что сочетание двух веществ излечивает определенную болезнь, то нам не так важно, почему это происходит.
Amazon — предложение книг не по тому, что покупал данный человек ранее, а по схожести самих книг, т.е. по корреляции содержания.
Walmart – повышенный спрос на тосты Рор-Т arts в период приближения стихийных бедствий.
© М.Е. Никитин, 2022 https://multiurok.ru/nikitin-me/blog

Российские особенности
— основные потребители – банковский сектор (работа с клиентскими базами) и телеком (анализ абонентской базы);
— перспективны госсектор (электронное правительство) и медицина (быстрый анализ общего состояния пациента);
— ИТ-компании типа Google и Amazon , держатели больших объемов данных, пока отсутствуют, но перспективны «Яндекс», « Mail.ru »;
— научно-исследовательские организации могли бы использовать, но бюджеты маловаты;
— МСБ не имеет бюджетов для работы с БД;
— исследовательские центры EMC в Санкт-Петербурге и Сколково (биомедицина и энергоэффективность).