Как разделить многоканальный звук на составляющие

от admin

Разделение звука в видеозаписях

Кадр из видео Super Mario Theme (Trumpet & Euphonium) https://youtu.be/o3a6F070Xt0

Кадр из видео Super Mario Theme (Trumpet & Euphonium) https://youtu.be/o3a6F070Xt0

Введение

Традиционно популярными и активно исследуемыми областями в Deep Learning являются задачи обработки изображений или текстов. Тем не менее, задачи, связанные с обработкой звуков и аудиодорожек, полезны и могут найти практические приложения во многих областях. Вот неполный перечень задач обработки звука, при решении которых используются подходы на основе глубокого обучения:

Классификация звуковых сигналов;

Speech2Text. Перевод речи в текстовое отображение;

Text2Speech. Обратная предыдущей задача. Генерация речи по заданному тексту;

Поиск похожих звуков;

Sound Separation. Разделение звуковой дорожки на составляющие звуки;

Beamforming. Разделение многоканальной звуковой дорожки на возможные составляющие с учетом пространственного расположения звукозаписывающих устройств.

В данной статье я расскажу о решении задачи Sound Separation, но с одним отличием — в качестве входных данных используются видеозаписи.

Для начала разберемся: что такое звук? Звук — это механические колебания, передающиеся в среде. Звуковые колебания характеризуются амплитудой и частотой. В среднем обычный человек может услышать звуки частотой 20Гц – 20000Гц. Для представления аудиоданных в цифровом формате микрофон с определенной частотой регистрирует амплитуду механических колебаний среды, затем полученные замеры преобразуются в цифровой формат. Таким образом, звук в вычислительных устройствах представляется как временной ряд. При этом, чем более высокая частота дискретизации, тем более высокие частоты получается сохранить.

Возможно представление аудио сигнала в виде трехмерной диаграммы, где на оси абсцисс изображено время, на оси ординат – частота звука. Третье измерение с указанием амплитуды на определенной частоте в конкретный момент времени представлено интенсивностью или цветом каждой точки изображения. Такое представление называется спектрограммой. Для получения спектрограммы из исходного аудио сигнала необходимо выполнить оконное преобразование Фурье.

Пример спектрограммы

Пример спектрограммы

Такое представление позволяет применять двумерные сверточные нейронные сети в задачах обработки звука. Следует помнить, что в таком подходе не учитывается положение на изображении, хотя в случае спектрограмм это может быть важно. Например, в задаче классификации изображений совершенно неважно, находится объект внизу или вверху, при этом положение «внизу» и «вверху» на спектрограмме отвечает разным частотам, а значит разным звукам.

Задача разделения звуков заключается в получении аудиодорожек отдельных источников звука по одной аудиозаписи с несколькими источниками.

— исходная аудиодорожка, «смесь» отдельных звуков
– i-тая компонента звука
— число компонент звука

 Разделение звука

Разделение звука

Задача локализации — поиск источников звука в кадре и отделение от общей аудиодорожки.

Локализация звуков

Локализация звуков

Подобрать метрику, которая идеально оценивала качество модели, не так просто. Это связано со сложностью самих звуковых данных, а так же с тем, что восприятие результата может быть субъективно. Несколько человек могут по-разному оценить качество разделения в зависимости от их музыкального слуха и других факторов. Зачастую, в задачах разделения звука используют метрику SDR, дополнительно можно вычислять SIR и SAR.

SDR — source to distortion ratio, общая оценка того, насколько хорошо источник звучит

SIR – source to interference ratio, оценка того, насколько хорошо звук отделен от остальных источников

SAR – source to artifact ratio, оценка того, насколько хорошо звук изолирован от нежелательных артефактов

Теперь, определившись с задачей и метриками, можно посмотреть как решать такую задачу.

Модель

Расскажу про подход, предложенный в статье Sound-of-Pixels. Модель состоит из нескольких частей: визуальная, аудио и синтезатор. Для начала определимся, что передается на вход в модели. Исходными данными для модели являются видеозаписи с источниками звука. Видеозапись можно представить как последовательность кадров и аудиодорожка. Аудиодорожку из одномерного представления можно перевести в спектрограмму. Таким образом, на вход модели будем подавать несколько кадров из видео и спектрограмму аудиодорожки.

Архитектура модели

Архитектура модели

Для вычисления признаков из кадров видео используется ResNet, для генерации аудио признаков из спектрограммы применяется U-Net подобная архитектура. После вычисления видео и аудио признаков они комбинируются с некоторыми обучаемыми весами и на выходе модели получаются сетка из масок. Маска — это одноканальное изображение с таким же размером, как и у входной спектрограммы, каждый пиксель маски принимает значения от 0 до 1. Впрочем, маска может быть бинарной, тогда значения — это 0 или 1. При поэлементном умножении маски на исходную спектрограмму смеси получается спектрограмма изолированного источника звука, а по спектрограмме можно восстановить аудиодорожку изолированного звука.

При вычисления визуальных признаков пространственные размерности уменьшаются в 16 раз. При использовании кадров размером 224х224 выходная пространственная размерность получается 14х14. И в каждой пространственной точке получается визуальный размер признаков размерности K (гиперпараметр, подбирается в зависимости от датасета). Сеть синтезатор для каждой пространственной точки совмещает визуальные признаки и аудио признаки и предсказывает маску для спектрограммы. Получается маска для звуков, источники которых находятся в соответствующем участке исходных кадров.

Выход модели

Выход модели

Обучить такую модель напрямую проблематично, поэтому авторы предлагают несколько трюков. Обучение проводится по видео с отдельными источниками звука. Если рассматривать музыкальный домен, то подойдут видео с соло исполнениями на музыкальных инструментах. Дополнительной разметки при этом не требуется, но при обучении делается несколько допущений. Во-первых, во время обучения не предсказывается сетка масок, после визуальной сети берется макспулинг по пространственным размерностям и маска вычисляется одна на весь кадр. Во-вторых, звук аддитивен, а это значит, что при сложении двух аудиозаписей в соло исполнении получается запись исполнения в дуете.

Для обучения из выборки семплируется пара видеозаписей, т.е. объект для обучения — это две видеозаписи. Аудиодорожки складываются и получается дорожка с несколькими источниками звука. В аудио часть модели подается смесь, а по кадрам первого и второго видео вычисляются соответствующие вектора визуальных признаков. Теперь можно применить синтезатор к аудио признакам и видео признакам от первого и второго видео и получить на выходе маску для извлечения исходных аудиодорожек из смеси. Исходные аудиодорожки нам известны, можно посчитать функцию потерь между предсказанными дорожками и исходными и обновить веса модели.

Обучение модели

Обучение модели

Остается вопрос — где взять данные для обучения? Для обучения на музыкальных инструментах использовался датасет MUSIC, для обобщения модели на общий звуковой домен использовался датасет VGGSound. Данные собраны из видео на youtube, но сами датасеты — это .csv файлы с id видео. Сбор, загрузку и предобработку записей нужно выполнять своими руками. MUSIC содержит

600 видеозаписей с соло исполнением на 11 (есть часть с 21) музыкальных инструментах, а также видео с исполнениями в дуете. Все исполнения любительские, произведены в повседневной обстановке без использования профессионального оборудования. VGGSound намного больше, датасет содержит более 200 тысяч видеозаписей, а также разметку на 310 классов звуков (указывается временной отрезок в видео и метка звука, который звучит в этом отрезке)

Результаты

Давайте теперь посмотрим на результаты обученной модели. Сначала я покажу, как работает модель на музыкальных инструментах, затем на общих звуках из VGGSound.

Разберем разделение на этапе валидации на примере двух видео. Возьмем два видео с соло исполнениями, сложим их аудиодорожки и разделим обратно.

Разделение гитары и скрипки

Разделение гитары и скрипки

По полученным спектрограммам можно восстановить звук и получить финальный результат

Модель работала в режиме валидации, который приближен к обучению. Визуальные признаки в этом случае считались по всему кадру, разбиения на регионы не было. Теперь можно посмотреть на результаты модели, которая не только разделяет источники, но и ищет их в кадре.

Локализация источников звука

Локализация источников звука

Теперь, если взять полученную модель и обученный детектор объектов в кадре, то можно усреднять маски в предсказанных boundary box детектора и получать звуки, издаваемые объектами в кадре.

Приведу метрики, которые я получал в результате наиболее удачных экспериментов. За baseline я взял метрики, которые авторы указали в своей статье. В приведенных экспериментах я использовал размерность признаков K=16. В других экспериментах пробовал различные значения, но они дают худший результат. В статье же авторы указывают, что по их экспериментам размерность K=32 работает лучше.

Разделение многоканальных аудио треков

Вы можете разделить многоканальные треки, такие как стерео или сурраунд, на несколько моно треков. Это пригодится, если вы планируете использовать треки в приложении, которое поддерживает только моно треки, или вам нужно отредактировать отдельные каналы многоканального файла.

Процедура

  1. В окне Проект выберите трек, который вы хотите разделить.
  2. Выберите Проект > Конвертировать треки > Многоканальный в моно треки .
  3. В диалоговом окне Разделить многоканальный трек на моно треки внесите изменения и нажмите OK .

Результат

Треки разделены на столько моно треков, сколько соответствует конфигурации трека-источника.

Все настройки канала треков-источников копируются в треки, созданные операцией разделения.

Многоканальный аудио материал из трека источника разделяется на моно события, которые вставляются в новые треки.

В папке Audio вашего проекта создана папка Split , в которой содержатся новые моно файлы.

Если вы разделяете стерео трек, получающиеся моно треки панорамируются влево и вправо с использованием стандартного стереорегулятора панорамы.

Если вы разделяете многоканальную дорожку, и эта дорожка направляется на выходную шину, групповой канал или канал FX с соответствующими дочерними шинами, все полученные монофонические дорожки направляются на назначенные им каналы. В остальных случаях результирующие моно треки панорамируются в центр.

Если конфигурация трека-источника и файла-источника не совпадают, потому что, например, многоканальный трек содержит моно файл, этот моно файл копируется в первые два трека назначения. Однако, поскольку информация о панорамировании не рассматривается во время разделения, громкость нового моно файла может не соответствовать громкости файла на оригинальном треке.

Как разделить многоканальный звук и стерео в дк?

Имею медиаплеер с цап, усилитель, ресивер. Везде есть xlr. Задача: как сделать систему с одной парой акустики, чтобы стерео работало не через ресивер, не переставляя провода? Предлагают поставить селектор. Насколько это правильно?

Ответы

В идеале, как стерео тракт, таки многоканал лучше полностью разделить на две системы. Как это правильно сделать обсуждалось на ресурсе очень много, много и много раз…

Если кратко, то можно выделить несколько способов.

Самый эффективный, это полное разделение двух систем. Для стерео используется свой усилитель, аналоговые источники и отдельная пара колонок.

Второй способ, он более экономичный, но подразумевает наличие в многоканальной системе фронтальных колонок высокого уровня. В этом случае, когда фронтальная пара АС поочередно будет использоваться в ДК в качестве фронтальной пары, а в стерео системе, как стерео пара, то, так же есть несколько способов разделить тракты.

1. Самый эффективный. Возможен только при наличии AV ресивера высокого класса, у которого есть полноценные многоканальные выходы с предварительных выходов аудио процессора и имеется интегральный стерео усилитель с наличием отдельного стерео входа на лконечные усилители, миную схемы предусилителя. В этом случае, интегрированный усилитель выступает, как внешний усилитель мощности для поочередной работы в дк и стерео системе. АС подключаются к стерео усилителю, преауты фронтальных каналов AV ресивера подключаются ко входам на оконечные усилители стерео усилителя, все аналоговые музыкальные источники по линейным выходам коммутируются с интегральным стерео усилителем, в этом случае Вы полностью отделяете мух от котлет, многоканал от стерео.

2. В качестве оконечного усилителя используется обычный интегральный стерео усилитель, в этом случае линейный сигнал с фронтальных преаутов AV ресивера и подается на любой свободный линейный вход интегрированного усилителя… Но, в этом случае в схеме работают сразу два прелусилителя в АV ресивере и в интегрированном стерео усилителе и для того, что бы уровень громкости в системе ДК был всегда одинамиковым, на интегральном усилителе, при использовании системы в ДК, напрмер, высталяется ручка громкости на 12ч и проводится автокалибровка системы звука в многоканале автоматикой ресивера и нужно будет каждый раз на усилителе ставит громкость 12ч, когда смотрите фильмы и отключать тембро блок на стерео усилителе… Это, не очень удобно и не совсем правильно, потому, что используется сразу два предусилителя в режиме ДК, но вполне допустимо.

3-й способ. Фронтальная пара АС коммутируется с помощью акустического коммутатора, поочередно, то к ресиверу, то к усилителю,например, есть подобные коммутаторы у немецкой компании Dynavox AMP-S. Но, такая коммутация требует каждый раз переключать АС с помощью механического коммутатора и работать ручками,�� переключая на коммутаторе колонки, то к усилителю, то к ресиверу… Такая схеме, то же имеет право на жизнь при разделении системы ДК и стерео тракта…

Немного плыву, только входу в эту эту тему. Есть ZIDOO UHD 3000. Завтра покупаю ресивер Yamaha 3080 и Vincent SV-238 MK. Колонки авторские большие на динамиках seas. Я так понимаю, что могу использовать из экономичных первый способ? Второй вопрос: в ресивере же преаут не балансный, следовательно я никак не смогу задействовать XLR,? Вся коммутация по RCA?

Есть еще селектор акустики (усилителей ) с пультом дистанционного управления — Luxman AS-50R

С точки зрения «настоящего» аудиофила дк и стерео это разные колонки а селектор увеличивает длину трассы и звук портит)

Мы чаще коммутируем через тот источник который выше по качеству (предполагаю что в вашем случае это плеер). Механический селектор (например VS4x от крамера) будет работать, но кнопочку все равно придётся нажать для переключения.

Для самых ленивых нужен с приоритетом входа либо переключением по питанию. А ещё правильная автоматика гасит усилитель -> отключает сигнал -> отключает экран xlr -> подключает экран нового источника -> подключает сигнал -> включает усилитель

Читать:
Как сделать прозрачную форму

Все верно, проще всего через селектор типа такого. У меня есть, не пользуюсь, могу продать ���� не реклама!

Внутри проводка 2,5 квадрата, медь, по желанию можно провода и терминалы сменить на более хорошие. Разбирается легко. Да, доп оборудование может влиять на звук, но по сути это некий удлинитель)

Такой коммутатор вещь не безопасная для Ваших колонок, ресивера и усилителя, т к не имеет 0 положения переключателя и скорее всего на коммутаторе перекидываются только плюсовые от АС а земляные провода остаются общими и если у Вас в системе используется балансный стерео усилитель или, например ламповый, томожет случится беда, т к разрыва с земляными клеммами между усилителем и ресивером не будет и это может привести к выходу из строя одного из аппаратов…

Я сейчас не пользуюсь этим устройством в виду того, что нет уже потребности, но! Я разбирал его и там не только плюсовые но и минус переключаются.. согласен, нет «нейтралки». В этом минус.

Подтверждаю, с Dynavox полет нормальный, а вот с изделием от «авитошных умельцев» с общим минусом у меня постоянно правый канал на усилителе отваливался.

Только авторизованные пользователи могут отвечать на вопросы, пожалуйста, войдите или зарегистрируйтесь.

Как разделить музыкальный трек на составные части ⁠ ⁠

Французская компания Deezer, известная своим одноименным музыкальным сервисом потоковой передачи музыки через Интернет, выложила в открытый доступ нейронную сеть, которая умеет разделять любую музыкальную композицию на составные части. Они выложили три варианта:

* разделение на голос и фонограмму

* разделение на голос, гитару, барабаны и остальное

* третий вариант дополнительно включает пианино

Над качественным решением данной задачи давно бьются исследователи. В интернете есть софт, онлайн-сервисы и гайды как это делать, например, в Audacity. Но результаты всегда оставляли желать лучшего или требовали существенной ручной доработки. И теперь мы на шаг ближе к полностью автоматическому решению этой задачи за счёт успехов в обучении нейронных сетей.

Посмотреть примеры можно в видео ниже. Видно что иногда артефакты проскакивают, но разделение в большинстве случаев происходит почти идеально. Этого удалось добиться за счёт использования огромного датасета для обучения, который в наличии у Deezer, чей каталог на данный момент включает 56 миллионов музыкальных композиций.

Софт для сплита треков написан на базе библиотеки tensorflow от google и выложен под полностью свободной лицензией на Github. Легко устанавливается и запускается с командной строки. Работает достаточно быстро даже на CPU.

Для желающих поиграться с разделением треков на базе spleeter, есть сервис, где это можно сделать в пару кликов онлайн: mvsep.com

Так же в своём пресс-релизе Deezer дали ссылку на похожий софт, от других исследователей со схожим качеством разделения треков. А так же на сайт где собирают работу различных нейронных сетей для решения этой задачи — тут интересно сравнить как один и тот же трек разбивают на части разные алгоритмы. На форуме программы пользователи предлагают доработки идеи, такие как добавить к spleeter музыкальные инструменты, например флейту или использовать spleeter для удаления музыки с фона спортивных видео чтобы Youtube не банил ролики за нарушение копирайта.

897 постов 7.1K подписчиков

Правила сообщества

Здесь вы можете свободно создавать посты по теме Искусственного интеллекта. Добро пожаловать 🙂

— Делиться вопросами, мыслями, гипотезами, юмором на эту тему.

— Делиться статьями, понятными большинству аудитории Пикабу.

— Делиться опытом создания моделей машинного обучения.

— Рассказывать, как работает та или иная фиговина в анализе данных.

— Век жить, век учиться.

I) Невостребованный контент

I.1) Создавать контент, сложный для понимания. Такие посты уйдут в минуса лишь потому, что большинству неинтересно пробрасывать градиенты в каждом тензоре реккурентной сетки с AdaGrad оптимизатором.

I.2) Создавать контент на «олбанском языке» / нарочно игнорируя правила РЯ даже в шутку. Это ведет к нечитаемости контента.

II) Нетематический контент

II.1) Создавать контент, несвязанный с Data Science, математикой, программированием.

II.2) Создавать контент, входящий в противоречие существующей базе теорем математики. Например, «Земля плоская» или «Любое действительное число представимо в виде дроби двух целых».

II.3) Создавать контент, входящий в противоречие с правилами Пикабу.

III) Непотребный контент

III.1) Эротика, порнография (даже с NSFW).

За нарушение I — предупреждение

За нарушение II — предупреждение и перемещение поста в общую ленту

За нарушение III — бан

СУПЕР. Спасибо огромное! Теперь можно в домашнее караоке, пусть с артефактами, зато с минусом, а не говномиди!

добрый день) не хотели бы вы перенести пост в «Машинное обучение»?

Функция по убиранию из песен вокала была в некоторых REALTEK’овских драйверах. Работало конечно хуже, но иногда очень даже убирало голос и оставляло только музыку без артефактов.

Как минимум за ссылку на сайт спасибо.

Попробовал, получилось поделить на музыку и вокал. В принципе можно подложку звуковую делать.

Лесной клещ под микроскопом⁠ ⁠

Лесная подстилка буквально кишит членистоногими. На одном квадратном метре может проживать до 50 000 различных видов насекомых, ногохвосток, пауков и клещей.

Лесной клещ под микроскопом Биология, Микроскоп, Научпоп, Исследования, Наука, Дзен, Длиннопост

Большинство из этих организмов питаются опавшими листьями и древесиной, которые они могут переваривать с помощью бактерий обитающих в их кишечнике.

Лесной клещ под микроскопом Биология, Микроскоп, Научпоп, Исследования, Наука, Дзен, Длиннопост

На фотографиях ниже, представлен клещ из рода (Caraboides). Эти микроскопические клещи, не опасны для человека и выполняют важную функцию по переработке отмерших органических отходов на поверхности и внутри почвы.

Лесной клещ под микроскопом Биология, Микроскоп, Научпоп, Исследования, Наука, Дзен, Длиннопост

Увеличение: x280. Сканирующий электронный микроскоп.

Советские достижения в Крымской астрофизической обсерватории – Роальд Гершберг⁠ ⁠

Сегодня празднует девяностолетие Роальд Евгеньевич Гершберг, астроном, доктор физико-математических наук, ведущий научный сотрудник Крымской астрофизической обсерватории.

Роальд Евгеньевич очень хотел, чтобы мы не вырезали его слова о советских достижениях, но по какой-то нелепой случайности именно в этот момент звукозаписывающая аппаратура подвела. Пришлось резать. Пусть хотя бы в таком виде его слова останутся для следующих поколений.

Сюжеты на нашем канале с его участием:

— История Крымской астрофизической обсерватории: https://youtu.be/abMQ4o4vFRs

— Исследования на телескопе им. Шайна в Крымской астрофизической обсерватории: https://youtu.be/aQeaYJWygHc

Что такое гравитационные волны простым языком | Лекции по астрофизике – Гор Оганесян | Научпоп⁠ ⁠

Что такое гравитационные волны? Как их изучают? Какими бывают источники гравитационных волн? Кому и когда была присуждена Нобелевская премия за их изучение? Где и как работает детектор гравитационных волн? Какие перспективы в будущем у этого направления исследований? Об этом и многом другом простым языком рассказывает Гор Оганесян, астрофизик, PhD, научный сотрудник Научного института Гран-Сассо (GSSI).

Ногохвостки под микроскоп⁠ ⁠

Продолжаем знакомится с микроскопическими обитателями леса. Ногохвостки — это класс мелких членистоногих насчитывающий более 8 000 видов.

Ногохвостки под микроскоп Микроскоп, Биология, Научпоп, Исследования, Наука, Дзен, Длиннопост

Их можно встретить практически в любом регионе планеты. Могут обитать в лесной подстилке, на стволах деревьев, внутри расщелин и пещер, омертвевшей древесине, на поверхности мхов, лишайников и рыхлой почвы.

Ногохвостки под микроскоп Микроскоп, Биология, Научпоп, Исследования, Наука, Дзен, Длиннопост

Размеры большинства представителей не превышают 3-5 мм. Хорошо видно даже без микроскопа. По типу питания в основном редуценты — питаются отмершей органикой, грибами или мелкими насекомыми.

Ногохвостки под микроскоп Микроскоп, Биология, Научпоп, Исследования, Наука, Дзен, Длиннопост

Ногохвостки — это настоящие реликты. За 400 миллионов лет с момента их появления в девонском периоде их внешний облик практически не претерпел изменений.

Ответ на пост «Нейросети и тексты: есть ли повод для беспокойства. Искусственный vs естественный — кто кого»⁠ ⁠

Окей, цитируя м/ф Гриффины «приготовься к оскорблениям по пунктам».
1. Копирайтеры, как и бОльшая часть современных журналистов, переводчиков, бухглатеров, рекламщиков, графоманов всех мастей и даже художников — просто ненужная плесень, которая НЕ создает НИЧЕГО нового, а высирает на бумагу или в сеть пятикратно переваренный кал, под видом «творческой работы». Это касается как безвестных дятлов клавиатуры, которые стучат однотипные «продающие тексты» по пять рублей за тысячу символов, так и вполне себе настоящих авторов сценариев, рожающих в кокаиновом бреду сюжеты говнофильмов.
2. Когда ты о чем-то по-русски спрашиваешь нейросеть, обученную преимущественно на английском языке, а она тебе отвечает глупость, дураком выглядишь ты, а не ИИ. Вот аналогичный запрос на английском и ответ (ниже если что перевод есть):

Ответ на пост «Нейросети и тексты: есть ли повод для беспокойства. Искусственный vs естественный - кто кого» Будущее, Технологии, Инновации, Длиннопост, Нейронные сети, Наука, Ответ на пост

Текстом с переводом на русский:

«На шумных улицах Петербурга, среди грохота конных экипажей и какофонии человеческих голосов жил-был копирайтер. Это был человек худощавого телосложения, лицо которого выдавало глубокую усталость, вызванную долгими часами, проведенными за письменным столом. Его звали Иван, и он посвятил свою жизнь искусству убеждения посредством письменного слова.

Иван был одинокой фигурой, его часто видели гуляющим по улицам в одиночестве, погруженным в свои мысли. У него был талант плести замысловатые языковые сети, способные заманить в ловушку даже самого скептически настроенного читателя. Его слова были его оружием, его щитом и его спасением. Они позволили ему выжить в мире, который часто был недоброжелателен к тем, у кого не было власти или влияния. Для Ивана письменное слово было средством побега, способом преодолеть ограничения своего скромного существования и соединиться с другими на более глубоком уровне.

И все же, несмотря на все свое умение говорить, Ивана мучило чувство экзистенциального отчаяния. Он чувствовал себя в ловушке мира, в котором превыше всего ценился материальный успех, и часто задавался вопросом, имеет ли его работа какое-то реальное значение. Он жаждал целеустремленности, дела, которому он мог бы посвятить свои значительные таланты. В глубине души Иван знал, что он способен на величие, но изо всех сил пытался найти в себе смелость осуществить свою мечту. И поэтому он продолжал писать день за днем, надеясь, что однажды его слов будет достаточно, чтобы изменить мир.»

3. Нейросеть — это инструмент и то что он оставит кучу народу без работы — объективный факт. Точно также в 19 веке станки и фабрики оставили без работы массу кустарей и ремесленников. Это не проблема нейросети. Это проблема общества, которое построено на том, что человек для выживания должен продавать свои навыки тому, кто за это заплатит. А тот кто платит, получив в руки более надежный и дешевый инструмент с устраивающим его качеством работы даже два раза думать не будет, чему предпочтение отдать.

4. Читатель, прежде чем идти в комменты, дочитай этот абзац до конца. Тут мысли не столько о текущем положении дел, сколько о будущем. Так вот, языковая нейросеть важна как универсальный источник знаний не завязанный на конкретных статьях, книгах и справочниках, а способная выдавать выжимку из них. Сегодня когда в науке вообще, кажется не осталось областей где можно сделать какой-то прорыв без междисциплинарности все стало настолько сложно, что достигнуть чего-то могут только большие коллективы специалистов. Если же одиночному исследователю-биологу, например, ВНЕЗАПНО в его исследованиях понадобится информация о физике сверхпроводников, в которой он ничего не понимает, сегодня у него только два пути — найти эксперта с которым можно это обсудить (но который — живой человек со своей работой, исследованиями и делами) либо лезть в гугл и рыться там тратя множество времени. Нейросеть дает третий вариант — просто спросить какие исследования в данной области сегодня актуальны, спросить конкретный вопрос, который его интересует. Или, например, инженер поймал озарение и придумал какое-либо устройство. Как ему узнать, действительно ли это что-то новое, или это очередной велосипед? Правильно, сегодня он садится и выполняет патентный поиск. Само по себе дело не простое, трудозатратное и длительное (опять же потому что человечество накопило чудовищное количество знаний, информации и в т.ч. патентов на все подряд). Нейросеть можно просто попросить выдать патенты, наиболее близкие к формуле изобретения сформулированной инженером. Ученый, который собирается нырнуть в новую или смежную область должен перелопатить массу обзорных статей (review article) в надежде получить там ответы о том что действительно в данной области сейчас является актуальными и нерешенными задачами. У нейросети это можно спросить. И это что касается творческих специальностей и как нейросеть может помочь создать что-то действительно новое. Всякая плесень вроде копирайтеров и так не очень нужна, а вот писатели могут точно также брать из нейросети выжимку по интересующим его историческим событиям, персоналиям, неизвестным ранее фактам (в поисках которых сточишь гугл до дыр). Далее, есть еще такая хрень как адвокаты. И такая хрень как адвокаты прецедентного права, для которых 80% работы состоит в дышании пылью архивов в поисках подходящих к его делу прецедентов. Как только нейросеть поглотит все эти архивные дела бОльшую часть таких мясных адвокатов можно будет выкидывать на мороз. Да, это дело все еще будущего. Да будут специализированные языковые нейросети, одни для науки (или даже конкретной области науки), другие для права, третьи для медицины, четвертые для погромистов.

5. ЧатГПТ это пока только развлекуха, но если смотреть не жопой, уже сегодня можно увидеть огромный потенциал для человечества. И да, ЧатГПТ оперирует 175 миллиардами параметров.

Ответ на пост «Нейросети и тексты: есть ли повод для беспокойства. Искусственный vs естественный - кто кого» Будущее, Технологии, Инновации, Длиннопост, Нейронные сети, Наука, Ответ на пост

Много это или мало? Следующий ГПТ по прогнозам и заявлениям будет обучен на 100 триллионах параметров. А ЧатГПТ уже сейчас весьма впечатляющ.

Related Posts