Какие проблемы возникают при проигрывании цифрового звука

от admin

FAQ по цифровому представлению звуковых сигналов

Все права в отношении данного текста принадлежат автору. При воспроизведении текста или его части сохранение Copyright обязательно. Коммерческое использование допускается только с письменного разрешения автора.

Чем цифровое представление сигналов отличается от аналогового?

Традиционное аналоговое представление сигналов основано на подобии (аналогичности) электрических сигналов (изменений тока и напряжения) представленным ими исходным сигналам (звуковому давлению, температуре, скорости и т.п.), а также подобии форм электрических сигналов в различных точках усилительного или передающего тракта. Форма электрической кривой, описывающей (также говорят — переносящей) исходный сигнал, максимально приближена к форме кривой этого сигнала.

Такое представление наиболее точно, однако малейшее искажение формы несущего электрического сигнала неизбежно повлечет за собой такое же искажение формы и сигнала переносимого. В терминах теории информации, количество информации в несущем сигнале в точности равно количеству информации в сигнале исходном, и электрическое представление не содержит избыточности, которая могла бы защитить переносимый сигнал от искажений при хранении, передаче и усилении.

Цифровое представление электрических сигналов призвано внести в них избыточность, предохраняющую от воздействия паразитных помех. Для этого на несущий электрический сигнал накладываются серьезные ограничения — его амплитуда может принимать только два предельных значения — 0 и 1. Вся зона возможных амплитуд в этом случае делится на три зоны: нижняя представляет нулевые значения, верхняя — единичные, а промежуточная является запрещенной — внутрь нее могут попадать только помехи. Таким образом, любая помеха, амплитуда которой меньше половины амплитуды несущего сигнала, не оказывает влияния на правильность передачи значений 0 и 1. Помехи с большей амплитудой также не оказывают влияния, если длительность импульса помехи ощутимо меньше длительности информационного импульса, а на входе приемника установлен фильтр импульсных помех.

Сформированный таким образом цифровой сигнал может переносить любую полезную информацию, которая закодирована в виде последовательности битов — нулей и единиц; частным случаем такой информации являются электрические и звуковые сигналы. Здесь количество информации в несущем цифровом сигнале значительно больше, нежели в кодированном исходном, так что несущий сигнал имеет определенную избыточность относительно исходного, и любые искажения формы кривой несущего сигнала, при которых еще сохраняется способность приемника правильно различать нули и единицы, не влияют на достоверность передаваемой этим сигналом информации. Однако в случае воздействия значительных помех форма сигнала может искажаться настолько, что точная передача переносимой информации становится невозможной — в ней появляются ошибки, которые при простом способе кодирования приемник не сможет не только исправить, но и обнаружить. Для еще большего повышения стойкости цифрового сигнала к помехам и искажениям применяется цифровое избыточное кодирование двух типов: проверочные (EDC — Error Detection Code, обнаруживающий ошибку код) и корректирующие (ECC — Error Correction Code, исправляющий ошибку код) коды. Цифровое кодирование состоит в простом добавлении к исходной информации дополнительных битов и/или преобразовании исходной битовой цепочки в цепочку большей длины и другой структуры. EDC позволяет просто обнаружить факт ошибки — искажение или выпадение полезной либо появление ложной цифры, однако переносимая информация в этом случае также искажается; ECC позволяет сразу же исправлять обнаруженные ошибки, сохраняя переносимую информацию неизменной. Для удобства и надежности передаваемую информацию разбивают на блоки (кадры), каждый из которых снабжается собственным набором этих кодов.

Каждый вид EDC/ECC имеет свой предел способности обнаруживать и исправлять ошибки, за которым опять начинаются необнаруженные ошибки и искажения переносимой информации. Увеличение объема EDC/ECC относительно объема исходной информации в общем случае повышает обнаруживающую и корректирующую способность этих кодов.

В качестве EDC популярен циклический избыточный код CRC (Cyclic Redundancy Check), суть которого состоит в сложном перемешивании исходной информации в блоке и формированию коротких двоичных слов, разряды которых находятся в сильной перекрестной зависимости от каждого бита блока. Изменение даже одного бита в блоке вызывает значительное изменение вычисленного по нему CRC, и вероятность такого искажения битов, при котором CRC не изменится, исчезающе мала даже при коротких (единицы процентов от длины блока) словах CRC. В качестве ECC используются коды Хэмминга (Hamming) и Рида-Соломона (Reed-Solomon), которые также включают в себя и функции EDC.

Информационная избыточность несущего цифрового сигнала приводит к значительному (на порядок и более) расширению полосы частот, требуемой для его успешной передачи, по сравнению с передачей исходного сигнала в аналоговой форме. Кроме собственно информационной избыточности, к расширению полосы приводит необходимость сохранения достаточно крутых фронтов цифровых импульсов.

Кроме целей помехозащиты, информация в цифровом сигнале может быть подвергнута также линейному или канальному кодированию, задача которого — оптимизировать электрические параметры сигнала (полосу частот, постоянную составляющую, минимальное и максимальное количество нулевых/единичных импульсов в серии и т.п.) под характеристики реального канала передачи или записи сигнала.

Полученный несущий сигнал, в свою очередь, также является обычным электрическим сигналом, и к нему применимы любые операции с такими сигналами — передача по кабелю, усиление, фильтрование, модуляция, запись на магнитный, оптический или другой носитель и т.п. Единственным ограничением является сохранение информационного содержимого — так, чтобы при последующем анализе можно было однозначно выделить и декоди- ровать переносимую информацию, а из нее — исходный сигнал.

Как звук представляется в цифровом виде?

Исходная форма звукового сигнала — непрерывное изменение амплитуды во времени — представляется в цифровой форме с помощью "перекрестной дискретизации" — по времени и по уровню.

Согласно теореме Котельникова, любой непрерывный процесс с ограниченным спектром может быть полностью описан дискретной последовательностью его мгновенных значений, следующих с частотой, как минимум вдвое превышающей частоту наивысшей гармоники процесса; частота Fd выборки мгновенных значений (отсчетов) называется частотой дискретизации.

Из теоремы следует, что сигнал с частотой Fa может быть успешно дискретизирован по времени на частоте 2Fa только в том случае, если он является чистой синусоидой, ибо любое отклонение от синусоидальной формы приводит к выходу спектра за пределы частоты Fa. Таким образом, для временнОй дискретизации произвольного звукового сигнала (обычно имеющего, как известно, плавно спадающий спектр), необходим либо выбор частоты дискретизации с запасом, либо принудительное ограничение спектра входного сигнала ниже половины частоты дискретизации.

Одновременно с временнОй дискретизацией выполняется амплитудная — измерение мгновенных значений амплитуды и их представление в виде числовых величин с определенной точностью. Точность измерения (двоичная разрядность N получаемого дискретного значения) определяет соотношение сигнал/шум и динамический диапазон сигнала (теоретически это — взаимно-обратные величины, однако любой реальный тракт имеет также и собственный уровень шумов и помех).

Полученный поток чисел (серий двоичных цифр), описывающий звуковой сигнал, называют импульсно-кодовой модуляцией или ИКМ (Pulse Code Modulation, PCM), так как каждый импульс дискретизованного по времени сигнала представляется собственным цифровым кодом.

Чаще всего применяют линейное квантование, когда числовое значение отсчета пропорционально амплитуде сигнала. Из-за логарифмической природы слуха более целесообразным было бы логарифмическое квантование, когда числовое значение пропорционально величине сигнала в децибелах, однако это сопряжено с трудностями чисто технического характера.

ВременнАя дискретизация и амплитудное квантование сигнала неизбежно вносят в сигнал шумовые искажения, уровень которых принято оценивать по формуле 6N + 10lg (Fдискр/2Fмакс) + C (дБ), где константа C варьируется для разных типов сигналов: для чистой синусоиды это 1.7 дБ, для звуковых сигналов — от -15 до 2 дБ. Отсюда видно, что к снижению шумов в рабочей полосе частот 0..Fмакс приводит не только увеличение разрядности отсчета, но и повышение частоты дискретизации относительно 2Fмакс, поскольку шумы квантования "размазываются" по всей полосе вплоть до частоты дискретизации, а звуковая информация занимает только нижнюю часть этой полосы.

В большинстве современных цифровых звуковых систем используются стандартные частоты дискретизации 44,1 и 48 кГц, однако частотный диапазон сигнала обычно ограничивается возле 20 кГц для оставления запаса по отношению к теоретическому пределу. Также наиболее распространено 16-разрядное квантование по уровню, что дает предельное соотношение сигнал/шум около 98 дБ. В студийной аппаратуре используются более высокие разрешения — 18-, 20- и 24-разрядное квантование при частотах дискретизации 56, 96 и 192 кГц. Это делается для того, чтобы сохранить высшие гармоники звукового сигнала, которые непосредственно не воспринимаются слухом, но влияют на формирование общей звуковой картины.

Для оцифровки более узкополосных и менее качественных сигналов частота и разрядность дискретизации могут снижаться; например, в телефонных линиях применяется 7- или 8-разрядная оцифровка с частотами 8..12 кГц.

Представление аналогового сигнала в цифровом виде называется также импульсно-кодовой модуляцией (ИКМ, PCM — Pulse Code Modulation), так как сигнал представляется в виде серии импульсов постоянной частоты (временнАя дискретизация), амплитуда которых передается цифровым кодом (амплитудная дискретизация). PCM-поток может быть как параллельным, когда все биты каждого отсчета передаются одновременно по нескольким линиям с частотой дискретизации, так и последовательным, когда биты передаются друг за другом с более высокой частотой по одной линии.

Сам цифровой звук и относящиеся к нему вещи принято обозначать общим термином Digital Audio; аналоговая и цифровая части звуковой системы обозначаются терминами Analog Domain и Digital Domain.

Что такое АЦП и ЦАП?

Аналогово-цифровой и цифро-аналоговый преобразователи. Первый преобразует аналоговый сигнал в цифровое значение амплитуды, второй выполняет обратное преобразование. В англоязычной литературе применяются термины ADC и DAC, а совмещенный преобразователь называют codec (coder-decoder).

Принцип работы АЦП состоит в измерении уровня входного сигнала и выдаче результата в цифровой форме. В результате работы АЦП непрерывный аналоговый сигнал превращается в импульсный, с одновременным измерением амплитуды каждого импульса. ЦАП получает на входе цифровое значение амплитуды и выдает на выходе импульсы напряжения или тока нужной величины, которые расположенный за ним интегратор (аналоговый фильтр) превращает в непрерывный аналоговый сигнал.

Для правильной работы АЦП входной сигнал не должен изменяться в течение времени преобразования, для чего на его входе обычно помещается схема выборки-хранения, фиксирующая мгновенный уровень сигнала и сохраняющая его в течение всего времени преобразования. На выходе ЦАП также может устанавливаться подобная схема, подавляющая влияние переходных процессов внутри ЦАП на параметры выходного сигнала.

При временнОй дискретизации спектр полученного импульсного сигнала в своей нижней части 0..Fa повторяет спектр исходного сигнала, а выше содержит ряд отражений (aliases, зеркальных спектров), которые расположены вокруг частоты дискретизации Fd и ее гармоник (боковые полосы). При этом первое отражение спектра от частоты Fd в случае Fd = 2Fa располагается непосредственно за полосой исходного сигнала, и требует для его подавления аналогового фильтра (anti-alias filter) с высокой крутизной среза. В АЦП этот фильтр устанавливается на входе, чтобы исключить перекрытие спектров и их интерференцию, а в ЦАП — на выходе, чтобы подавить в выходном сигнале надтональные помехи, внесенные временнОй дискретизацией.

Что такое передискретизация (oversampling)?

Это дискретизация сигнала с частотой, превышающей основную частоту дискретизации. Передискретизации может быть аналоговой, когда с повышенной частотой делаются выборки исходного сигнала, или цифровой, когда между уже существующими цифровыми отсчетами вставляются дополнительные, рассчитанные путем интерполяции. Другой способ получения значений промежуточных отсчетов состоит во вставке нулей, после чего вся последовательность подвергается цифровой фильтрации. В АЦП используется аналоговая передискретизация, в ЦАП — цифровая.

Передискретизация используется для упрощения конструкций АЦП и ЦАП. По условиям задачи на входе АЦП и выходе ЦАП должен быть установлен аналоговый фильтр с АЧХ, линейной в рабочем диапазоне и круто спадающей за его пределами. Реализация такого аналогового фильтра весьма сложна; в то же время при повышении частоты дискретизации вносимые ею отражения спектра пропорционально отодвигаются от основного сигнала, и аналоговый фильтр может иметь гораздо меньшую крутизну среза.

Другое преимущество передискретизации состоит в том, что ошибки амплитудного квантования (шум дробления), распределенные по всему спектру квантуемого сигнала, при повышении частоты дискретизации распределяются по более широкой полосе частот, так что на долю основного звукового сигнала приходится меньшее количество шума. Каждое удвоение частоты снижает уровень шума квантования на 3 дБ; поскольку один двоичный разряд эквивалентен 6 дБ шума, каждое учетверение частоты позволяет уменьшить разрядность преобразователя на единицу.

Передискретизация вместе с увеличением разрядности отсчета, интерполяцией отсчетов с повышенной точностью и выводом их на ЦАП надлежащей разрядности позволяет несколько улучшить качество восстановления звукового сигнала. По этой причине даже в 16-разрядных системах нередко применяются 18- и 20-разрядные ЦАП с передискретизацией.

АЦП и ЦАП с передискретизацией за счет значительного уменьшения времени преобразования могут обходиться без схемы выборки-хранения.

Как устроены и работают АЦП и ЦАП?

  • параллельные — входной сигнал одновременно сравнивается с эталонными уровнями набором схем сравнения (компараторов), которые формируют на выходе двоичное значение. В таком АЦП количество компараторов равно (2 в степени N) — 1, где N — разрядность цифрового кода (для восьмиразрядного — 255), что не позволяет наращивать разрядность свыше 10-12.
  • последовательного приближения — преобразователь при помощи вспомогательного ЦАП генерирует эталонный сигнал, сравниваемый со входным. Эталонный сигнал последовательно изменяется по принципу половинного деления (дихотомии), который используется во многих методах сходящегося поиска прикладной математики. Это позволяет завершить преобразование за количество тактов, равное разрядности слова, независимо от величины входного сигнала.
  • с измерением временнЫх интервалов — широкая группа АЦП, использующая для измерения входного сигнала различные принципы преобразования уровней в пропорциональные временнЫе интервалы, длительность которых измеряется при помощи тактового генератора высокой частоты. Иногда называются также считающими АЦП.

  • последовательного счета, или однократного интегрирования (single-slope) — в каждом такте преобразования запускается генератор линейно возрастающего напряжения, которое сравнивается со входным. Обычно такое напряжение получают на вспомогательном ЦАП, подобно АЦП последовательного приближения.
  • двойного интегрирования (dual-slope) — в каждом такте преобразования входной сигнал заряжает конденсатор, который затем разряжается на источник опорного напряжения с измерением длительности разряда.
  • следящие — вариант АЦП последовательного счета, при котором генератор эталонного напряжения не перезапускается в каждом такте, а изменяет его от предыдущего значения до текущего.

  • взвешивающие — с суммированием взвешенных токов или напряжений, когда каждый разряд входного слова вносит соответствующий своему двоичному весу вклад в общую величину получаемого аналогового сигнала; такие ЦАП называют также параллельными или многоразрядными (multibit).
  • sigma-delta, с предварительной цифровой передискретизацией и выдачей малоразрядных (обычно однобитовых) значений на схему формирования эталонного заряда, которые со столь же высокой частотой добавляются к выходному сигналу. Такие ЦАП носят также название bitstream.
  • с широтно-импульсной модуляцией (ШИМ, Pulse Width Modulation, PWM), когда на схему выборки-хранения аналогового сигнала выдаются импульсы постоянной амплитуды и переменной длительности, управляя дозированием выдаваемого на выход заряда. На этом принципе работают преобразователи MASH (Multi-stAge Noise Shaping — многостадийная формовка шума) фирмы Matsushita. Свое название эти ЦАП получили по причине применения в них нескольких последовательных формирователей шума.

Каковы достоинства и недостатки цифрового звука?

Цифровое представление звука ценно прежде всего возможностью бесконечного хранения и тиражирования без потери качества, однако преобразование из аналоговой формы в цифровую и обратно все же неизбежно приводит к частичной его потере. Наиболее неприятные на слух искажения, вносимые на этапе оцифровки — гранулярный шум, возникающий при квантовании сигнала по уровню из-за округления амплитуды до ближайшего дискретного значения. В отличие от простого широкополосного шума, вносимого ошибками квантования, гранулярный шум представляет собой гармонические искажения сигнала, наиболее заметные в верхней части спектра.

Мощность гранулярного шума обратно пропорциональна количеству ступеней квантования, однако из-за логарифмической характеристики слуха при линейном квантовании (постоянная величина ступени) на тихие звуки приходится меньше ступеней квантования, чем на громкие, и в результате основная плотность нелинейных искажений приходится на область тихих звуков. Это приводит к ограничению динамического диапазона, который в идеале (без учета гармонических искажений) был бы равен соотношению сигнал/шум, однако необходимость ограничения этих искажений снижает динамический диапазон для 16-разрядного кодирования до 50-60 дБ. Положение могло бы спасти логарифмическое квантование, однако его реализация в реальном времени весьма сложна и дорога.

Искажения, вносимые гранулярным шумом, можно уменьшить путем добавления к сигналу обычного белого шума (случайного или псевдослучайного сигнала), амплитудой в половину младшего значащего разряда; такая операция называется сглаживанием (dithering). Это приводит к незначительному увеличению уровня шума, зато ослабляет корреляцию ошибок квантования с высокочастотными компонентами сигнала и улучшает субъективное восприятие. Сглаживание применяется также перед округлением отсчетов при уменьшении их разрядности. По существу, dithering и noise shaping являются частными случаями одной технологии — с той разницей, что в первом случае используется белый шум с равномерным спектром, а во втором — шум со специально "формованным" спектром.

При восстановлении звука из цифровой формы в аналоговую возникает проблема сглаживания ступенчатой формы сигнала и подавления гармоник, вносимых частотой дискретизации. Из-за неидеальности АЧХ фильтров может происходить либо недостаточное подавление этих помех, либо избыточное ослабление полезных высокочастотных составляющих. Плохо подавленные гармоники частоты дискретизации искажают форму аналогового сигнала (особенно в области высоких частот), что создает впечатление "шероховатого", "грязного" звука.

Какие интерфейсы используются для передачи цифрового звука?

S/PDIF (Sony/Philiрs Digital Interface Format — формат цифрового интерфейса фирм Sony и Philiрs) — цифровой интерфейс для бытовой радиоаппаратуры.

AES/EBU (Audio Engineers Society / European Broadcast Union — общество звукоинженеров / европейское вещательное объединение) — цифровой интерфейс для студийной радиоаппаратуры.

Оба интерфейса являются последовательными и используют одинаковый формат сигнала и систему кодирования — самосинхронизирующийся код BMC (Biphase-Mark Code — код с представлением единицы двойным изменением фазы), и могут передавать сигналы в формате PCM разрядностью до 24 бит на частотах дискретизации до 48 кГц.

Каждый отсчет сигнала передается 32-разрядным словом, в котором 20 разрядов используются для передачи отсчета, а 12 — для формирования синхронизирующей преамбулы, передачи дополнительной информации и бита четности. 4 разряда из служебной группы могут использоваться для расширения формата отсчетов до 24 разрядов.

Помимо бита четности, служебная часть слова содержит бит достоверности (Validity), который должен быть нулевым для каждого достоверного отсчета. В случае приема слова с единичным битом Validity либо с нарушением четности в слове приемник трактует весь отсчет как ошибочный и может на выбор либо заменить его предыдущим значением, либо интерполировать на основе нескольких соседних достоверных отсчетов. Отсчеты, помеченные как недостоверные, могут передавать CD-проигрыватели, DAT-магнитофоны и другие устройства, если при считывании информации с носителя не удалось скорректировать возникшие в процессе чтения ошибки.

Стандартно формат кодирования предназначен для передачи одно- и двух-канального сигнала, однако при использовании служебных разрядов для кодирования номера канала возможна передача многоканального сигнала.

С электрической стороны S/PDIF предусматривает соединение коаксиальным кабелем с волновым сопротивлением 75 Ом и разъемами типа RCA ("тюльпан"), амплитуда сигнала — 0.5 В. AES/EBU предусматривает соединение симметричным экранированным двухпроводным кабелем с трансформаторной развязкой по интерфейсу RS-422 с амплитудой сигнала 3-10 В, разъемы — трехконтактные типа Cannon XLR. Существуют также оптические варианты приемопередатчиков — TosLink (пластмассовое оптоволокно) и AT&T Link (стеклянное оптоволокно).

Какие методы используются для эффективного сжатия цифрового звука?

  • 1 — коэффициент сжатия 1:4 при потоке данных 384 кбит/с;
  • 2 — 1:6..1:8 при 256..192 кбит/с;
  • 3 — 1:10..1:12 при 128..112 кбит/с.

Какие форматы используются для представления цифрового звука?

  • CD (Compact Disk — компакт-диск) — односторонний пластмассовый диск с оптической лазерной записью и считыванием, диаметром 120 или 90 мм, вмещающий максимум 74 минуты стереозвучания с частотой дискретизации 44.1 кГц и 16-разрядным линейным квантованием. Система предложена фирмами Sony и Philips и носит название CD-DA (Compact Disk — Digital Audio). Для защиты от ошибок используется двойной код Рида-Соломона с перекрестным перемежением (Cross Interleaved Reed-Solomon Code, CIRC) и модуляция кодом Хэмминга 8-14 (Eight-to-Fourteen Modulation, EFM). Различаются штампованные (CD) однократно записываемые (CD-R) и многократно перезаписываемые (CD-RW) компакт-диски.
  • ИКМ-приставка (PCM deck) — система для преобразования цифрового звукового сигнала в псевдовидеосигнал, совместимый с популярными видеоформатами (NTSC, PAL/SECAM), и обратно. ИКМ-приставки применяются в сочетании с бытовыми (VHS) или студийными (S-VHS, Beta, U-Matic) видеомагнитофонами, используя их в качестве устройств чтения/записи. Устройства работают с 16-разрядным линейным квантованием на частотах дискретизации 44,056 кГц (NTSC) и 44,1 кГц (PAL/SECAM), и позволяют записывать двух- или четырехканальную цифровую сигналограмму. По сути, такая приставка представляет собой модем (модулятор-демодулятор) для видеосигнала.
  • S-DAT (Stationary head Digital Audio Tape — цифровая звуковая лента с неподвижной головкой) — система наподобие обычного кассетного магнитофона, запись и чтение в которой ведутся блоком неподвижных тонкопленочных головок на ленте шириной 3.81 мм в двухсторонней кассете размером 86 x 55.5 x 9.5 мм. Реализует 16-разрядную запись двух или четырех каналов на частотах 32, 44.1 и 48 кГц.
  • R-DAT (Rotary head Digital Audio Tape — цифровая звуковая лента с вращающейся головкой) — система наподобие видеомагнитофона с поперечно-наклонной записью вращающимися головками. Наиболее популярный формат ленточной цифровой записи, системы R-DAT часто обозначаются просто DAT. В R-DAT используется кассета размером 73 × 54 × 10,5 мм, с лентой шириной 3,81 мм, а сама система кассеты и магнитофона очень похожа на типовой видеомагнитофон. Базовая скорость движения ленты — 8,15 мм/с, скорость вращения блока головок — 2000 об/мин. R-DAT работает с двухканальным (в ряде моделей — четырехканальным) сигналом на частотах дискретизации 44,1 и 48 кГц с 16-разрядном линейным квантованием, и 32 кГц — с 12-разрядным нелинейным. Для защиты от ошибок используется двойной код Рида-Соломона и модуляция кодом 8-10. Емкость кассеты — 80..240 минут в зависимости от скорости и длины ленты. Бытовые DAT-магнитофоны обычно оснащены системой защиты от незаконного копирования фонограмм, не допускающей записи с аналогового входа на частоте 44,1 кГц, а также прямого цифрового копирования при наличии запрещающих кодов SCMS (Serial Code Managenent System). Студийные магнитофоны таких ограничений не имеют.
  • DASH (Digital Audio Stationary Head) — система с записью на магнитную ленту шириной 6.3 и 12.7 мм в продольном направлении неподвижными головками. Скорость движения ленты — 19,05, 38,1, 76,2 см/с. Реализует 16-разрядную запись с частотами дискретизации 44,056, 44,1 и 48 кГц от 2 до 48 каналов.
  • ADAT (Alesis DAT) — собственная (proprietary) система восьмиканальной записи звука на видеокассету типа S-VHS, разработанная фирмой Alesis. Использует 16-разрядное линейное квантование на частоте 48 кГц, емкость кассеты составляет до 60 минут на каждый канал. Магнитофоны ADAT допускают каскадное соединение, в результате чего может быть собрана система 128-канальной синхронной записи. Для ADAT выпускается множество различных интерфейсных блоков для сопряжения с DAT, CD, MIDI и т.п. Модель Meridian (ADAT Type II) использует 20-разрядное квантование на частотах 44,1 и 48 кГц.
  • DCC (Digital Compact Cassette — цифровая компакт-кассета) — бытовая система записи в продольном направлении на стандартную компакт-кассету, разработанная Philips. Скорость движения ленты — 4.76 см/с, максимальное время звучания такое же, как при аналоговой записи. Частоты дискретизации — 32, 44,1, 48 кГц, разрешение — 16/18 разрядов (метод сжатия PASC). На DCC-магнитофонах могут воспроизводиться (но не записываться) обычные аналоговые компакт-кассеты. В настоящее время система DCC признана неперспективной.
  • MD (MiniDisk) — бытовая и концертная система записи на магнитооптический диск, разработанная Sony. Диск диаметром 64 мм, помещенный в пластмассовый футляр размером 70 × 67,5 × 5 мм, вмещает 74 минуты (60 в ранних версиях) стереофонического звучания. При обмене со внешними устройствами используется формат 16-разрядных отсчетов на частоте 44,1 кГц, однако на сам диск сигнал записывается после сжатия методом ATRAC.

  • Microsoft RIFF/WAVE (Resource Interchange File Format/Wave — формат файлов передачи ресурсов/волновая форма) — стандартный формат звуковых файлов в компьютерах IBM PC. Файл этого формата содержит заголовок, описывающий общие параметры файла, и один или более фрагментов (chunks), каждый из которых представляет собой волновую форму или вспомогательную информацию — режимы и порядок воспроизведения, пометки, названия и координаты участков волны и т.п. Файлы этого формата имеют расширение .WAV.
  • Apple AIFF (Audio Interchange File Format — формат файла обмена звуком) — стандартный тип звукового файла в системах Apple Macintosh. Похож на RIFF и также позволяет размещать вместе со звуковой волной дополнительную информацию, в частности — самплы WaveTable-инструментов вместе с параметрами синтезатора.
  • Формат "чистой оцифровки" RAW, не содержащий заголовка и представляющий собой только последовательность отсчетов звуковой волны. Обычно оцифровка хранится в 16-разрядном знаковом (signed) формате, когда первыми в каждой паре идут отсчеты левого канала, хотя могут быть и исключения.

Как выполняется обработка цифрового звука?

Цифровой звук обрабатывается посредством математических операций, применяемых к отдельным отсчетам сигнала, либо к группам отсчетов различной длины. Выполняемые математические операции могут либо имитировать работу традиционных аналоговых средств обработки (микширование двух сигналов — сложение, усиление/ослабление сигнала — умножение на константу, модуляция — умножение на функцию и т.п.), либо использовать альтернативные методы — например, разложение сигнала в спектр (ряд Фурье), коррекция отдельных частотных составляющих, затем обратная "сборка" сигнала из спектра.

Обработка цифровых сигналов подразделяется на линейную (в реальном времени, над "живым" сигналом) и нелинейную — над предварительно записанным сигналом. Линейная обработка требует достаточного быстродействия вычислительной системы (процессора); в ряде случаев невозможно совмещение требуемого быстродействия и качества, и тогда используется упрощенная обработка с пониженным качеством. Нелинейная обработка никак не ограничена во времени, поэтому для нее могут быть использованы вычислительные средства любой мощности, а время обработки, особенно с высоким качеством, может достигать нескольких минут и даже часов.

Для обработки применяются как универсальные процессоры общего назначения — Intel 8035, 8051, 80×86, Motorola 68xxx, SPARC — так и специализированные цифровые сигнальные процессоры (Digital Signal Processor, DSP) Texas Instruments TMS xxx, Motorola 56xxx, Analog Devices ADSP-xxxx и др.

Разница между универсальным процессором и DSP состоит в том, что первый ориентирован на широкий класс задач — научных, экономических, логических, игровых и т.п., и содержит большой набор команд общего назначения, в котором преобладают обычные математические и логические операции. DSP специально ориентированы на обработку сигналов и содержат наборы специфический операций — сложение с ограничением, перемножение векторов, вычисление математического ряда и т.п. Реализация даже несложной обработки звука на универсальном процессоре требует значительного быстродействия и далеко не всегда возможна в реальном времени, в то время как даже простые DSP нередко справляются в реальном времени с относительно сложной обработкой, а мощные DSP способны выполнять качественную спектральную обработку сразу нескольких сигналов.

В силу своей специализации DSP редко применяются самостоятельно — чаще всего устройство обработки имеет универсальный процессор средней мощности для управления всем устройством, приема/передачи информации, взаимодействия с пользователем, и один или несколько DSP — собственно для обработки звукового сигнала. Например, для реализации надежной и быстрой обработки сигналов в компьютерных системах применяют специализированные платы с DSP, через которые пропускается обрабатываемый сигнал, в то время как центральному процессору компьютера остаются лишь функции управления и передачи.

Что представляет собой цифровая звуковая рабочая станция?

Digital Audio Workstation (DAW) представляет собой специализированную или универсальную компьютерную систему, способную выполнять запись, хранение, воспроизведение и обработку цифрового звука. Специализированные системы ориентированы исключительно на работу с цифровым звуком и выпускаются в законченном исполнении, допускающем лишь ограниченное расширение, либо нерасширяемые вообще. Универсальные системы представляют собой обычный персональный компьютер, снабженный средствами для ввода/вывода звука (ЦАП/АЦП и/или цифровые интерфейсы) и набором программ для его записи, воспроизведения и обработки. Кроме этого, станция может содержать и другие компоненты — например, аппаратные модули цифровой обработки, музыкальные синтезаторы, записывающие CD-приводы и т.п.

Поскольку любая компьютерная система является сильным источником высокочастотных помех, возникают определенные проблемы в достижении профессионального качества звука при использовании встроенных АЦП/ЦАП. В таких случаях предпочтительно использование внешних модулей АЦП/ЦАП, выдающих и получающих цифровую информацию в реальном времени через универсальные или собственные цифровые интерфейсы.

Какие жесткие диски используются в рабочих станциях?

Большинство специализированных рабочих станций используют для хранения звука жесткие диски с интерфейсом SCSI (Small Computer System Interface — интерфейс малых компьютерных систем), ставшие универсальным стандартом — любая популярная компьютерная система имеет возможность подключения этих дисков. Достоинствами SCSI является универсальность среди всех компьютерных систем, возможность подключения до семи устройств (любых, не только дисковых) к одному контроллеру, хороший арбитраж при конкуренции устройств, интеллектуальность каждого устройства, более высокое общее качество исполнения, возможность использования интерфейса для прямой связи между двумя станциями. К недостаткам SCSI следует отнести высокую стоимость интерфейсов и дисков и ограниченный спектр выпускаемых моделей.

В компьютерах типа IBM PC более популярны жесткие диски с интерфейсом IDE (Integrated Drive Electronics — электроника, встроенная в накопитель), не получившие распространения в других системах. Достоинства IDE-дисков — простота, хорошая производительность, не уступающая большинству SCSI-дисков, а в ряде случаев — превосходящая их, низкая стоимость, массовый выпуск, широкий спектр моделей. Недостатки — низкая производительность и надежность моделей низших классов, возможность подключения только двух накопителей к одному контроллеру, невозможность прямого соединения двух станций, часто худшая поддержка драйверами операционных систем.

Есть ли преимущества у SCSI перед IDE при цифровой записи?

Среди пользователей звуковых рабочих станций — как домашних, так и студийных — бытует мнение, что только диски SCSI способны обеспечить нужное быстродействие. Однако, несмотря на ряд очевидных преимуществ SCSI, большинство даже профессиональных рабочих станций на IBM PC вполне может обходиться дисками IDE. Скорость чтения/записи типовых моделей IDE-дисков сегодня (конец 1998 г.) находится на уровне 6-10 Мб/с при времени поиска около 8-10 мс, что равнозначно таким же типовым (не High End) моделям SCSI.

Такой жесткий диск свободно справляется с одновременным чтением 16-разрядных звуковых данных по 20-30 звуковым каналам на частоте дискретизации 48 кГц, и несколько меньшим объемом данных в случае записи. Другое дело, что в случае SCSI его внутренняя оптимизация (сортировка запросов для минимизации перемещения головок в SCSI-2) часто маскирует неоптимальную работу ОС и звуковой программы, а для достижения такого уровня на IDE может потребоваться хороший драйвер ОС и аккуратно сделанная программа (например, DDClip).

Причины нелюбви многих пользователей к IDE-дискам происходят оттого, что с этими дисками они обычно сталкиваются в дешевых, некачественно собранных и протестированных компьютерах средней мощности, состоящих из разномастных компонент, нередко плохо совместимых друг с другом. И напротив — SCSI-диски чаще всего ставятся в более мощные и дорогие модели, содержащие компоненты "уважаемых" производителей, более тщательно собранные и проверенные. Замена во втором варианте диска SCSI на IDE примерно равной производительности и сборка/настройка системы с учетом особенностей IDE во многих случаях не окажет заметного влияния на ее производительность.

Зачем в цифровой записи применяются жесткие диски класса AV?

Класс AV (Audio/Video) у жестких дисков означает их способность предельно равномерно, без пауз, записывать и считывать потоки данных. Такие диски снабжаются внутренним буфером большего размера и не прерывают процесса чтения/записи термокалибровкой системы позиционирования. Для систем цифровой записи, имеющих недостаточное быстродействие и объемы ОЗУ, чтобы сгладить возможные неравномерности в работе обычных дисков, диски класса AV являются единственным возможным выходом.

Следует иметь в виду, что наличие аббревиатуры AV в обозначении диска еще не означает его принадлежности к классу Audio/Video — об этом должно быть явно упомянуто в паспорте диска.

Однако указанная особенность в общем случае необходима только при работе с качественной видеоинформацией, скорость поступления которой составляет порядка 10 мегабайт в секунду на канал. В случае же звуковых систем скорость одноканального 16-разрядного потока с частотой дискретизации 48 кГц на два порядка меньше и составляет всего 94 килобайта в секунду. В то же время почти никакая рабочая станция не в состоянии обеспечить одновременную работу с сотней каналов, как и жесткий диск не в состоянии параллельно обрабатывать такое количество данных, расположенных в разных его участках. В реальных применениях многоканальной записи на одном диске основная часть накладных расходов дисковой подсистемы ложится на перемещение головок между участками записи, а отнюдь не на саму передачу данных. Низкая же скорость звуковых потоков делает более удобной и надежной их буферизацию в ОЗУ компьютера, компенсирующую термокалибровку диска в течение 0.5 — 1 с, нежели использование дорогих и редких дисков AV-класса. К тому же далеко не на всех обычных дисках термокалибровка оказывает заметное влияние на равномерность потока данных.

"Рваная" передача данных может также возникать при использовании "неправильной" операционной системы (DOS, Windows без 32-разрядного драйвера диска и т.п.), недостаточном количестве и размере файловых буферов ОС и записывающей программы, применении дисков низкого класса со скоростью передачи порядка 1-2 мегабайт в секунду и ниже, неправильном подключении диска и т.п. В любом случае, такие ситуации чаще всего говорят о неправильной конфигурации и настройке аппаратной и программной части системы.

Искажается ли цифровой сигнал при передаче и хранении?

Поскольку любой цифровой сигнал представляется реальной электрической кривой напряжения или тока — его форма так или иначе искажается при любой передаче, а "замороженный" для хранения сигнал (сигналограмма) подвержен деградации в силу обычных физических причин. Все эти воздействия на форму несущего сигнала являются помехами, которые до определенной величины не изменяют информационного содержания сигнала, как отдельные искажения и выпадения букв в словах обычно не мешают правильному пониманию этих слов, причем избыточность информации, как и увеличение длины слов, повышает вероятность успешного распознавания. Другими словами, сам несущий сигнал может искажаться, однако переносимая им информация — закодированный звуковой сигнал — в абсолютном большинстве случаев остается неизменной.

Для того, чтобы качество несущего сигнала не ухудшалось, любая передача полезной звуковой информации — копирование, запись на носитель и считывание с него — обязательно должна включать операцию восстановления формы несущего сигнала, а в идеале — и первичного цифрового вида сигнала информационного, и лишь после этого заново сформированный несущий сигнал может быть передан следующему потребителю. В случае прямого копирования без восстановления (например, обычным переписыванием видеокассеты с цифровым сигналом, полученным при помощи ИКМ-приставки, на обычных видеомагнитофонах) качество цифрового сигнала ухудшается, хотя он по-прежнему полностью содержит всю переносимую им информацию. Однако после многократного последовательного копирования или длительного хранения качество ухудшается настолько, что начинают возникать неисправимые ошибки, необратимо искажающие переносимую сигналом информацию. Поэтому копирование и передачу цифровых сигналов необходимо вести только в цифровых устройствах, а при хранении на носителях — своевременно "освежать" не дожидаясь необратимой деградации (для магнитных носителей этот срок оценивается в несколько лет). Правильно переданная или обновленная цифровая сигналограмма качества не теряет и может копироваться и существовать вечно в абсолютно неизменном виде.

Тем не менее, не следует забывать, что корректирующая способность любого кода конечна, а реальные носители далеки от идеальных, поэтому возникновение неисправимых ошибок — на такая уж редкая вещь, особенно при неаккуратном обращении с носителем. При чтении с новых и правильно хранимых DAT-кассет или компакт-дисков в качественных и надежных аппаратах таких ошибок практически не возникает, однако при старении, загрязнении и повреждении носителей и считывающих систем их становится больше. Одиночная неисправленная ошибка почти всегда незаметна на слух благодаря интерполяции, однако она приводит к искажению формы исходного звукового сигнала, а накопление таких ошибок со временем начинает ощущаться и на слух.

Отдельную проблему составляет сложность регистрации неисправленных ошибок, а также проверки идентичности оригинала и копии. Чаще всего конструкторы цифровых звуковых устройств, работающих в реальном времени, не озабочены вопросом точной проверки достоверности передачи, считая вполне достаточными меры, принятые для коррекции ошибок. Невозможность в общем случае повторной передачи ошибочного отсчета или блока приводит к тому, что интерполяция происходит скрытно и после копирования нельзя с уверенностью сказать, точно ли скопирован исходный сигнал. Индикаторы ошибки, имеющиеся в ряде устройств, обычно включаются только в момент ее возникновения, и в случае одиночных ошибок их срабатывание легко может остаться незамеченным. Даже в системах на основе персональных компьютеров чаще всего нет возможности контролировать правильность приема по цифровому интерфейсу или прямого считывания CD; выходом является только многократное повторение операции и сравнение результатов.

И наконец, в принципе возможны ситуации, когда даже незначительные ошибки способны необратимо исказить передаваемую информацию, оставшись при этом незамеченными системой передачи. Другое дело, что вероятность возникновения подобных ошибок исчезающе мала (порядка одной на несколько лет непрерывной передачи сигнала), поэтому такую возможность практически нигде не принимают в расчет.

Страдает ли качество сигнала при цифровой обработке?

Прежде всего, необходимо различать "искажающие" и "неискажающие" виды обработки. К первым относятся операции, изменяющие форму и структуру сигнала — смешивание, усиление, фильтрация, модуляция и т.п., ко вторым — операции монтажа (вырезка, вклейка, наложение) и переноса (копирования).

Качество сигнала может страдать только при "искажающей" обработке, причем любой — и аналоговой, и цифровой. В первом случае это происходит в результате внесения шумов, гармонических, интермодуляционных и других искажений в узлах аналогового тракта, во втором — благодаря конечной точности квантования сигнала и математических вычислений. Все цифровые вычисления выполняются в некоторой разрядной сетке фиксированной длины — 16, 20, 24, 32, 64, 80 и более бит; увеличение разрядности сетки повышает точность вычислений и уменьшает ошибки округления, однако в общем случае не может исключить их полностью. Конечная точность квантования первичного аналогового сигнала приводит к тому, что даже при абсолютно точной обработке полученного цифрового сигнала квантованное значение каждого отсчета все равно отличается от своего идеального значения. Для минимизации искажений при обработке в студиях предпочитают обрабатывать и хранить сигналограммы на мастер-носителях с повышенным разрешением (20, 24 или 32 разряда), даже если результат будет тиражироваться на носителе с меньшим разрешением.

Кроме собственно ошибок вычислений и округления, на точность сильно влияет выбор представления числовых отсчетов сигнала при обработке. Традиционное представление PCM с так называемой фиксированной точкой (fixed point), когда отсчеты представляются целыми числами, наиболее удобно и влечет минимум накладных расходов, однако точность вычислений зависит от масштаба операций — например, при умножении образуются числа вдвое большей разрядности, которые потом приходится приводить обратно к разрядности исходных отсчетов, а это может привести к переполнению разрядной сетки. Компромиссным вариантом служит промежуточное увеличение разрядности отсчетов (например, 16->32), что снижает вероятность переполнения, однако требует большей вычислительной мощности, объема памяти и вносит дополнительные искажения при обратном понижении разрядности. Кроме того, снижению погрешности способствует правильный выбор последовательности коммутативных (допускающих перестановку) операций, группировка дистрибутивных операций, учет особенностей работы конкретного процессора и т.п.

Другим способом увеличения точности является преобразование отсчетов в форму с плавающей точкой (floating point) с разделением на значащую часть — мантиссу и показатель величины — порядок. В этой форме все операции сохраняют разрядность значащей части, и умножение не приводит к переполнению разрядной сетки. Однако, как само преобразование между формами с фиксированной и плавающей точкой, так и вычисления в этой форме требуют на порядки большего быстродействия процессора, что сильно затрудняет их использование в реальном времени.

Несмотря на то, что качество сигнала неизбежно, хоть и незначительно, ухудшается при любой "искажающей" цифровой обработке, некоторые операции при определенных условиях являются полностью и однозначно обратимыми. Например, усиление сигнала по амплитуде в три раза заключается в умножении каждого отсчета на три; если эта операция выполнялась с фиксированной точкой и при этом не возникло переполнения, с помощью деления на три потом можно будет вернуть все отсчеты в исходное состояние, тем самым полностью восстановив первоначальное состояние сигнала. И в то же время после умножения каждый отсчет окажется увеличенным точно в три раза, поэтому ошибка относительно исходного аналогового сигнала, внесенная при квантовании, также увеличится в среднем в три раза, тем самым ухудшив общее качество сигнала.

Сказанное выше демонстрирует, что ухудшение качества при "искажающей" цифровой обработке совсем не обязательно накапливается со временем, хотя в большинстве реальных применений происходит именно так. Кроме того, это не означает, что любая операция цифрового усиления всегда будет однозначно обратимой — это зависит от многих особенностей применения операции. Тем не менее, грамотно и качественно реализованная цифровая обработка может давать существенно меньший уровень искажений, чем такая же аналоговая, разве что это будут искажения разных видов.

Страдает ли качество сигнала при преобразованиях форматов?

Только в том случае, когда в процессе преобразования применяются "искажающие" операции — изменение разрядности отсчета, частоты дискретизации, фильтрование, сжатие с потерями и т.п. Простое увеличение разрядности отсчета с сохранением частоты дискретизации будет неискажающим, однако такое же увеличение, сопряженное с применением сглаживающей функции — уже нет. Уменьшение разрядности отсчета всегда является искажающей операцией, кроме случая, когда преобразуемые отсчеты были получены таким же простым увеличением разрядности — равной или меньшей.

Многие форматы отличаются друг от друга только порядком битов в слове, отсчетов левого и правого каналов в потоке и служебной информацией — заголовками, контрольными суммами, помехозащитными кодами и т.п. Точный способ проверки неискажаемости сигнала заключается в преобразовании нескольких различных потоков (файлов) формата F1 в формат F2, а затем обратно в F1. Если информационная часть каждого потока (файла) при этом будет идентична исходной — данный вид преобразования можно считать неискажающим.

Под информационной частью потока (файла) понимается собственно набор данных, описывающих звуковой сигнал; остальная часть считается служебной и на форму сигнала в общем случае не влияет. Например, если в служебной части файла или потока предусмотрено поле для времени его создания (передачи), то даже в случае полного совпадения информационных частей двух разных файлов или потоков их служебные части окажутся различными, и это будет зафиксировано логическим анализатором в случае потока или программой побайтного сравнения — в случае файла. Кроме этого, временной сдвиг одного сигнала относительно другого, возникающий при выравнивании цифрового потока по границам слов или блоков и состоящий в добавлении нулевых отсчетов в начало и/или конец файла или потока, также приводит к их кажущемуся цифровому несовпадению. В таких ситуациях для проверки идентичности цифровых сигналов необходимо пользоваться специальной аппаратурой или программой.

Как преобразовать цифровой звук из одного формата в другой?

  • Прямой перенос по цифровому интерфейсу, если у обоих систем имеются совместимые цифровые интерфейсы. При этом на компьютерной системе используется программа записи/воспроизведения, формирующая или воспроизводящая стандартный для данной системы звуковой файл.
  • Чтение/запись на специализированных системах стандартных компьютерных носителей. Например, ряд музыкальных рабочих станций использует гибкие диски в форматах стандартных файловых систем IBM PC или Macintosh, либо позволяет прочитать или создать такой диск.
  • Чтение и запись на компьютерной системе специализированных носителей и их специальных форматов, если это позволяет аппаратура и программное обеспечение. Таким образом читаются и пишутся дискеты от Ensoniq, AKAI, Emulator, компакт-диски ряда "чужих" систем, а также читаются и пишутся обычные звуковые компакт-диски.

Какие компьютерные программы используются для обработки звука?

На IBM PC наиболее популярны редакторы Cool Edit Pro (Syntrillium) Sound Forge (Sonic Foundry), WaveLab (Steinberg) и системы многодорожечной записи SAW Plus, Samplitude, N-Track и DDClip. На Apple Macintosh используются программ Alchemy, Deck II, DigiTracks, HyperPrism.

Какие платы применяются для работы с цифровым звуком на IBM PC?

Для любительской работы со звуком, не требующей высокого качества, в принципе достаточно любой звуковой карты, качество которой удовлетворяет ее владельца. Самые дешевые карты типа Edison, Sky Rocket, Media Vision, Sound Blaster Vibra и т.п. обладают достаточно низким качеством преобразования звука. Более хорошим звучанием из простых карт обладают некоторые модели Sound Blaster AWE32, Gravis Ultrasound, Turtle Beach Tropez и некоторые другие. Все эти карты ориентированы на шину ISA и работают с 16-разрядным звуком.

Минимальным уровнем карт, пригодных для более-менее серьезной работы со звуком, принято считать снятую с производства Turtle Beach Tahiti (16 разрядов, 18-разрядный ЦАП) и ее выпускаемый ныне улучшенный вариант Fiji (20 разрядов). Эти карты также сделаны под ISA. Для Fiji существует отдельная дочерняя плата электрического интерфейса S/PDIF.

Представляет интерес 20-разрядная карта Terratec EWS64XL, АЦП и ЦАП которой обеспечивают 16- и 18-разрядную точность, а электрический и оптический интерфейс S/PDIF — 20-разрядную.

Более высокий класс ISA-карт представлен серией 24-разрядных карт AdB Multi!Wav с цифровыми интерфейсами S/PDIF и AES/EBU и синхронизацией Word Clock: Digital Pro18 (18-разрядный мониторный ЦАП), Digital Pro24 (24-разрядный мониторный ЦАП), Analog Pro24 (24-разрядные ЦАП и АЦП, без цифровых интерфейсов). 20-разрядная карта Zefiro Acoustics ZA-2 имеет электрические и оптические интерфейсы S/PDIF и AES/EBU, 24-разрядный DSP и мониторный ЦАП.

Спектр карт для шины PCI открывает давно известная, хоть и устаревшая, AudioMedia III (24 разряда, четыре 18-разрядных АЦП/ЦАП, вход/выход S/PDIF, 24-разрядная обработка в DSP). В последнее время популярны три 24-разрядные карты Event Electonics с 20-разрядными ЦАП/АЦП и 24-разрядным DSP: Darla (2 АЦП, 8 ЦАП), Gina (2 АЦП, 8 ЦАП, S/PDIF) и Layla (8 АЦП и 10 ЦАП в выносном модуле, S/PDIF, MIDI, Word Clock).

Связана ли разрядность отсчета с разрядностью канала передачи?

Никоим образом. В сущности, почти все современные АЦП и ЦАП — и 16-, и 20-, и 24-разрядные — работают с последовательными потоками однобитовых данных, точно так же передается информация в большинстве цифровых интерфейсов и хранится на цифровых носителях. При этом частота следования отдельных битов, составляющих отсчет, повышается настолько, чтобы обеспечить передачу нужного количества битов в течение интервала дискретизации, что полностью эквивалентно параллельной передаче отсчетов непосредственно с частотой дискретизации.

Также в ряде систем используется последовательно-параллельная переда- ча, когда отсчеты передаются группами битов меньшей длины (обычно бай- тами). Например, большинство 16-разрядных компьютерных звуковых карт использует для передачи отсчетов 8-разрядные каналы прямого доступа к памяти (DMA), где каждый 16-разрядный отсчет передается последователь- ностью из двух байтов. Пропускной способности DMA достаточно для од- новременной передачи более десяти стереофонических 16-разрядных звуко- вых потоков с частотой дискретизации 44.1 кГц, так что такие карты ни- чуть не уступают моделям, использующим 16-разрядные каналы, а разница в качестве звука обусловлена сугубо параметрами АЦП и ЦАП.

Что такое джиттер?

Jitter — дрожание (быстрые колебания) фазы синхросигналов в цифровых системах, приводящее к неравномерности во времени моментов срабатывания тактируемых этими сигналами цифровых устройств. Сами по себе цифровые устройства нечувствительны к таким колебаниям, пока они не достигают значительной величины по сравнению с общей длительностью импульсов, однако в "пограничных" устройствах, находящихся на стыке цифровой и аналоговой частей схемы — АЦП и ЦАП — джиттер приводит к неравномерности моментов срабатывания компараторов АЦП или ключей ЦАП, приводящей к нарушению правильности формы аналогового сигнала. Для высокочастотных компонент сигнала дрожание фазы приводит к "размыванию" звука — нарушению субъективной пространственной локализации источников, поскольку слуховое восприятие локализации базируется в основном на фазовых, а не на амплитудных соотношениях стереоканалов.

Джиттер может возникать из-за любой нестабильности напряжений и токов в области ЦАП/АЦП. Например, колебания питающих напряжений изменяют частоту опорного генератора, наводки на провода и печатные дорожки искажают форму цифровых сигналов. Даже если эти искажения не изменяют информационного содержимого сигнала — заключенной в нем битовой последовательности, они могут нарушить равномерность опроса входного звукового сигнала в АЦП или выдачу выходного сигнала с ЦАП и привести к искажениям формы, особенно заметной в области высоких частот.

Величина джиттера обозначает максимальное абсолютное отклонение момента перехода тактового сигнала из одного состояния в другое от расчетного значения, и измеряется в секундах. Для систем среднего качества допустимая величина джиттера составляет порядка 100 пикосекунд, для систем класса Hi-Fi ее стараются предельно минимизировать.

Для борьбы с джиттером используется тактирование АЦП и ЦАП высокостабильными генераторами, а для подавления неравномерности цифрового потока, поступающего на ЦАП — промежуточными буферами типа FIFO (очередь). Для уменьшения влияния помех применяются обычные методы — экранирование, развязки, исключение "земляных петель", раздельные источники питания, питание критичных схем от аккумулятора и т.п. Хорошие результаты дают внешние модули ЦАП, в которых реализованы описанные методы — например, Audio Alchemy DAC-in-the-Box и другие.

Необходимо различать "пограничный" джиттер, действующий на границах аналоговой и цифровой части схемы — в области АЦП или ЦАП, и "внутренний", возникающий в любых других участках чисто цифровой схемы. Влияние на звуковой сигнал имеет только "пограничный" джиттер, ибо только он непосредственно связан с преобразованием аналогового звукового сигнала. Весь "внутренний" джиттер при грамотном построении схемы должен полностью подавляться в интерфейсных цепях, однако некорректная реализация может пропускать его и непосредственно на ЦАП/АЦП.

Может ли джиттер передаваться при копировании?

Возникающий в цепях формирования, обработки, передачи, записи и чтения цифровых сигналов "внутренний" джиттер вполне может распространяться по системе, выходить за ее пределы и переноситься между системами через цифровые интерфейсы передачи или цифровые же носители информации. При этом величина джиттера может как ослабляться, так и усиливаться. При использовании интерфейсов передачи со "встроенным" (embedded) синхросигналом, а также при чтении с любого носителя, приемная сторона вынуждена синхронизироваться с передатчиком путем использования систем фазовой автоподстройки частоты (ФАПЧ, Phase Locked Loop — PLL), которая вносит дополнительные дрожания, будучи не в состоянии мгновенно отслеживать изменения фазы и частоты принимаемого сигнала.

Один из возможных способов ослабления джиттера при передаче — использование синхронных интерфейсов с отдельным тактовым сигналом (Word Clock), а еще лучше — асинхронных двунаправленных с возможностью согласования темпа передачи, наподобие RS-232. В этом случае стороны могут не опасаться возможного опустения или переполнения буфера на приемном конце, передача может выполняться блоками с более высокой скоростью, чем идет вывод звука, а приемная сторона может использовать полностью независимый стабильный генератор для извлечения отсчетов из буфера. Однако все это имеет смысл только в том случае, когда приемник работает непосредственно на ЦАП — при записи на носитель неравномерности такой величины влияния на качество звука не оказывают.

Таким образом, в корректно реализованной системе все виды джиттера, возникающие в чисто цифровых блоках и между ними, являются "внутренними" и должны быть подавлены до передачи цифрового сигнала на ЦАП для оконечного преобразования. Это может быть сделано при помощи промежуточного буфера, схемы ФАПЧ с плавным изменением частоты генератора (медленное изменение в небольших пределах, в отличие от дрожания, практически не ощущается на слух), или каким-либо другим методом.

Может ли один и тот же цифровой сигнал звучать по-разному?

Для слуховой оценки звукового сигнала его необходимо воспроизвести либо одновременно на двух разных системах, либо последовательно — на одной. Даже если в обоих случаях сам цифровой сигнал будет одинаковым, набор сопутствующих условий — аппарат, носитель, его микроструктура, первичные сигналы при считывании информации, особенности работы декодеров, спектр аналоговых шумов и помех — почти всегда будет различен. Все эти побочные процессы могут создавать паразитные наводки, искажающие форму цифрового сигнала, порождающие джиттер, воздействующие на цепи питания и прочие аналоговые компоненты системы. В правильно сконструированных и тщательно выполненных аппаратах все эти влияния должны быть подавлены до уровня, недоступного восприятию, однако для большинства бытовых и особенно бюджетных аппаратов это не так.

Могут быть и более прозаичные причины для возникновения разницы — такие, как неустойчивое считывание цифрового носителя, при котором декодер не в состоянии однозначно восстановить закодированный звуковой сигнал и вынужден прибегать к его интерполяции, ухудшающей качество звучания. Такая же интерполяция или гашение отсчетов происходит в случае ошибочного их приема по цифровым межсистемным интерфейсам, что может быть вызвано плохим качеством или чрезмерной длиной кабеля, воздействием на него сильных помех, неисправностью приемника или передатчика, плохой их совместимостью и т.п. Поэтому вопрос о сравнении звучания должен рассматриваться только после того, как доказана идентичность цифровых потоков, поступающих на оконечный ЦАП. Под ЦАП здесь должен пониматься именно неделимый, "самый последний" преобразователь, а не произвольное сложное устройство, получающее на входе цифровой сигнал и выдающее на выходе аналоговый.

Цифровой звук

В последнее время возможности мультимедийного оборудования значительно выросли, однако этой области почему-то не уделяется достаточно внимания. Рядовой пользователь страдает от нехватки информации и вынужден учиться лишь на собственном опыте и ошибках. Этой статьей мы постараемся устранить это досадное недоразумение. Данная статья ориентирована на рядового пользователя и ставит своей целью помочь ему разобраться в теоретических и практических основах цифрового звука, выявить возможности и основные приемы его использования.

Что именно мы знаем о звуковых возможностях компьютера, кроме того, что в нашем домашнем компьютере установлена звуковая плата и две колонки? К сожалению, вероятно из-за недостаточности литературы или по каким-либо другим причинам, но пользователь, чаще всего, не знаком ни с чем, кроме встроенного в Windows микшера аудио входов/выходов и Recorder’а. Единственное использование звуковой карты, которое находит простой пользователь – это вывод звука в играх, да прослушивание коллекции аудио. А, ведь, даже самая простая на сегодняшний день звуковая плата, установленная почти в каждом компьютере, умеет намного больше — она открывает широчайшие возможности для всех, кто любит и интересуется музыкой и звуком, а для тех, кто хочет создавать свою музыку, звуковая карта может стать всемогущим инструментом. Для того чтобы узнать что же умеет компьютер в области звука нужно только поинтересоваться и перед вами откроются возможности, о которых вы, может быть, даже не догадывались. И все это не так сложно, как может показаться на первый взгляд.

Некоторые факты и понятия, без которых тяжело обойтись:

В соответствии с теорией математика Фурье, звуковую волну можно представить в виде спектра входящих в нее частот.

Справка: человеческий слуховой аппарат/мозг способен различать частотные составляющие звука в пределах от 20 Гц до

20 КГц (верхняя граница может колебаться в зависимости от возраста и других факторов). Кроме того, нижняя граница сильно колеблется в зависимости от интенсивности звучания.

Оцифровка звука и его хранение на цифровом носителе

Цифровой звук – это способ представления электрического сигнала посредством дискретных численных значений его амплитуды. Допустим, мы имеем аналоговую звуковую дорожку хорошего качества (говоря «хорошее качество» будем предполагать нешумную запись, содержащую спектральные составляющие из всего слышимого диапазона частот – приблизительно от 20 Гц до 20 КГц) и хотим «ввести» ее в компьютер (то есть оцифровать) без потери качества. Как этого добиться и как происходит оцифровка? Звуковая волна – это некая сложная функция, зависимость амплитуды звуковой волны от времени. Казалось бы, что раз это функция, то можно записать ее в компьютер «как есть», то есть описать математический вид функции и сохранить в памяти компьютера. Однако практически это невозможно, поскольку звуковые колебания нельзя представить аналитической формулой (как y=x 2 , например). Остается один путь – описать функцию путем хранения ее дискретных значений в определенных точках. Иными словами, в каждой точке времени можно измерить значение амплитуды сигнала и записать в виде чисел. Однако и в этом методе есть свои недостатки, так как значения амплитуды сигнала мы не можем записывать с бесконечной точностью, и вынуждены их округлять. Говоря иначе, мы будем приближать эту функцию по двум координатным осям – амплитудной и временной (приближать в точках – значит, говоря простым языком, брать значения функции в точках и записывать их с конечной точностью). Таким образом, оцифровка сигнала включает в себя два процесса — процесс дискретизации (осуществление выборки) и процесс квантования. Процесс дискретизации — это процесс получения значений величин преобразуемого сигнала в определенные промежутки времени.

Квантование — процесс замены реальных значений сигнала приближенными с определенной точностью (рис. 3).

Таким образом, оцифровка – это фиксация амплитуды сигнала через определенные промежутки времени и регистрация полученных значений амплитуды в виде округленных цифровых значений (так как значения амплитуды являются величиной непрерывной, нет возможности конечным числом записать точное значение амплитуды сигнала, именно поэтому прибегают к округлению). Записанные значения амплитуды сигнала называются отсчетами. Очевидно, что чем чаще мы будем делать замеры амплитуды (чем выше частота дискретизации) и чем меньше мы будем округлять полученные значения (чем больше уровней квантования), тем более точное представление сигнала в цифровой форме мы получим. Оцифрованный сигнал в виде набора последовательных значений амплитуды можно сохранить.

Теперь о практических проблемах. Во-первых, надо иметь в виду, что память компьютера не бесконечна, так что каждый раз при оцифровке необходимо находить какой-то компромисс между качеством (напрямую зависящим от использованных при оцифровке параметров) и занимаемым оцифрованным сигналом объемом.

Во-вторых, согласно теореме Котельникова частота дискретизации устанавливает верхнюю границу частот оцифрованного сигнала, а именно, максимальная частота спектральных составляющих равна половине частоты дискретизации сигнала. Попросту говоря, чтобы получить полную информацию о звуке в частотной полосе до 22050 Гц, необходима дискретизация с частотой не менее 44.1 КГц.

Существуют и другие проблемы и нюансы, связанные с оцифровкой звука. Не сильно углубляясь в подробности отметим, что в «цифровом звуке» из-за дискретности информации об амплитуде оригинального сигнала появляются различные шумы и искажения (под фразой «в цифровом звуке есть такие-то частоты и шумы» подразумевается, что когда этот звук будет преобразован обратно из цифрового вида в аналоговый, то в его звучании будут присутствовать упомянутые частоты и шумы). Так, например, джиттер (jitter) – шум, появляющийся в результате того, что осуществление выборки сигнала при дискретизации происходит не через абсолютно равные промежутки времени, а с какими-то отклонениями. То есть, если, скажем, дискретизация проводится с частотой 44.1 КГц, то отсчеты берутся не точно каждые 1/44100 секунды, а то немного раньше, то немного позднее. А так как входной сигнал постоянно меняется, то такая ошибка приводит к «захвату» не совсем верного уровня сигнала. В результате во время проигрывания оцифрованного сигнала может ощущаться некоторое дрожание и искажения. Появление джиттера является результатом не абсолютной стабильности аналогово-цифровых преобразователей. Для борьбы с этим явлением применяют высокостабильные тактовые генераторы. Еще одной неприятностью является шум дробления. Как мы говорили, при квантовании амплитуды сигнала происходит ее округление до ближайшего уровня. Такая погрешность вызывает ощущение «грязного» звучания.

Небольшая справка: стандартные параметры записи аудио компакт-дисков следующие: частота дискретизации — 44.1 КГц, уровень квантования – 16 бит. Такие параметры соответствуют 65536 (2 16 ) уровням квантования амплитуды при взятии ее значений 44100 раз в секунду.

На практике, процесс оцифровки (дискретизация и квантование сигнала) остается невидимым для пользователя — всю черновую работу делают разнообразные программы, которые дают соответствующие команды драйверу (управляющая подпрограмма операционной системы) звуковой карты. Любая программа (будь то встроенный в Windows Recorder или мощный звуковой редактор), способная осуществлять запись аналогового сигнала в компьютер, так или иначе оцифровывает сигнал с определенными параметрами, которые могут оказаться важными в последующей работе с записанным звуком, и именно по этой причине важно понять как происходит процесс оцифровки и какие факторы влияют на ее результаты.

Преобразование звука из цифрового вида в аналоговый

Как после оцифровки прослушивать звук? То есть, как преобразовывать его обратно из цифрового вида в аналоговый?

Для преобразования дискретизованного сигнала в аналоговый вид, пригодный для обработки аналоговыми устройствами (усилителями и фильтрами) и последующего воспроизведения через акустические системы, служит цифроаналоговый преобразователь (ЦАП). Процесс преобразования представляет собой обратный процесс дискретизации: имея информацию о величине отсчетов (амплитуды сигнала) и беря определенное количество отсчетов в единицу времени, путем интерполирования происходит восстановление исходного сигнала (рис. 4).

Еще совсем недавно воспроизведение звука в домашних компьютерах было проблемой, так как компьютеры не оснащались специальными ЦАП. Сначала в качестве простейшего звукового устройства в компьютере использовался встроенный динамик (PC speaker). Вообще говоря, этот динамик до сих пор имеется почти во всех PC, но никто уже не помнит как его «раскачать», чтобы он заиграл. Если вкратце, то этот динамик присоединен к порту на материнской плате, у которого есть два положения – 1 и 0. Так вот, если этот порт быстро-быстро включать и выключать, то из динамика можно извлечь более-менее правдоподобные звуки. Воспроизведение различных частот достигается за счет того, что диффузор динамика обладает конечной реакцией и не способен мгновенно перескакивать с места на место, таким образом он «плавно раскачивается» вследствие скачкообразного изменения напряжения на нем. И если колебать его с разной скоростью, то можно получить колебания воздуха на разных частотах. Естественной альтернативой динамику стал так называемый Covox – это простейший ЦАП, выполненный на нескольких подобранных сопротивлениях (или готовой микросхеме), которые обеспечивают перевод цифрового представления сигнала в аналоговый – то есть в реальные значения амплитуды. Covox прост в изготовлении и поэтому он пользовался успехом у любителей вплоть до того времени, когда звуковая карта стала доступной всем.

В современном компьютере звук воспроизводится и записывается с помощью звуковой карты, подключаемой либо встроенной в материнскую плату компьютера. Задача звуковой карты в компьютере – ввод и вывод аудио. Практически это означает, что звуковая карта является тем преобразователем, который переводит аналоговый звук в цифровой и обратно. Если описывать упрощенно, то работа звуковой карты может быть пояснена следующим образом. Предположим, что на вход звуковой карты подан аналоговый сигнал и карта включена (программно) в режим записи. Сначала входной аналоговый сигнал попадает в аналоговый микшер, который занимается смешением сигналов и регулировкой громкости и баланса. Микшер необходим, в частности, для предоставления возможности пользователю управлять уровнями записи. Затем отрегулированный и сбалансированный сигнал попадает в аналогово-цифровой преобразователь, где сигнал дискретизуется и квантуется, в результате чего в компьютер по шине данных направляется бит-поток, который и представляет собой оцифрованный аудио сигнал. Вывод аудио информации почти аналогичен вводу, только происходит в обратную сторону. Поток данных, направленный в звуковую карту, преодолевает цифро-аналоговый преобразователь, который образует из чисел, описывающих амплитуду сигнала, электрический сигнал; полученный аналоговый сигнал может быть пропущен через любые аналоговые тракты для дальнейших преобразований, в том числе и для воспроизведения. Надо отметить, что если звуковая карта оборудована интерфейсом для обмена цифровыми данными, то при работе с цифровым аудио никакие аналоговые блоки карты не задействуются.

Способы хранения цифрового звука

Для хранения цифрового звука существует много различных способов. Как мы говорили, оцифрованный звук являет собой набор значений амплитуды сигнала, взятых через определенные промежутки времени. Таким образом, во-первых, блок оцифрованной аудио информации можно записать в файл «как есть», то есть последовательностью чисел (значений амплитуды). В этом случае существуют два способа хранения информации.

Первый — PCM (Pulse Code Modulation — импульсно-кодовая модуляция) — способ цифрового кодирования сигнала при помощи записи абсолютных значений амплитуд (бывают знаковое или беззнаковое представления). Именно в таком виде записаны данные на всех аудио CD.

Второй способ — ADPCM (Adaptive Delta PCM — адаптивная относительная импульсно-кодовая модуляция) – запись значений сигнала не в абсолютных, а в относительных изменениях амплитуд (приращениях). Во-вторых, можно сжать или упростить данные так, чтобы они занимали меньший объем памяти, нежели будучи записанными «как есть». Тут тоже имеются два пути.

Кодирование данных без потерь (lossless coding) — это способ кодирования аудио, который позволяет осуществлять стопроцентное восстановление данных из сжатого потока. К такому способу уплотнения данных прибегают в тех случаях, когда сохранение оригинального качества данных критично. Например, после сведения звука в студии звукозаписи, данные необходимо сохранить в архиве в оригинальном качестве для возможного последующего использования. Существующие сегодня алгоритмы кодирования без потерь (например, Monkeys Audio) позволяют сократить занимаемый данными объем на 20-50%, но при этом обеспечить стопроцентное восстановление оригинальных данных из полученных после сжатия. Подобные кодеры – это своего рода архиваторы данных (как ZIP, RAR и другие), только предназначенные для сжатия именно аудио.

Имеется и второй путь кодирования, на котором мы остановимся чуть подробнее, – кодирование данных с потерями (lossy coding). Цель такого кодирования — любыми способами добиться схожести звучания восстановленного сигнала с оригиналом при как можно меньшем объеме упакованных данных. Это достигается путем использования различных алгоритмов «упрощающих» оригинальный сигнал (выкидывая из него «ненужные» слабослышимые детали), что приводит к тому, что декодированный сигнал фактически перестает быть идентичным оригиналу, а лишь похоже звучит. Методов сжатия, а также программ, реализующих эти методы, существует много. Наиболее известными являются MPEG-1 Layer I,II,III (последним является всем известный MP3), MPEG-2 AAC (advanced audio coding), Ogg Vorbis, Windows Media Audio (WMA), TwinVQ (VQF), MPEGPlus, TAC, и прочие. В среднем, коэффициент сжатия, обеспечиваемый такими кодерами, находится в пределах 10-14 (раз). Надо особо подчеркнуть, что в основе всех lossy-кодеров лежит использование так называемой психоакустической модели, которая как раз и занимается «упрощением» оригинального сигнала. Говоря точнее, механизм подобных кодеров выполняет анализ кодируемого сигнала, в процессе которого определяются участки сигнала, в определенных частотных областях которых имеются неслышные человеческому уху нюансы (замаскированные или неслышимые частоты), после чего происходит их удаление из оригинального сигнала. Таким образом, степень сжатия оригинального сигнала зависит от степени его «упрощения»; сильное сжатие достигается путем «агрессивного упрощения» (когда кодер «считает» ненужными множественные нюансы), такое сжатие, естественно, приводит к сильной деградации качества, поскольку удалению могут подлежать не только незаметные, но и значимые детали звучания.

Как мы сказали, современных lossy-кодеров существует достаточно много. Наиболее распространенный формат – MPEG-1 Layer III (всем известный MP3). Формат завоевал свою популярность совершенно заслуженно – это был первый распространенный кодек подобного рода, который достиг столь высокого уровня компрессии при отличном качестве звучания. Сегодня этому кодеку имеется множество альтернатив, выбор остается за пользователем. К сожалению, рамки статьи не позволяют привести здесь тестирования и сравнения существующих кодеков, однако авторы статьи позволят себе привести некоторую информацию, полезную при выборе кодека.

Итак, преимущества MP3 – широкая распространенность и достаточно высокое качество кодирования, которое объективно улучшается благодаря разработкам различных кодеров MP3 энтузиастами (например, кодер Lame). Мощная альтернатива MP3 – кодек Microsoft Windows Media Audio (Файлы .WMA и .ASF). По различным тестам этот кодек показывает себя от «как MP3» до «заметно хуже MP3» на средних битрейтах, и, чаще, «лучше MP3» на низких битрейтах. Ogg Vorbis (файлы .OGG) – совершенно свободный от лицензирования кодек, создаваемый независимыми разработчиками. Чаще всего ведет себя лучше MP3, недостатком является лишь малая распространенность, что может стать критическим аргументом при выборе кодека для длительного хранения аудио. Вспомним и еще молодой кодек MP3 Pro, анонсированный в июле 2001 года компанией Coding Technologies совместно с Thomson Multimedia. Кодек является продолжением, или, точнее, развитием старого MP3 – он совместим с MP3 назад (полностью) и вперед (частично). За счет использования новой технологии SBR (Spectral Band Replication), кодек ведет себя заметно лучше других форматов на низких битрейтах, однако качество кодирования на средних и высоких битрейтах чаще уступает качеству почти всех описанных кодеков. Таким образом, MP3 Pro пригоден больше для ведения аудио трансляций в Internet, а также для создания превью песен и музыки.

Говоря о способах хранения звука в цифровом виде нельзя не вспомнить и о носителях данных. Всем привычный аудио компакт-диск, появившийся в начале 80-х годов, широкое распространение получил именно в последние годы (что связано с сильным удешевлением носителя и приводов). А до этого носителями цифровых данных являлись кассеты с магнитной лентой, но не обычные, а специально предназначенные для так называемых DAT-магнитофонов. Ничего примечательного – магнитофоны как магнитофоны, однако цена на них всегда была высокой, и такое удовольствие было не всем «по зубам». Эти магнитофоны использовались, в основном, в студиях звукозаписи. Преимущество таких магнитофонов было в том, что, не смотря на использование привычных носителей, данные на них хранились в цифровом виде и практически никаких потерь при чтении/записи на них не было (что очень важно при студийной обработке и хранении звука). Сегодня появилось большое количество различных носителей данных, кроме привычных всем компакт дисков. Носители совершенствуются и с каждым годом становятся более доступными и компактными. Это открывает большие возможности в области создания мобильных аудио проигрывателей. Уже сегодня продается огромное количество различных моделей переносных цифровых плееров. И, можно предположить, что это еще далеко не пик развития такого рода техники.

Преимущества и недостатки цифрового звука

С точки зрения обычного пользователя выгоды много — компактность современных носителей информации позволяет ему, например, перевести все диски и пластинки из своей коллекции в цифровое представление и сохранить на долгие годы на небольшом трехдюймовом винчестере или на десятке-другом компакт дисков; можно воспользоваться специальным программным обеспечением и хорошенько «почистить» старые записи с бобин и пластинок, удалив из их звучания шумы и треск; можно также не просто скорректировать звучание, но и приукрасить его, добавить сочности, объемности, восстановить частоты. Помимо перечисленных манипуляций со звуком в домашних условиях, Интернет тоже приходит на помощь аудио-любителю. Например, сеть позволяет людям обмениваться музыкой, прослушивать сотни тысяч различных Интернет-радио станций, а также демонстрировать свое звуковое творчество публике, и для этого нужен всего лишь компьютер и Интернет. И, наконец, в последнее время появилась огромная масса различной портативной цифровой аудио аппаратуры, возможности даже самого среднего представителя которой зачастую позволяют с легкостью взять с собой в дорогу коллекцию музыки, равную по длительности звучания десяткам часов.

С точки зрения профессионала цифровой звук открывает поистине необъятные возможности. Если раньше звуковые и радио студии размещались на нескольких десятках квадратных метров, то теперь их может заменить хороший компьютер, который по возможностям превосходит десять таких студий вместе взятых, а по стоимости оказывается многократно дешевле одной. Это снимает многие финансовые барьеры и делает звукозапись более доступной и профессионалу и простому любителю. Современное программное обеспечение позволяет делать со звуком все что угодно. Раньше различные эффекты звучания достигались с помощью хитроумных приспособлений, которые не всегда являли собой верх технической мысли или же были просто устройствами кустарного изготовления. Сегодня, самые сложные и просто невообразимые раньше эффекты достигаются путем нажатия пары кнопок. Конечно, вышесказанное несколько утрировано и компьютер не заменяет человека – звукооператора, режиссера или монтажера, однако с уверенностью можно сказать, что компактность, мобильность, колоссальная мощность и обеспечиваемое качество современной цифровой техники, предназначенной для обработки звука, уже сегодня почти полностью вытеснило из студий старую аналоговую аппаратуру.

Конечно, цифровая техника тоже имеет свои недостатки. Многие (профессионалы и любители) отмечают, что аналоговый звук слушался живее. И это не просто дань прошлому. Как мы сказали выше, процесс оцифровки вносит определенную погрешность в звучание, кроме того, различная усиливающая цифровая аппаратура привносит так называемые «транзисторные шумы» и другие специфические искажения. Термину «транзисторный шум», пожалуй, нет точного определения, но можно сказать, что это хаотичные колебания в области высоких частот. Не смотря на то, что слуховой аппарат человека способен воспринимать частоты до 20 кГц, похоже, все-таки, человеческий мозг улавливает и более высокие частоты. И именно на подсознательном уровне человек все же ощущает аналоговое звучание чище, чем цифровое.

Впрочем, у цифрового представления данных есть одно неоспоримое и очень важное преимущество – при сохранном носителе данные на нем не искажаются с течением времени. Если магнитная лента со временем размагничивается и качество записи теряется, если пластинка царапается и к звучанию прибавляются щелчки и треск, то компакт-диск / винчестер / электронная память либо читается (в случае сохранности), либо нет, а эффект старения отсутствует. Важно отметить, мы не говорим здесь об Audio CD (CD-DA – стандарт, устанавливающий параметры и формат записи на аудио компакт диски) так как несмотря на то, что это носитель цифровой информации, эффект старения его, все же, не минует. Это связано с особенностями хранения и считывания аудио данных с Audio CD.

Информация на всех типах компакт-дисков хранится покадрово и каждый кадр имеет заголовок, по которому его возможно идентифицировать. Однако различные типы CD имеют различную структуру и используют различные методы маркировки кадров. Поскольку компьютерные приводы CD-ROM рассчитаны на чтение в основном Data-CD (надо сказать, что существуют различные разновидности стандарта Data-CD, каждый из которых дополняет основной стандарт CD-DA), они часто не способны правильно «ориентироваться» на Audio CD, где способ маркировки кадров отличен от Data-CD (на аудио CD кадры не имеют специального заголовка и для определения смещения каждого кадра необходимо следить за информацией в кадре). Это означает, что если при чтении Data-CD привод легко «ориентируется» на диске и никогда не перепутает кадры, то при чтении с аудио компакт диска привод не может ориентироваться четко, что при появлении, скажем, царапины или пыли может привести к чтению неправильного кадра и, как следствие, скачку или треску звучания. Эта же проблема (неспособность большинства приводов правильно позиционироваться на CD-DA) является причиной еще одного неприятного эффекта: копирование информации с Audio CD вызывает проблемы даже при работе с полностью сохранными дисками вследствие того, что правильное «ориентирование на диске» полностью зависит от считывающего привода и не может быть четко проконтролировано программным путем.

Повсеместное распространение и дальнейшее развитие уже упомянутых lossy-кодеров аудио (MP3, AAC и других) открыло широчайшие возможности распространения и хранения аудио. Современные каналы связи уже давно позволяют пересылать большие массивы данных за сравнительно небольшое время, однако самой медленной остается передача данных между конечным пользователем и поставщиком услуг связи. Телефонные линии, по которым пользователи в большинстве своем связываются с Интернетом, не позволяют осуществлять быструю передачу данных. Нечего и говорить, что такие объемы данных, какие занимает несжатая аудио и видео информация, передавать по привычным каналам связи придется очень долго. Однако появление lossy-кодеров, обеспечивающих десяти-пятнадцати кратное сжатие, превратило передачу и обмен аудио данными в повседневное занятие каждого пользователя Интернета и сняло все преграды, образованные слабыми каналами связи. Касательно этого нужно сказать, что развивающаяся сегодня семимильными шагами цифровая мобильная связь во многом обязана именно lossy-кодированию. Дело в том, что протоколы передачи аудио по каналам мобильной связи работают на приблизительно тех же принципах, что и известные всем музыкальные кодеры. Поэтому дальнейшее развитие в области кодирования аудио неизменно ведет к уменьшению стоимости передачи данных в мобильных системах, от чего конечный пользователь только выигрывает: дешевеет связь, появляются новые возможности, продлевается время работы батарей мобильных устройств и т.д. Не в меньшей степени lossy-кодирование помогает экономить деньги на покупке дисков с любимыми песнями – сегодня стоит только зайти в Интернет и там можно найти почти любую интересующую песню. Безусловно, такое положение вещей давно «мозолит глаза» звукозаписывающим компаниям – у них под носом люди вместо покупки дисков обмениваются песнями прямо через Интернет, что превращает некогда золотое дно в малоприбыльный бизнес, но это уже вопрос этики и финансов. Одно можно сказать с уверенностью: с таким положением вещей уже ничего нельзя поделать и бум обмена музыкой через Интернет, порожденный именно появлением lossy-кодеров, уже ничем не остановить. А это только на руку рядовому пользователю.

К вопросу об обработке звука

Под обработкой звука следует понимать различные преобразования звуковой информации с целью изменения каких-то характеристик звучания. К обработке звука относятся способы создания различных звуковых эффектов, фильтрация, а также методы очистки звука от нежелательных шумов, изменения тембра и т.д. Все это огромное множество преобразований сводится, в конечном счете, к следующим основным типам:

Амплитудные преобразования. Выполняются над амплитудой сигнала и приводят к ее усилению/ослаблению или изменению по какому-либо закону на определенных участках сигнала.

Частотные преобразования. Выполняются над частотными составляющими звука: сигнал представляется в виде спектра частот через определенные промежутки времени, производится обработка необходимых частотных составляющих, например, фильтрация, и обратное «сворачивание» сигнала из спектра в волну.

Фазовые преобразования. Сдвиг фазы сигнала тем или иным способом; например, такие преобразования стерео сигнала, позволяют реализовать эффект вращения или «объёмности» звука.

Временные преобразования. Реализуются путем наложения, растягивания/сжатия сигналов; позволяют создать, например, эффекты эха или хора, а также повлиять на пространственные характеристики звука.

Обсуждение каждого из названных типов преобразований может стать целым научным трудом. Стоит привести несколько практических примеров использования указанных видов преобразований при создании реальных звуковых эффектов:

Echo (эхо). Реализуется с помощью временных преобразований. Фактически для получения эха необходимо на оригинальный входной сигнал наложить его задержанную во времени копию. Для того, чтобы человеческое ухо воспринимало вторую копию сигнала как повторение, а не как отзвук основного сигнала, необходимо время задержки установить равным примерно 50 мс. На основной сигнал можно наложить не одну его копию, а несколько, что позволит на выходе получить эффект многократного повторения звука (многоголосного эха). Чтобы эхо казалось затухающим, необходимо на исходный сигнал накладывать не просто задержанные копии сигнала, а приглушенные по амплитуде.

Reverberation (повторение, отражение). Эффект заключается в придании звучанию объемности, характерной для большого зала, где каждый звук порождает соответствующий, медленно угасающий отзвук. Практически, с помощью реверберации можно «оживить», например, фонограмму, сделанную в заглушенном помещении. От эффекта «эхо» реверберация отличается тем, что на входной сигнал накладывается задержанный во времени выходной сигнал, а не задержанная копия входного. Иными словами, блок реверберации упрощенно представляет собой петлю, где выход блока подключен к его входу, таким образом уже обработанный сигнал каждый цикл снова подается на вход смешиваясь с оригинальным сигналом.

Chorus (хор). В результате его применения звучание сигнала превращается как бы в звучание хора или в одновременное звучание нескольких инструментов. Схема получения такого эффекта аналогична схеме создания эффекта эха с той лишь разницей, что задержанные копии входного сигнала подвергаются слабой частотной модуляции (в среднем от 0.1 до 5 Гц) перед смешиванием со входным сигналом. Увеличение количества голосов в хоре достигается путем добавления копий сигнала с различными временами задержки.

Безусловно, как и во всех других областях, в обработке сигналов также имеются проблемы, которые являются своего рода камнем преткновения. Так, например, при разложении сигналов в спектр частот существует принцип неопределенности, который невозможно преодолеть. Принцип гласит, что нельзя получить точную спектральную картину сигнала в конкретный момент времени: либо для получения более точной спектральной картины нужно проанализировать больший временной участок сигнала, либо, если нас интересует больше время, когда происходило то или иное изменение спектра, нужно пожертвовать точностью самого спектра. Иными словами нельзя получить точный спектр сигнала в точке — точный спектр для большого участка сигнала, либо очень приблизительный спектр, но для короткого участка.

Механизмы для обработки сигналов существуют как в программном, так и в аппаратном исполнениях (так называемые эффект-процессоры). Например, вокодеры и гитарные процессоры, хорусы и ревербераторы существуют в виде аппаратуры, а также в виде программ.

Практическую обработку сигналов можно разделить на два типа: обработка «на лету» и пост-обработка. Обработка «на лету» подразумевает мгновенное преобразование сигнала (то есть с возможностью осуществлять вывод обработанного сигнала почти одновременно с его вводом). Простой пример – гитарные «примочки» или реверберация во время живого исполнения на сцене. Такая обработка происходит мгновенно, то есть, скажем, исполнитель поет в микрофон, а эффект-процессор преобразует его голос и слушатель слышит уже обработанный вариант голоса. Пост-обработка – это обработка уже записанного сигнала. Скорость такой обработки может быть сильно ниже скорости воспроизведения. Такая обработка преследует те же цели, то есть придание звуку определенного характера, либо изменение характеристик, однако применяется на стадии мастеринга или подготовки звука к тиражированию, когда не требуется спешка, а важнее качество и скрупулезная проработка всех нюансов звучания. Существует множество различных операций над звуком, которые вследствие недостаточной производительности сегодняшних процессоров нельзя реализовать «на лету», поэтому такие преобразования проводят лишь в пост-режиме.

Обработка сигнала – это сложная и, главное, ресурсоемкая процедура. Она сравнительно недавно стала проводиться в цифровых устройствах – раньше различные эффекты звучания и другие достигались путем обработки звука в аналоговых приборах. В аналоговой аппаратуре звук в виде электрических колебаний проходит через различные тракты (блоки электрических элементов), чем достигается изменение фазы, спектра и амплитуды сигнала. Однако такой способ обработки имеет массу недостатков. Во-первых, страдает качество обработки, ведь каждый аналоговый элемент имеет свою погрешность, а несколько десятков элементов могут критически повлиять на точность и качество желаемого результата. А во-вторых, и это, пожалуй, самое главное, почти каждый отдельный эффект достигается путем использования отдельного устройства, когда каждое такое устройство может стоить очень дорого. Возможность же использования цифровых устройств имеет неоспоримые преимущества. Качество обработки сигналов в них намного меньше зависит от качества аппаратуры, главное – это качественно оцифровать звук и иметь возможность качественно его воспроизводить, и тогда качество обработки ложится уже только на программный механизм. Кроме того, для различных манипуляций со звуком не требуется постоянная смена оборудования. И, самое главное, поскольку обработка ведется программным путем, для нее открываются просто невероятные возможности, которые ограничены лишь мощностью компьютеров (а она увеличивается с каждым днем) и фантазией человека. Однако, (по крайней мере сегодня) здесь имеются и свои неприятности. Так, например, часто, даже для осуществления несложной обработки сигнала необходимо осуществить его разложение в спектр частот. В этом случае обработка сигнала на лету может быть затруднена именно из-за ресурсоемкости этапа разложения. Поэтому преобразования, требующие спектрального разложения, выполняют чаще в пост-режиме.

Аппаратура

Немаловажная часть разговора о звуке связана с аппаратурой. Существует много различных устройств для обработки и ввода/вывода звука. Касательно обычного персонального компьютера следует подробнее остановиться на звуковых картах. Звуковые карты принято делить на звуковые, музыкальные и звукомузыкальные. По конструкции же все звуковые платы можно разделить на две группы: основные (устанавливаемые на материнской плате компьютера и обеспечивающие ввод и вывод аудио данных) и дочерние (имеют принципиальное конструктивное отличие от основных плат — они чаще всего подключаются к специальному разъему, расположенному на основной плате). Дочерние платы служат чаще всего для обеспечения или расширения возможностей MIDI-синтезатора.

Звукомузыкальные и звуковые платы выполняются в виде устройств, вставляемых в слот материнской платы (либо уже встроены в нее изначально). Визуально они имеют обычно два аналоговых входа — линейный и микрофонный, и несколько аналоговых выходов: линейные выходы и выход для наушников. В последнее время карты стали оснащаться также и цифровым входом и выходом, обеспечивающим передачу аудио между цифровыми устройствами. Аналоговые входы и выходы обычно имеют разъемы, аналогичные разъемам головных наушников (1/8”). Вообще, входов у звуковой платы немного больше, чем два: аналоговые CD, MIDI и другие входы. Они, в отличие от микрофонного и линейного входов, расположены не на задней панели звуковой платы, а на самой плате; могут иметься и другие входы, например, для подключения голосового модема. Цифровые входы и выходы обычно выполнены в виде интерфейса S/PDIF (интерфейс цифровой передачи сигналов) с соответствующим разъемом (S/PDIF – сокращение от Sony/Panasonic Digital Interface — цифровой интерфейс Sony/Panasonic). S/PDIF — это «бытовой» вариант более сложного профессионального стандарта AES/EBU (Audio Engineering Society / European Broadcast Union). Сигнал S/PDIF используется для цифровой передачи (кодирования) 16-разрядных стерео данных с любой частотой дискретизации. Помимо перечисленного, на звукомузыкальных платах имеется MIDI-интерфейс с разъемами для подключения MIDI-устройств и джойстиков, а также для подсоединения дочерней музыкальной карты (хотя в последнее время возможность подключения последней становится редкостью). Некоторые модели звуковых карт для удобства пользователя оснащаются фронтальной панелью, устанавливаемой на лицевой стороне системного блока компьютера, на которой размещаются разъемы, соединенные с различными входами и выходами звуковой карты.

Определим несколько основных блоков, из которых состоят звуковые и звукомузыкальные платы.

1. Блок цифровой обработки сигналов (кодек). В этом блоке осуществляются аналого-цифровые и цифро-аналоговые преобразования (АЦП и ЦАП). От этого блока зависят такие характеристики карты, как максимальная частота дискретизации при записи и воспроизведении сигнала, максимальный уровень квантования и максимальное количество обрабатываемых каналов (моно или стерео). В немалой степени от качества и сложности составляющих этого блока зависят и шумовые характеристики.

2. Блок синтезатора. Присутствует в музыкальных картах. Выполняется на основе либо FM-, либо WT-синтеза, либо на обоих сразу. Может работать как под управлением собственного процессора, так и под управлением специального драйвера.

3. Интерфейсный блок. Обеспечивает передачу данных по различным интерфейсам (например, S/PDIF). У чисто звуковой карты этот блок чаще отсутствует.

  • уровней сигналов с линейных входов;
  • уровней с MIDI входа и входа цифрового звука;
  • уровня общего сигнала;
  • панорамирования;
  • тембра.

Рассмотрим важнейшие параметры, характеризующие звуковые и звукомузыкальные платы. Наиболее важными характеристиками являются: максимальная частота дискретизации (sampling rate) в режиме записи и в режиме воспроизведения, максимальный уровень квантования или разрядность (max. quantization level) в режиме записи и воспроизведения. Кроме того, так как звукомузыкальные платы имеют еще и синтезатор, то к их характеристикам относят и параметры установленного синтезатора. Естественно, чем с большим уровнем квантования карта способна кодировать сигналы, тем большее качество сигнала при этом достигается. Все современные модели звуковых карт способны кодировать сигнал с уровнем 16 бит. Одной из важных характеристик является возможность одновременного воспроизведения и записи звуковых потоков. Особенность карты одновременно воспроизводить и записывать называют полнодуплексной (full duplex). Есть еще одна характеристика, которая зачастую играет решающую роль при покупке звуковой карты — отношение сигнал/шум (Signal/Noise Ratio, S/N). Этот показатель влияет на чистоту записи и воспроизведения сигнала. Отношение сигнал/шум – это отношение мощности сигнала к мощности шума на выходе устройства, этот показатель принято измерять в дБ. Хорошим можно считать отношение 80-85 дБ; идеальным – 95-100 дБ. Однако нужно учитывать, что на качество воспроизведения и записи сильно влияют наводки (помехи) со стороны других компонент компьютера (блока питания и проч.). В результате этого отношение сигнал/шум может изменяться в худшую сторону. На практике методов борьбы с этим существует достаточно много. Некоторые предлагают заземлить компьютер. Другие, дабы как можно более тщательно уберечь звуковую карту от наводок, «выносят» ее за пределы корпуса компьютера. Однако полностью уберечься от наводок очень тяжело, так как даже элементы самой карты создают наводки друг на друга. С этим тоже пытаются бороться и для этого экранируют каждый элемент на плате. Но сколько бы усилий не прилагалось к решению этой проблемы, полностью исключить влияние внешних помех невозможно.

Еще одна не менее важная характеристика – коэффициент нелинейных искажений или Total Harmonic Distortion, THD. Этот показатель также критическим образом влияет на чистоту звучания. Коэффициент нелинейных искажений измеряется в процентах: 1% — «грязное» звучание; 0.1% — нормальное звучание; 0.01% — чистое звучание класса Hi-Fi; 0.002% — звучание класса Hi-Fi – Hi End.. Нелинейные искажения – результат неточности в восстановлении сигнала из цифрового вида в аналоговый. Упрощенно, процесс измерения этого коэффициента проводится следующим образом. На вход звуковой карты подается чистый синусоидальный сигнал. На выходе устройства снимается сигнал, спектр которого представляет собой сумму синусоидальных сигналов (сумма исходной синусоиды и ее гармоник). Затем по специальной формуле рассчитывается количественное соотношение исходного сигнала и его гармоник, полученных на выходе устройства. Это количественное соотношение и есть коэффициент нелинейных искажений (THD).

Что такое MIDI-синтезатор? Термин «синтезатор» обычно используется применительно к электронному музыкальному инструменту, в котором звук создается и обрабатывается, меняя свою окраску и характеристики. Естественно, название этого устройства пошло от его основного предназначения – синтеза звука. Основных методов синтеза звука существует всего два: FM (Frequency modulation – частотная модуляция) и WT (Wave Table – таблично-волновой). Поскольку мы не можем здесь подробно останавливаться на их рассмотрении, опишем лишь основную идею методов. В основе FM-синтеза лежит идея, что любое даже самое сложное колебание является по сути суммой простейших синусоидальных. Таким образом, можно наложить друг на друга сигналы от конечного числа генераторов синусоид и путем изменения частот синусоид получать звуки, похожие на настоящие. Таблично-волновой синтез основывается на другом принципе. Синтез звука при использовании такого метода достигается за счет манипуляций над заранее записанными (оцифрованными) звуками реальных музыкальных инструментов. Эти звуки (они называются сэмплами) хранятся в постоянной памяти синтезатора.

MIDI-синтезатор – это синтезатор, отвечающий требованиям стандарта, о котором мы сейчас поговорим. MIDI – это общепринятая спецификация, связанная с организацией цифрового интерфейса для музыкальных устройств, включающая в себя стандарт на аппаратную и программную части. Эта спецификация предназначена для организации локальной сети электронных инструментов (рис. 7). К MIDI-устройствам относятся различные аппаратные и музыкальные инструменты, отвечающие требованиям MIDI. Таким образом, MIDI-синтезатор – это музыкальный инструмент, предназначенный обычно для синтеза звука и музыки, а также удовлетворяющий спецификации MIDI. Давайте разберемся кратко, почему выделен отдельный класс устройств, названный MIDI.

Дело в том, что осуществление программной обработки звука часто сопряжено с неудобствами, обусловленными различными техническими особенностями этого процесса. Даже возложив операции по обработке звука на звуковую карту или любую другую аппаратуру, остается множество различных проблем. Во-первых, зачастую желательно пользоваться аппаратным синтезом звучания музыкальных инструментов (как минимум потому, что компьютер – это слишком общий инструмент, часто необходим просто аппаратный синтезатор звуков и музыки, не более). Во-вторых, программная обработка звука часто сопровождается временными задержками, в то время как при концертной работе необходимо мгновенное получение обработанного сигнала. По этим и другим причинам и прибегают к использованию специальной аппаратуры для обработки, а не компьютеров со специальными программами. Однако при использовании аппаратуры возникает необходимость в едином стандарте, который позволил бы соединять устройства друг с другом и комбинировать их. Эти предпосылки и заставили в 1982 году несколько ведущих в области музыкального оборудования компаний утвердить первый MIDI-стандарт, который впоследствии получил продолжение и развивается по сей день. Что же в конечном счете представляет собой MIDI-интерфейс и устройства в него входящие с точки зрения персонального компьютера?

  • Аппаратно — это установленные на звуковой карте: синтезатор различных звуков и музыкальных инструментов, микропроцессор, контролирующий и управляющий работу MIDI-устройств, а также различные стандартизованные разъемы и шнуры для подключения дополнительных устройств.
  • Программно — это протокол MIDI, представляющий собой набор сообщений (команд), которые описывают различные функции системы MIDI и с помощью которых осуществляется связь (обмен информацией) между устройствами MIDI. Сообщения можно рассматривать как средство удаленного управления.

Рамки данной статьи не позволяют нам углубляться в частности описания MIDI, следует отметить однако, что в отношении синтезаторов звука MIDI устанавливает строгие требования к их возможностям, примененным в них способам синтеза звука, а также к управляющим параметрам синтеза. Кроме того, для того, чтобы музыка созданная на одном синтезаторе могла бы быть легко перенесена и успешно воспроизведена на другом, были установлены несколько стандартов на соответствие инструментов (голосов) и их параметров в различных синтезаторах: стандарт General MIDI (GM), General Synth (GS) и eXtended General (XG). Базисным стандартом является GM, остальные два являются его логическими продолжениями и расширениями.

В качестве практического примера устройства MIDI, можно рассмотреть обычную MIDI-клавиатуру. Упрощенно, MIDI-клавиатура представляет собой укороченную клавиатуру рояля в корпусе с которой находится MIDI-интерфейс, позволяющий подключать ее к другим MIDI-устройствам, например, к MIDI-синтезатору, который установлен в звуковой карте компьютера. Используя специальное программное обеспечение (например, MIDI-секвенсор) можно включить MIDI-синтезатор в режим игры, например, на рояле, и нажимая на клавиши MIDI-клавиатуры слышать звуки рояля. Естественно, что роялем дело не ограничивается – в стандарте GM имеются 128 мелодических инструментов и 46 ударных. Кроме того, используя MIDI-секвенсор можно записывать исполняемые на MIDI-клавиатуре ноты в компьютер, для последующего редактирования и аранжировки, либо просто для элементарной распечатки нот.

Надо отметить, что поскольку MIDI-данные – это набор команд, то музыка, которая написана с помощью MIDI, также записывается с помощью команд синтезатора. Иными словами, MIDI-партитура – это последовательность команд: какую ноту играть, какой инструмент использовать, какова продолжительность и тональность ее звучания и так далее. Знакомые многим MIDI-файлы (.MID) есть нечто иное, как набор таких команд. Естественно, что поскольку имеется великое множество производителей MIDI-синтезаторов, то и звучать один и тот же файл может на разных синтезаторах по-разному (потому что в файле сами инструменты не хранятся, а есть лишь только указания синтезатору какими инструментами играть, в то время как разные синтезаторы могут звучать по-разному).

Вернемся к рассмотрению звукомузыкальных плат. Поскольку мы уже уточнили, что такое MIDI, нельзя обойти стороной характеристики встроенного аппаратного синтезатора звуковой карты. Современный синтезатор, чаще всего, основан на так называемой «волновой таблице» — WaveTable (вкратце, принцип работы такого синтезатора состоит в том, что звук в нем синтезируется из набора записанных звуков путем их динамического наложения и изменения параметров звучания), раньше же основным типом синтеза являлся FM (Frequency Modulation – синтез звука посредством генерирования простых синусоидальных колебаний и их смешения). Основными характеристиками WT-синтезатора являются: количество инструментов в ПЗУ и его объем, наличие ОЗУ и его максимальный объем, количество возможных эффектов обработки сигналов, а также возможность поканальной эффект-обработки (конечно, в случае наличия эффект-процессора), количество генераторов, определяющих максимальное число голосов в полифоническом (многоголосном) режиме и, может быть самое главное, стандарт, в соответствии с которым выполнен синтезатор (GM, GS или XG). Кстати, объем памяти синтезатора — не всегда величина фиксированная. Дело в том, что в последнее время синтезаторы перестали иметь свое ПЗУ, а пользуются основным ОЗУ компьютера: в этом случае все используемые синтезатором звуки хранятся в файле на диске и при необходимости считываются в ОЗУ.

Программное обеспечение

Тема программного обеспечения очень широка, поэтому здесь мы только вкратце обсудим основные представители программ для обработки звука.

Наиболее важный класс программ – редакторы цифрового аудио. Основные возможности таких программ это, как минимум, обеспечение возможности записи (оцифровки) аудио и сохранение на диск. Развитые представители такого рода программ позволяют намного больше: запись, многоканальное сведение аудио на нескольких виртуальных дорожках, обработка специальными эффектами (как встроенными, так и подключаемыми извне – об этом позже), очистка от шумов, имеют развитую навигацию и инструментарий в виде спектроскопа и прочих виртуальных приборов, управление/управляемость внешними устройствами, преобразование аудио из формата в формат, генерация сигналов, запись на компакт диски и многое другое. Некоторые из таких программ: Cool Edit Pro (Syntrillium), Sound Forge (Sonic Foundry), Nuendo (Steinberg), Samplitude Producer (Magix), Wavelab (Steinberg).

Основные возможности редактора Cool Edit Pro 2.0 (см. скриншот — пример рабочего окна программы в многодорожечном режиме): редактирование и сведение аудио на 128 дорожках, 45 встроенных DSP-эффектов, включая инструменты для мастеринга, анализа и реставрации аудио, 32-битная обработка, поддержка аудио с параметрами 24 бит / 192 КГц, мощный инструментарии для работы с петлями (loops), поддержка DirectX, а также управление SMPTE/MTC, поддержка работы с видео и MIDI и прочее.

 Основные возможности редактора Sound Forge 6.0a (см. скриншот — пример рабочего окна программы): мощные возможности не деструктивного редактирования, многозадачная фоновая обработка заданий, поддержка файлов с параметрами до 32 бит / 192 КГц, менеджер предустановок, поддержка файлов более 4 Гб, работа с видео, большой набор эффектов обработки, восстановление после зависаний, предпрослушивание примененных эффектов, спектральный анализатор и прочее.

Не менее важная в функциональном смысле группа программ – секвенсоры (программы для написания музыки). Чаще всего, такие программы используют MIDI-синтезатор (аппаратный внешний или встроенный почти в любую звуковую карту, либо программный, организуемый специальным программным обеспечением). Такие программы предоставляют пользователю либо привычный нотный стан (как, например, программа Finale от CODA), либо более распространенный способ редактирования аудио на компьютере, так называемый, piano-roll (это более понятное представление музыки для людей, не знакомых с нотами; в таком представлении вертикально имеется ось с изображением клавиш пианино, а горизонтально откладывается время, таким образом, ставя на пересечении штрихи разной длинны, добиваются звучания определенной ноты с определенной продолжительностью). Встречаются и программы, позволяющие просматривать и редактировать аудио в обоих представлениях. Развитые секвенсоры помимо редактирования аудио во многом могут дублировать возможности редакторов цифрового аудио – осуществлять запись на CD, совмещать MIDI-дорожки с цифровыми сигналами и осуществлять мастеринг. Яркие представители такого класса программ: Cubase (Steinberg), Logic Audio (Emagic), Cakewalk (Twelve Tone Systems) и уже упомянутый Finale.

 Основные возможности редактора Cubase 5.1 (см. скриншот – пример рабочего окна программы в режиме просмотра MIDI дорожек): редактирование музыки в реальном времени используя графическое представление информации, высокое разрешение редактора (15360 пульсов на четверть), практически не лимитированное количество дорожек, 72 аудио канала, поддержка VST32, 4 эквалайзера на канал и другие поканальные эффекты, встроенные инструменты обработки с использованием аналогового моделирования (виртуальные инструменты, эффект процессоры, инструменты микширования и записи) и множество других возможностей.

 Основные возможности редактора Logic Audio 5 (см. скриншот – пример рабочего окна программы): работа со звука при точности в 32 бита, высокое временное разрешение событий, самоадаптируемый микшер аудио и MIDI, оптимизируемый интерфейс пользователя, синхронизация с видео, виртуально неограниченное число MIDI-дорожек, обработка звука в реальном времени, полная синхронизация с MTC, MMC, SMPTE, встроенные модули обработки и автоинструменты, поддержка большого количество аппаратного оборудования, а также множество других возможностей.

В наборе программ пользователя, занимающегося обработкой звука, имеется множество разных инструментов, так было раньше и так будет впредь – универсальных комбайнов для работы со звуком не бывает. Однако, не смотря на все разнообразие ПО, в программах часто используются схожие механизмы для обработки звука (например, процессоры эффектов и прочие). На каком-то этапе разработки аудио ПО, производители поняли, что удобнее сделать в своих программах возможность подключения внешних инструментов, чем каждый раз создавать заново инструменты для каждой отдельной программы. Так что многие программы, относящиеся к той или иной группе ПО, позволяют подключать так называемые «плаг-ины» — внешние подключаемые модули, расширяющие возможности обработки звука. Это стало возможным в результате появления нескольких стандартов на интерфейс между программой и подключаемым модулем. На сегодняшний день существуют два основных стандарта на интерфейс: DX и VST. Существование стандартов позволяет подключать один и тот же плаг-ин к совершенно разным программам, не заботясь о возникновении конфликтов и неполадок. Говоря о самих плаг-инах, надо сказать, что это просто огромное семейство программ. Обычно, один плаг-ин является механизмом, реализующим какой-то конкретный эффект, например, реверберацию или низкочастотный фильтр.

 Из интересных плаг-инов можно вспомнить, например iZotope Vinyl, — он позволяет придать звучанию эффект виниловой пластинки (см. скриншот – пример рабочего окна плаг-ина в среде Cool Edit Pro), Antares AutoTune позволяет в полуавтоматическом режиме корректировать звучание вокала, а Orange Vocoder являет собой замечательный вокодер (механизм для придания звучанию различных инструментов схожести со звучанием голоса человека).

Обработка звука и написание музыки – это не только творческий процесс. Иногда нужен скрупулезный анализ данных, а также осуществление поиска огрехов их звучания. Кроме того, аудио материал, с который приходится иметь дело, не всегда желаемого качества. В этой связи нельзя не вспомнить о целом ряде программ-анализаторов аудио, специально предназначенных для осуществления измерительных анализов аудио данных. Такие программы помогают представить аудио данные удобнее, чем обычные редакторы, а также внимательно изучить их с помощью различных инструментов, таких как FFT-анализаторы (построители динамических и статических амплитудно-частотных характеристик), построители сонограмм, и прочих. Одна из наиболее известных и развитых программ подобного плана – программа SpectraLAB (Sound Technology Inc.), чуть более простые, но мощные – Analyzer2000 и Spectrogram.

 Программа SpectraLAB – наиболее мощный продукт подобного рода, существующий на сегодня (см. скриншот – пример рабочего окна программы, на экране: спектральная картина в трез представлениях и фазовая картина). Возможности программы: 3 режима работы (пост режим, режим реального времени, режим записи), основной инструментарий – осциллограф, спектрометр (двухмерный, трехмерный, а также построитель сонограмм) и фазометр, возможность сравнения амплитудно-частотных характеристик нескольких сигналов, широкие возможности масштабирования, измерительные инструменты: нелинейных искажений, отношения сигнал/шум, искажений и прочие.

Специализированные реставраторы аудио играют также немаловажную роль в обработке звука. Такие программы позволяют восстановить утерянное качество звучания аудио материала, удалить нежелательные щелчки, шумы, треск, специфические помехи записей с аудио-кассет, и провести другую корректировку аудио. Программы подобного рода: Dart, Clean (от Steinberg Inc.), Audio Cleaning Lab. (от Magix Ent.), Wave Corrector.

 Основные возможности реставратора Clean 3.0 (см. скриншот – рабочее окно программы): устранение всевозможных потрескиваний и шумов, режим автокоррекции, набор эффектов для обработки скорректированного звука, включая функцию «surround sound» с наглядным акустическим моделированием эффекта, запись CD с подготовленными данными, «интеллигентная» система подсказок, поддержка внешних VST плаг-инов и другие возможности.

Трекеры. Трекеры – это отдельная категория звуковых программ, предназначенных именно для создания музыки. Ранее мы рассмотрели два принципиально отличных способа хранения звуковых данных (музыки): первый — хранение звука в виде сжатого или несжатого потока аудио, второй — хранение музыки в виде MIDI-файлов (в виде набора команд MIDI-синтезатору). Структура и концепция построения трекерных файлов очень похожа на принцип хранения MIDI-информации. В трекерных модулях (файлы, созданные в трекерах, принято называть модулями), также, как и в MIDI-файлах, содержится партитура в соответствии с которой должны проигрываться инструменты. Кроме того, в них содержится информация о том, какие эффекты и в какой момент времени должны быть применены при проигрывании того или иного инструмента. Однако, принципиальное отличие трекерных модулей от MIDI-файлов заключается в том, что проигрываемые в этих модулях инструменты (или, точнее сказать, сэмплы) хранятся в самих модулях (то есть внутри файлов), а не в синтезаторе (как это происходит в случае с MIDI). Такой способ хранения музыки имеет массу преимуществ: размер файлов невелик по сравнению с непрерывной оцифрованной музыкой (поскольку записываются только использованные инструменты и партитура в виде команд), нет зависимости звучания от компьютера, на котором происходит воспроизведение (в MIDI, как мы говорили, есть зависимость звучания от используемого синтезатора), имеется большая свобода творчества, поскольку автор музыки не ограничен наборов инструментов (как в MIDI), а может использовать в качестве инструмента любой оцифрованный звук. Основные программы-трекеры Scream Tracker, Fast Tracker, Impulse Tracker, OctaMED SoundStudio, MAD Tracker, ModPlug Tracker.

 Программа ModPlug Tracker является сегодня одним из тех трекеров, сумевших стать универсальной рабочей средой для множества типов трекерных модулей (см. скриншот7 – пример рабочего окна программы, на экране: содержание дорожек одного загруженного модуля и рабочее окно сэмплов другого модуля). Основные возможности: поддержка до 64 физических каналов аудио, поддержка почти всех существующих форматов трекерных модулей, импорт инструментов во множестве форматов, 32-битное внутреннее микширование, высококачественный ресэплирующий фильтр, поддержка MMX/3dNow!/SSE, автоматическое удаление потрескиваний, расширение басов, ревербератор, расширение стерео, 6-полосный графический эквалайзер и другие возможности.

Напоследок следует упомянуть о существовании огромного количества другого аудио ПО: проигрыватели аудио (наиболее выдающиеся: WinAMP, Sonique, Apollo, XMPlay, Cubic Player), подключаемые модули для проигрывателей (из «улучшателей» звучания аудио — DFX, Enhancer, iZotop Ozone), утилиты для копирования информации с аудио CD (ExactAudioCopy, CDex, AudioGrabber), перехватчики аудио потоков (Total Recorder, AudioTools), кодеры аудио (кодеры MP3: Lame encoder, Blade Encoderб Go-Go и другие; кодеры VQF: TwinVQ encoder, Yamaha SoundVQ, NTT TwinVQ; кодеры AAC: FAAC, PsyTel AAC, Quartex AAC), конвертеры аудио (для перевода аудио информации из одного формата в другой), генераторы речи и множество других специфических и общих утилит. Безусловно, все перечисленное – только малая толика из того, что может пригодиться при работе со звуком.

Перспективы и проблематика

Перспективы развития и использования цифрового аудио видятся авторам статьи очень широкими. Казалось бы, все, что можно было сделать в этой области, уже сделано. Однако это не так. Остается масса еще совсем незатронутых проблем.

Например, область распознавания речи еще очень не развита. Давно уже делались и делаются попытки создать программное обеспечение, способное качественно распознавать речь человека, однако все они пока не приводят к желаемому результату. А ведь долгожданный прорыв в этой области мог бы неимоверно упростить ввод информации в компьютер. Только представьте себе, что вместо набора текста его можно было бы просто надиктовывать, попивая кофе где-нибудь неподалеку от компьютера. Имеется множество программ якобы способных предоставить такую возможность, однако все они не универсальны и сбиваются при незначительном отклонении голоса читающего от заданного тона. Такая работа приносит не столько удобств, сколько огорчений. Еще куда более сложной задачей (вполне возможно, что и неразрешимой вовсе) является распознавание общих звуков, например, звучания скрипки в звуках оркестра или выделение партии рояля. Можно надеяться, что когда-нибудь такое станет возможным, ведь человеческий мозг легко справляется с такими задачами, однако сегодня говорить о хотя бы малейших сдвигах в этой области рано.

В области синтеза звука также есть пространство для изучения. Способов синтеза звука сегодня существует несколько, однако ни один из них не дает возможности синтезировать звук, который нельзя было бы отличить от настоящего. Если, скажем, звуки рояля или тромбона еще более-менее поддаются реализации, до правдоподобного звучания саксофона или электрогитары добиться еще так и не смогли – существует масса нюансов звучания, которые почти невозможно воссоздать искусственно.

Таким образом, можно смело сказать, что в области обработки, создания и синтеза звука и музыки еще очень далеко до того решающего слова, которое поставит точку на развитии этой отрасли человеческой деятельности.

Глоссарий терминов

1) DSP – Digital Signal Processor (цифровой сигнальный процессор). Устройство (или программный механизм) предназначенное для цифровой обработки сигналов.

2) Битрейт – применительно к потокам данных — количество бит в секунду (bits per second). Применительно в звуковым файлам (например, после lossy-кодирования) – каким количеством бит описывается одна секунда аудио.

3) Звук — акустическая волна, распространяющаяся в пространстве; в каждой точке пространства может быть представлена функцией амплитуды от времени.

4) Интерфейс — совокупность программных и аппаратных средств, предназначенных для организации взаимодействия различных устройств.

5) Интерполяция — отыскание промежуточных значений величины по некоторым известным ее значениям; отыскание значений функции f(x) в точках x, лежащих между точками xo

Аналог vs Цифра: бой, которого не было

Целью данной статьи не является разжигание святой войны между поклонниками аналогового и цифрового аудио. Целью является показать принципиальные
различия между двумя технологиями. Автор статьи (то есть я) занимает сторону цифровой технологии как наиболее совершенной и хочет
разъяснить всем желающим свою точку зрения не только с субъективной, но и с научной стороны. Знание принципа цифровой записи звука, вкупе с пониманием научной стороны этого дела,
однозначно исключает какие-либо сомнения в превосходстве цифровых технологий над аналоговыми.

Аналоговая запись звука.

По сути, звук (колебание частиц воздуха) имеет аналоговую природу. Звук распространяется в воздушном пространстве, он может искажаться в зависимости
от разнообразных условий — расстояния до источника звука, отражения от окружающих предметов, скорости движения относительно источника и т.п.
Диапазоном воспринимаемых человеческим ухом звуковых колебаний принято считать промежуток от 20 Гц до 20 кГц. На самом деле, 20 кГц — цифра довольно
оптимистичная, мало кто может похвастаться тем, что реально слышит такую частоту. Большинство из встречавшихся мне взрослых людей не слышали частоты выше 15-16
кГц, так что я с большой долей уверенности в качестве среднего порога слышимости назвал бы частоту в 15 кГц. Впрочем, в плане тона нашим ухом
воспринимаются частоты всего лишь до 5 кГц — всё, что выше, является дополнительными гармониками, обертонами, созвуками и т.п. Однако, правильное
воспроизведение высоких составляющих (граничная частота воспроизведения) в основном и является мерой качества записи звука, обычно указываемой в
технических характеристиках любого сколько-нибудь серьёзного звукозаписывающего устройства.

В мире аналоговой записи звука, колебание воздуха сначала преобразуется в электрическое колебание посредством микрофона. Далее, электрическое
колебание подаётся на звукозаписывающую магнитную головку (в случае магнитной ленты) или механический резец (в случае винила). В первом случае,
информация записана на намагниченной ленте, во втором — в канавке пластинки. Для воспроизведения звука, достаточно протянуть магнитную ленту вдоль магнитной головки с той же
скоростью, с которой производилась запись — головка преобразует переменное магнитное поле обратно в электрические колебания, которые усиливаются и
подаются на звуковоспроизводящую систему (динамик). Звуковоспроизводящая система заставляет воздух колебаться и мы слышим звук. В случае с
пластинкой, достаточно прогнать иглу по канавке, которая преобразует механические колебания в электрические, а далее — снова усилитель с колонками.

Чисто с точки зрения здравого смысла из всего вышесказанного следует, что винил — это наихудший вариант для записи звука в принципе, потому что
в процессе записи/воспроизведения присутствует грубая механика (как ни
парадоксально, консерваторами почему-то принято отстаивать именно винил а не магнитные ленты, хотя последние в пике своего развития имели значительно более
высокие качественные характеристики). Кроме всего прочего, почти весь более-менее нормальный винил писАлся именно с магнитных лент. Ему просто
неоткуда было записываться — мастеринг и сведение делались в ленте, поскольку на пластинке это в принципе невозможно. То есть, звук с винила — это
звук с магнитной ленты, только дополненный собственными недостатками винила — треском, шипением и прочими «меломанскими»
безобразиями, обусловленными механическим съёмом звука с канавки пластинки — «плуг в борозде».

Фактически, аналоговая запись звука несовершенна почти на всех стадиях. Например, при записи на магнитную ленту, многое зависит от качества магнитной
головки, архиважным является её калибровка относительно ленты (вечная головная боль). Добавьте сюда детонацию (непостоянство скорости ленты
из-за неточностей в лентопротяжном механизме), саморастяжение ленты, изменения характеристик ленты на её протяжении, случайные выбоины/посторонние
частицы на ней. Винил? Детонация, попадание в канавку мусора, деформация диска, ухудшение качества звука после каждого
проигрывания из-за «раздалбывания» канавки. Но самым главным недостатком аналоговой записи является невозможность
создания точной копии — любая копия с оригинала будет хуже качеством. Плюс ко всему, любой аналоговый носитель, даже будучи неиспользуемым, подвержен
старению и постепенному ухудшению качества воспроизводимого с него звука.

Цифровая запись звука.

Цифровая запись звука стала возможной благодаря огромному техническому прогрессу, произошедшему в последние десятилетия. По сути, в
основе цифровой записи звука лежит довольно старая теория — просто стало возможным сделать из теории практику. Чтобы пояснить принцип цифровой
записи, мне придётся поразглагольствовать несколько больше, поскольку в двух словах рассказать его невозможно.

Само название «цифровая запись» предполагает наличие цифр. Что за цифры? Выше я уже говорил, что сам по себе звук имеет аналоговую природу. Чтобы
записать звук в цифровую форму, нужно просто зафиксировать значения звукового колебания, изменяющегося во времени, в числах с как можно большей
точностью. Далее, для иллюстрации принципа цифровой записи звука я воспользуюсь собственной разработкой — программой
моделирования систем цифровой обработки сигналов sDCAD.

На рисунке зелёным цветом представлен аналоговый, непрерывный сигнал, желтым — его зафиксированные отсчёты (выборки). Выборка — значение сигнала в данный момент времени,
записанное цифрой. Поскольку аналоговый сигнал непрерывно меняется во времени, сразу вырисовывается проблема: для точного воспроизведения сигнала
необходимо бесконечное количество выборок — «одна за другой». Однако, здесь в силу вступает теорема Котельникова (тут вам придётся поверить мне на
слово) — сигнал с известной максимальной частотой можно точно восстановить из цифровых выборок, сделанных с частотой
вдвое большей максимальной частоты этого сигнала. В компакт-дисках (CD) частота выборки установлена «с запасом» — 44.1 кГц, таким образом, с
компакт-диска можно с высокой точностью восстановить сигналы с частотами до 22.05 кГц, что перекрывает возможности самого чуткого уха с лихвой.

Процесс восстановления «промежуточных» значений сигнала между снятыми выборками называется интерполяцией. Интерполяция делается при воспроизведении звука,
записанного в цифровой форме. Чем качественнее производится интерполяция, тем
лучше восстанавливается сигнал. Обратимся к визуальной демонстрации восстановления сигнала из выборок.

На рисунке показан оригинальный сигнал и его зафиксированные выборки. Следующий рисунок показывает то, что получится, если «восстановить» сигнал
без интерполяции, грубо «соединив» ближайшие выборки между собой прямыми линиями.

Как видим, результат немного похож на оригинал, но всё же весьма далёк от него. Конечно, «восстановленный» таким образом звук будет отличаться
от оригинала и на слух. Что получится, если интерполировать выборки и «восстановить» сигнал с
коэффициентом интерполяции 2 (т.е., добавить между уже имеющимися у нас выборками по одной «искусственной», восстановленной выборке)?

Теперь, между имеющимися у нас выборками добавлено по одной «восстановленной». Заметьте, насколько сигнал стал похож на оригинал! Конечно, до
идеала ещё далеко — но ведь это всего лишь коэффициент интерполяции 2! Заостряю внимание: никакого волшебства нет — сигнал интерполируется строго по
теории, математическими вычислениями, без какого-либо подвоха. Также, заметьте интересный факт: восстановленные выборки вовсе не являются средними
значениями между двумя соседними оригинальными выборками.

Удвоим коэффициент интерполяции (4). Качество восстановления сигнала растёт небывалыми темпами.

Если ещё удвоить коэффициент (8), восстановленный сигнал на вид практически не отличается от оригинального. Думаю, продолжать интерполировать
далее не имеет смысла — вы и так уже всё поняли.

Теперь подхожу к ещё одной проблеме цифровой записи. На самом деле, мало просто сделать выборки сигнала на нужной частоте. Надо ещё и записать их
значение максимально точно. Точность при записи называется разрядностью. Чем выше разрядность — тем точнее можно записать выборки сигнала. Нагляднее
всего это демонстрируют два следующих рисунка.

На рисунке представлен всё тот же сигнал, что и на предыдущих — только оцифрованный с разрядностью 2 бита. Несмотря на то, что интерполяция
производилась с коэффициентом 16, восстановленный сигнал вовсе непохож на оригинал. Он и не может быть похожим на него — разрядность в 2 бита
является очень низкой и непригодной для записи звукового колебания.

Всё тот же сигнал, оцифрованный в 16 бит (именно такое качество у CD) и восстановленный с коэффициентом интерполяции 16. Практически неотличим от
оригинала. Отличия будут незаметны на слух. В студийной практике чаще используются более высокие разрядности и частоты выборок —
например, 24бит/48кГц, 24бит/96кГц и т.д. Это связано с тем, что на студиях звук подвергается дальнейшей кропотливой обработке и его лучше иметь в
максимально доступном цифровом качестве. В финальном результате — например, на CD — качества 16бит/44.1кГц для отличного воспроизведения хватает с лихвой.

Добавим сюда тот факт, что цифровая запись не стареет и не может испортиться в принципе. Это — слепок звука, который сам по себе
никаким временным изменениям не подвержен. Также, с этого слепка можно наделать сколь угодное количество копий — и все они будут в точности
одинаковы. А при достаточной точности слепка, его ещё можно и обрабатывать практически неограниченное количество раз.

Подведу черту: все предыдущие изыскания, увещевания и рисунки сводятся к одной мысли — цифровая звукозапись в теории является идеальной. С её
помощью можно записать любой звук, который только может услышать человеческое ухо. А затем можно максимально точно воспроизвести этот звук — с такой
точностью, которая и не снилась аналоговым носителям по причине очевидного несовершенства последних.

Где же подвох?

Теория цифровой записи — как вы, вероятно, уже убедились — свободна от изъянов. Что же происходит на практике?

Во-первых, звук надо грамотно оцифровать — а это задача не совсем тривиальная, хотя упирается она в основном в одну-единственную деталь — АЦП
(аналого-цифровой преобразователь). Допустим, мы взяли суперкачественный микрофон, обеспечили нормальное прохождение электрического сигнала через все
аналоговые цепи (провода, микшер и т.п.). Некачественный АЦП, стоящий на входе цифрового записывающего устройства, враз испортит все старания. Он
может записывать отсчёты с недостаточной точностью. Он может делать выборки с неравномерной частотой. В общем — если АЦП на записи был плох —
записанный звук получается далёким от оригинала и мы уже ничего не сможем с ним сделать (хотя отсчёты по прежнему будут цифровые — исправить их не представится
никаким образом).

Во-вторых, цифровой звук надо грамотно воспроизвести. Ситуация с точностью до наоборот: имеем прекрасную акустическую систему, замечательный
усилитель, отличные провода. Но если мы подключим всё это к выходу некачественного ЦАПа (цифро-аналоговый преобразователь) — получим соответствующий
некачественный звук. У ЦАП обычно больше способов испортить звук: это и неравномерная частота, и недостаточная точность, и, возможно, полное
отсутствие интерполяционной схемы как таковой! Автору доводилось видеть «супербюджетные» звуковые карты для компьютеров, на которых никакой
интерполяции не производилось вовсе, а разрядность выводимого сигнала на вид не доходила и до 5 бит.

Что всё вышесказанное означает? Да то, что качество цифровой записи/воспроизведения зависит только и только от аппаратуры — ровным счётом так же, как и в случае с аналоговыми технологиями.
И если на звукозаписывающих студиях уж явно постарались, приобрели себе хорошую электронику и не имеют проблем с цифровым звуком — у вас эти проблемы
вполне могут появиться, поскольку бытовые проигрыватели цифровой музыки зачастую производят ужасный звук. Здесь раскрывается один момент: во времена
винила и магнитной ленты сама звуковоспроизводящая аппаратура делалась куда более качественно — автор и сам помнит те времена. В наш же век, век
удешевления всего, чего только можно и переноса производства сами знаете куда, ожидать замечательного качества от подавляющего количества среднебюджетной аппаратуры не приходится. Возможно, с
этим и связано большинство негатива в сторону цифровой музыки, т.к. люди не слышат тот звук, который они слышали когда-то. Но зачем винить в этом
цифровую запись? Эта тема уже для другого разговора.

Иногда приходится видеть забавные «обзоры», где люди сравнивают одинаковые альбомы каких-либо исполнителей — сначала в виниле, потом — в CD.
Это смешит: во-первых, переизданная на CD запись будет, конечно же, иметь другой звук, поскольку её ремастерили специально для CD.
Причём, разумеется, ремастеринг делается уж явно для улучшения звука, а не для его ухудшения. Думается, на студиях, переиздающих классические
коллекционные издания хитовой музыки прошлых десятилетий, сидят не профаны.
Во-вторых, тот же винил не в состоянии правильно передать некоторое количество высоких частот из-за очевидной инерционности иглы — звук с винила всегда
характеризуется завалом по ВЧ — он будет более мягким и глуховатым, но кто сказал, что всем нравится эдакая ретро-мягкость?

В голову также приходит другая забавная аналогия. Почему-то, никто не отстаивает видеоформат VHS, говоря, что на DVD худшая картинка. Оно и
понятно — здесь всё видно невооружённым глазом. В случае же со звуком, когда каждый спешит убедить окружающих в своём исключительном слухе, всё
сложнее и плацдарм для разнообразного рода спекуляций шире. Отсюда многочисленные бредовые высказывания, ничего общего со здравым смыслом и наукой не имеющие.
Например, высказывание о том, что «особенно на цифровой записи пропадают басы». Почему именно басы — совершенно непонятно. Равно как и непонятно,
откуда такие профанские мнения постоянно берутся.

Резюме.

С точки зрения науки, цифровая запись звука в сравнении с аналоговой имеет сплошные преимущества и не имеет недостатков. С точки зрения реалий — чтобы услышать по-настоящему
качественный цифровой звук — надо выложить кучу денег, да и не всегда даже за кучу будет хороший результат. Впрочем, в случае с аналоговой записью — ровным счётом всё то же самое.

А напоследок — маленькая сенсация: звук с магнитных лент на самом деле. Цифровой. Связано это с тем, что фактически в
зазор магнитной головки в каждый конкретный момент времени попадает конечное количество магнитных частиц ленты. Следовательно,
значение сигнала уже записано не с полной, а с ограниченной точностью. «Интерполятором» в таком случае выступает сама магнитная головка, т.к. в
ней магнитное поле не может меняться абсолютно мгновенно. Где-то читал (не буду ручаться за достоверность), что примерная разрядность магнитной ленты
— 18 бит. Впрочем, не стоит путать эту «разрядность» с цифровой — всё же, это всего лишь приближение, граничащее с шуткой.

А винил записан с магнитной ленты.

©2009, Анатолий Савенков

Тёплый ламповый звук и сферический винил в вакууме

Данная статья является как бы неформальным продолжением предыдущей: «Аналог vs Цифра:
бой, которого не было». Поскольку вышеуказанная статья поимела широкий отклик (и имеет его до сих пор ;), я принял решение развить эту тему
далее. Никаких графиков, как в предыдущей статье, приводить не буду — как выяснилось, для широкого читателя это где-то даже вредно. Поговорю о теме
цифрового звука более развязно, стараясь затронуть темы, недостаточно хорошо освещённые в предыдущем эссе.

Далее я буду в больших количествах употреблять слово «аудиофил». Замечу, что данное слово употребляется в основном как диагноз — не
исключением будет и эта статья. Человека, который ценит качественный звук и разбирается в нём, обычно принято называть меломаном. А вот аудиофилия —
это пристрастие к якобы «качественному» звуку, основанное на мифах, легендах и, как правило, отсутствии личного опыта и знаний.

Что такое «качественный звук»?

Самое смешное во всей истории споров о различных технологиях звуковоспроизведения — то, что точного определения «качественный звук» попросту не
существует.

Начнём с того, что один и тот же звук может быть качественным для одного индивида и совершенно некачественным для другого. Например, кто-то больше любит
басы и страдает от их недостатка. А кому-то, напротив, нравятся «крепкие» высокие — и если они «мягковаты», то возникает дискомфорт при прислушивании. Что ещё
более интересно, эти пристрастия к тем или иным диапазонам могут со временем меняться даже у одного и того же человека. Всё происходит оттого, что
человеческое ухо — довольно субъективный инструмент восприятия звука. Ухо может «подстраиваться» под звук, нехило обманывая тем самым своего
владельца (тут сразу вспоминаются кабели червонного золота, изготовленные по последнему слову нанотехнологий).

«Слуховые тесты», которыми бредят аудиофилы, по сути подвержены диким погрешностям и вообще не могут серьёзно рассматриваться как
достоверные доказательства «плохости» или «хорошести» звука. Невозможно дважды войти в одну и ту же воду — равнозначно невозможно услышать один и тот
же звук, даже из одной и той же колонки.

Далее, любая звуковоспроизводящая система априори будет искажённо передавать первоначальный звук. Звук был искажён ещё на записи, затем при
обработке, а потом — в трактах усиления и акустической системе. Он никак не может быть стопроцентно соответствующим первоначальному по той простой причине, что
идеальной технологии записи/воспроизведения не существует (и вряд ли когда-либо она появится). Более того: звук после записи искажают намеренно, для
получения того или иного эффекта. Количество обработок, через которые проходит звук на современных студиях звукозаписи, исчисляется десятками. В
результате всё получается красиво — точно так же, как на картинке голливудского фильма, которая далёка от реальности на 99%. Но тем не менее, звучит
всё весьма хорошо (если, конечно, звукорежиссёр не был профаном). Поэтому, следует зарубить себе на носу: звук в конечном треке является очищенным,
рафинированным. Причём рафинированным не с целью ухудшить его, а наоборот.

Как правило, нужная звуковоспроизводящая система подбирается очень просто: по звуку. Вы включаете систему и слышите звук, который вам либо
нравится, либо нет. Выискивать «прозрачность», «теплоту», «объёмность» — чистой воды аудиофилия, ни к чему хорошему в данном
случае не приводящая. Звук системы либо нравится, либо нет — всё просто. И что интересно, с увеличением стоимости системы звук обычно улучшается.
Странно это, или нет? Мне кажется — не очень.

Конечно, люди с повышенными требованиями к звуку выбирают систему более детально. У меня, например, на этот случай есть с собой несколько треков —
пара-тройка прослушиваний — и всё становится ясно. Идеальной АЧХ нет ни у одного усилителя — значит, надо выбрать тот, который наиболее приятно
звучит (в конечном счёте, всё сводится к тому, насколько акустическая система хорошо воспроизводит те или иные частоты, необходимые индивиду для
комфортного прослушивания). Причём, усилитель с идеальной АЧХ в субъективном тесте скорее всего проиграет усилителю, который воспроизводит определённые частоты с бОльшим
усилением (или, наоборот, подавляет их) — как говорится, кому что.

Сегодня в мире аудио господствуют цифровые технологии. Специалиста в данной области это удивлять никак не может: цифра является отличным способом
сохранить и воспроизвести звук. Способом значительно более совершенным, нежели способы, существовавшие до него. Тем не менее, как это случается со всеми
относительно новыми технологиями (хотя цифра «новой» уже не является), цифровые технологии до сих пор подвергаются не особенно заслуженной критике.
«Критики», в основном, разделяются на два лагеря: люди, подкованные в теории и, соответственно, неподкованные и не имеющие вообще никакого опыта.
Первые (видимо, в силу патологического консерватизма и личных пристрастий) изобретают мифы, способные воздействовать на вторых. Вторые с удовольствием эти мифы
распространяют и спорят до упаду в конференциях, не понимая сути предмета как такового. При всём при этом, никак не изменяя того факта, что кругом всё оцифровано и в аналог обратно
переводиться уже не будет.

В общем-то, я не являюсь ярым защитником цифровых технологий записи/воспроизведения звука (на данный момент, это и не требуется). Мне приходилось слышать и аналог, и цифру. Звучат они,
естественно, по-разному. Но кто сказал, что аналог звучит лучше? Это совершенно недоказуемо. Главное достоинство цифры — тиражируемость и вечность,
огромные возможности пост-обработки. И звучит цифра, уж простите меня аудиофилы, ничем не хуже аналога. Точнее, она звучит лучше.

В предыдущей статье я не осветил кое-каких «заветных» тем, с которыми типичные аудиофилы пытаются «разгромить» цифру.
Темы, в общем, избитые и высосанные из пальца. Постараюсь разобрать их здесь поподробнее и надеюсь на то, что мне удастся устроить максимально
понятный ликбез.

Динамический диапазон.

«Динамический диапазон. » — первый крик, с которым аудиофил бросается на амбразуру споров. Абсолютно все аудиофилы, с которыми я, бывало, разговаривал на тему звука,
называли эти два слова. И абсолютно все они толком не знали истинного значения этих слов и реальной картины дела.

Грубо говоря, динамический диапазон — разница между самым тихим и самым громким звуком. В общем случае, чем она больше — тем лучше: ведь это
значит, что система может записать одинаково качественно и очень громкий звук, и крайне тихий. Динамический диапазон, рассчитанный для CD «по математике» —
чуть больше 90 дБ. Динамический диапазон у лучших аналоговых носителей (без шумопонижения) — 50-60 дБ. Итого, вроде бы как получается 30-40 дБ
выигрыша у цифры (что крайне много), но всё не так просто. Дело в том, что ниже диапазона 50-55 дБ у CD возрастает коэффициент нелинейных искажений,
превышая допустимый 1%. То есть, у аналога динамический диапазон ограничен шумами, в которых теряется звук. А у цифры (в её CD-шном варианте) — допустимыми искажениями.
Получается, что динамический диапазон в обоих случаях примерно одинаков (причём цифра не проигрывает, даже на этом этапе
рассуждения). Однако, есть несколько нюансов.

Первый нюанс. Что лучше: когда звук скрывается в шумах совсем, или когда он не скрывается, а только искажается? Однако, пусть лучше звук будет,
чем его не будет.

Второй нюанс. Звук на уровне -50 дБ почти не слышен. Неверящие могут попробовать нормализовать любой звуковой файл до -50 дБ в
каком-нибудь редакторе и послушать (естественно, не надо при этом выкручивать громкость на максимум — пусть она остаётся на обычном уровне). То есть,
где-то там, за диапазоном в -50 дБ, у CD происходят искажения. Только услышать их путём не представляется возможности — вот в чём загвоздка,
музыку на таком уровне просто никто не записывает — в этом диапазоне громкостей можно услышать разве что послезвучие в конце трека. Ну а у
аналогового носителя там просто шум, и всё.

Третий нюанс. Аудионаука давно уже знает о нелинейных искажениях на малых уровнях сигнала в CD (шум квантования). И давно уже есть технология,
позволяющая эти искажения замаскировать (dither). Сия технология применяется в процессе создания любого нормального AudioCD. Фактически, dither
незаметен (из-за того, что воздействует на малые уровни, которые и так не слышно). Но можно сделать забавный опыт: dither на 8-битовом файле! Из
шумящего и шипящего он превратится в относительно чистый, несмотря на низкое битовое разрешение. Таким образом, искажения в фактически неслышимом
диапазоне уровней можно ещё и качественно замаскировать!

И последний, четвёртый нюанс: все эти «страшные ограничения» динамического диапазона применимы только к CD. На студиях давно уже делают запись
и обработку с битовым разрешением минимум в 18 бит (чаще — 24 бита). А это сдвигает динамический диапазон за 100 дБ, оставляя все
аналоговые технологии далеко позади. Сейчас сложно сказать, какой формат устойчиво придёт на смену AudioCD, но можно точно сказать — он не будет
разрешением в 16 бит. Впрочем, пока большинство устраивает даже AudioCD — исходя из вышесказанного, ничего странного в этом я не вижу.

Таким образом, сказки об ограниченном динамическом диапазоне у цифры — не более, чем сказки. Которые, во-первых, привязаны к конкретному формату
AudioCD, а во-вторых — даже у AudioCD с диапазоном всё в порядке.

Джиттер.

Джиттер (jitter) — нестабильность частоты дискретизации. Может возникать как при записи, так и при воспроизведении. Пугать окружающих
страшным ловом «джиттер» аудиофилы привыкли давно. На деле, всё просто. Джиттер возникает в некачественных АЦП/ЦАП — т.е., в дешёвых, бытовых и
непрофессиональных. А в дорогих — профессиональных и высококачественных — джиттер отсутствует. Вот, собственно, и всё.

Чаще всего джиттер встречается в дешёвых звуковых картах для компьютеров. Звуковая карта должна воспроизводить звук с совершенно разными
частотами дискретизации (типично — от 8 до 48 кГц). Естественно, никто не будет вставлять в неё с десяток стабильных генераторов для
разных частот. Сделают один генератор, а все нужные частоты получат с помощью синтезатора частот, который будет пропускать часть импульсов и
таким образом генерировать нестабильную частоту дискретизации (производя джиттер).

Называть джиттер «одной из проблем» цифрового звука — всё равно, что называть кассету «МК-60» проблемой аналогового. Если вы знаете, о чём я. 😉

Уровень записи.

Частенько приходится слышать, что из-за «проблем с цифровыми перегрузками» звукорежиссёры «занижают уровень записи» до запаса аж в 12-16 дБ. Что,
естественно, приводит к возрастанию ошибок квантования, соответствующему искажению сигнала, а также уменьшению динамического диапазона.
Хватает всего пары нюансов, чтобы разгромить и этот миф.

Во-первых, ныне никто в 16 бит не пишет (а именно для такого битового разрешения и будет проблемой занижение уровня записи).
То есть, проблема, возможно, существовала в 90-х годах у людей, пытавшихся записать что-то на звуковую карту класса SB16.

Во-вторых, даже когда я делал запись в 16 бит, то никогда не оставлял такого громадного запаса и не занижал уровень до такого мизера. Просто потому, что это
незачем делать: надо отрегулировать уровень записи до -3 -4 дБ и записывать в своё удовольствие. Кроме того, когда я работал с
16-ю битами, то занимался потрековой записью: каждому инструменту — свой трек (это обычная схема). При такой схеме, даже на 16 бит всё получается
вкусно: каждый инструмент записан с большим динамическим диапазоном (поскольку инструменту «никто не мешает»). В финальном миксе, инструменты
смешивались и реальный динамический диапазон оказывался больше, чем можно было достигнуть при записи «всё в куче».

Этот ваш Котельников — только теория.

Частенько приходится читать рассуждения о том, что практическое применение теоремы Котельникова, на основе которой делается
запись и воспроизведение цифрового звука, сталкивается с очевидными проблемами — что, якобы, делает цифровой звук «не выдерживающим никакой критики».
Проблемы действительно имеют место быть: что запись, что воспроизведение цифры сталкиваются с подводными камешками. Вопрос только в том, что камешки
эти размером с пылинку, если учесть конечную разрешающую способность человеческого уха, которое просто не в состоянии эти камешки вычислить. Да и
описание «проблем», как всегда, зиждется на голом формате AudioCD — как будто других не существует. Дело, как правило, осложняется ещё и тем, что
аудиофилы представляют свои обличающие «слуховые тесты», полученные с mp3-плейера «JingHuang» в колонки Genius.

При записи звука в основном возникает проблема ограничения входного спектра сигнала. Если этого не сделать, то частоты, находящиеся выше граничной
(22.05 кГц для AudioCD) «переползут» при оцифровывании «вниз», создавая низкочастотные искажения (aliasing). Фильтрация сигнала — процесс
нетривиальный и, в целом, полностью отфильтровать весь ВЧ спектр выше нужной частоты без значительных искажений полезных частот всё равно не
получится. Однако, проблема легко решается использованием более высоких частот дискретизации (oversampling) — что при записи, что при обработке. Например, 88.2 кГц
вместо традиционной 44.1 кГц (на студиях вряд ли кто-то в здравом уме ещё пишет в 44.1). При частоте выборки 88.2 кГц граничная частота входного сигнала
— 44.1 кГц, что позволяет конструировать фильтры низких частот более «расслабленно», учитывая то, что нужным диапазоном в конечном счёте является
диапазон частот до

20 кГц. Преобразование же выборок, сделанных на частоте 88.2 кГц, в выборки с частотой 44.1 кГц — просто, как три рубля: достаточно
выкинуть каждый второй отсчёт.

При воспроизведении цифрового звука возникают проблемы с интерполяцией: надо максимально точно восстановить исходный сигнал. Опять же, задача
решается программным повышением частоты выборки (upsampling). Здесь аудиофилы радостно возопят о том, что для программной интерполяции нужны великие
миллиарды операций и что ни один компьютер на такое не способен. В идеале — да, но на деле — можно применить весьма упрощённые формулы, достаточные
для восстановления сигнала с таким качеством, которое аналоговым носителям и не снилось. Пример с графиками для этого дела приведён в
предыдущей статье, где показано, насколько точно восстанавливается сигнал даже для формата
AudioCD (коий традиционно принято пинать аудиофильскими ногами). Уточню также, что те графики я не стянул откуда-то из интернета, а построил их сам — с
помощью своей же программы для моделирования систем цифровой обработки сигналов sDCAD. Суперкомпьютер с миллиардами операций для этого, по счастью,
не потребовался.

Плоский звук.

От аудиофилов часто приходится слышать термин «плоский звук» применительно к цифре. Термин может варьироваться: «пластиковый», «исскусственный»,
«неживой» и тому подобное. Чем же конкретно аналоговый звук отличается от цифрового?

Во-первых, аналог характеризуется мягкостью (завалом) воспроизведения высоких частот. Мягкость возникает из-за банальных недостатков аналоговых технологий.
В случае с винилом это инерционность иглы. В случае с магнитными лентами — постепенное размагничивание (возникающее сразу после записи). Короче
говоря — аналог звучит мягко и деликатно (тем не менее, мягкость обязана «сжёвыванию» ВЧ).

Иное дело цифра: что записал — то и получил. Если тракт звуковоспроизведения качественный — мы слышим то, что было записано — и ничего не
теряется. Некоторые цифровые треки звучат очень жёстко потому, что их так записали — ничего удивительного здесь нет, мягкость нравится не
каждому звукорежиссёру. Особенно учитывая направления в современной музыке, где принято искажать всё, что только возможно, включая голос вокалиста. Но дело в том, что
цифра способна воспроизводить и мягкий звук — надо лишь соответствующим образом его записать.

Слушатели «старой закалки» привыкли слышать с винила или ленты сочный «ухающий» бас, который появляется благодаря естественному завалу ВЧ и
сопутствующим выделением на этом фоне НЧ. С
появлением цифровых технологий звукорежиссёры получили возможность качественно оперировать всем спектром, в результате чего записи стали более насыщенными в
высокочастотном плане. И они действительно звучат привлекательнее старых — если откинуть предрассудки. Впрочем, для получения мощного «ухающего» баса
достаточно сделать простую операцию: прибавить низких. Если, конечно, ваш музыкальный центр вообще оборудован эквалайзером.

В общем, появление цифровых технологий записи звука изменило и сам звук, который мы слышим с треков. Есть ли в этом что-либо удивительное? Не
думаю. Плох ли цифровой звук? Нет, цифровой звук — хорош. При грамотном применении — как и со всем остальным.

Будет также правильным в окончании всех разглагольствований упомянуть факт: в спорах о звуковых технологиях принято забывать о самой музыке. Мы до
сих пор слушаем, к примеру, ранние записи «Битлз» и радуемся. Несмотря на то, что эти записи были сделаны на стиральных досках и целиком представить себе прогресс
в области звуковых технологий, произошедший с тех времён, неподготовленному человеку едва ли возможно. У каждого музыканта свой взгляд на передачу
идей, и поверьте мне на слово, меньше всего мы задумываемся о тёплом ламповом звуке и сферическом виниле в вакууме. Меньше всего музыкант думает о
том, что кто-то будет слушать его запись с золотыми проводами и динамиками, около которых предварительно потанцевал шаман с бубном, заточив
перед этим иглу звукоснимателя в пирамиде. Музыкант думает о том, чтобы донести свою мысль до слушателя. Прекрасно понимая, что в 90% случаев его
музыка будет прослушиваться на весьма бюджетной аппаратуре, зачастую не выдерживающей никакой критики.

И потом, вот уже лет тридцать мир находится под властью синтезированного звука. Звука, появляющегося не из живых инструментов, а из разнообразных
электронных устройств. И понятия «плоский звук» относительно электронного инструмента не может существовать вообще. Кто сказал, что звук синтезатора,
который мы слышим на записи, должен звучать как-то иначе?

Кажется, я разобрал все темы, не затронутые в предыдущей статье. Есть вопросы? Добро пожаловать в комментарии.

Музыкальное дополнение к статье: «Винил» (людям без чувства юмора и аудиофилам не
рекомендуется).

Цифровой звук: DSD vs PCM

Цифровой звук. Как же много мифов крутится вокруг этой фразы. Сколько споров возникало между любителями удобства и качества цифры и приверженцами «живого воздушного» винилового звука помноженного на «тёплое ламповое» звучание. Кроме того, есть немало споров и между любителями «цифры»: достаточно ли 16х44.1 или нужно 24х192? Что лучше: мультибит или дельта-сигма? CDDA или SACD? PCM или DSD? В этой статье я попробую простым языком изложить азы цифрового звука, а так же более подробно остановлюсь на сравнении двух типов кодирования аналогового сигнала в цифровой: DSD и PCM.

Для начала ответим на вопрос, что есть цифровой звук? Чем он отличаются от аналогового? Если говорить кратко, математическим языком, аналоговый звуковой сигнал — непрерывная функция, цифровой звуковой сигнал — дискретная функция. Что это значит?

Аналоговый сигнал

Если нарисовать в воображении график синусоиды (именно так в чаще всего изображают звуковую волну): то, как бы мы его не увеличивали, стараясь рассмотреть все детали, — всегда будем видеть плавную гладкую линию: это аналоговый звуковой сигнал (рис. 1).


Рис. 1. Аналоговый сигнал

Аналоговый звук (запись) имеет множество параметров, с помощью которых можно оценить его качество. Рассмотрим три самых важных: частотный диапазон, динамический диапазон, искажения.

Частотный диапазон — набор частот, содержащихся в звуке. Принято считать, что частотный диапазон человеческого слуха 20… 20.000 Гц (иногда указывается 16 — 22.000 Гц). Сам по себе частотный диапазон музыки никакого интереса в плане оценки качества не представляет (к примеру, частотный диапазон все того же взлетающего самолета будет очень широк, а вокальной партии тенора — намного уже). Качественным параметром, скажем, наушников является потенциальный частотный диапазон, а оценивается он с помощью амплитудно-частотной характеристики (АЧХ). Идеальная АЧХ — прямая линия на всем диапазоне частот слуха – означает, что источник звука не усиливает и не ослабляет какие-то отдельные частоты, а значит извлекаемый звук совпадает с оригиналом.


Рис. 2. АЧХ MP3 файла 256 kbps

Динамический диапазон (ДД) — разность между самым тихим и самым громким звуком. Измеряется громкость в децибелах (дБ). Принято считать, что максимальная громкость, не наносящая травм человеку — это 130 дБ — звук взлетающего самолета, а минимальная слышимая громкость — 5… 10 дБ — на уровне шелеста листьев в маловетреную погоду. Естественно, что шелест листьев на фоне взлетающего самолета разобрать будет невозможно, да и слушать музыку с уровнем 130 дБ крайне неприятно. Поэтому принято считать, что комфортный ДД для прослушивания музыки — 80… 100 дБ.

Искажения – не что иное, как отклонение сигнала от оригинала.

Принципы представления звука в цифровом виде

Что же происходит при оцифровке аналогового звука? Не будем углубляться в технические аспекты, разберем все, как говорится, на бумаге: для этого нарисуем нашу воображаемую «идеальную» синусоиду и будем измерять величину сигнала через равные промежутки времени (этот процесс называется дискретизацией или квантованием): мы получим некий последовательный набор значений — это и будет наш цифровой сигнал, полученный методом импульсно-кодовой модуляции (PCM) (рис. 3).


Рис. 3. Преобразование аналогового сигнала в PCM

Два основных параметра качества PCM сигнала — это частота и разрядность. Частота — это количество измерений за одну секунду, чем их больше — тем с большей точностью передаётся сигнал. Частота измеряется в герцах: 44100 Hz, 192000 Hz и др. Разрядность — количество возможных значений величины сигнала (точность передачи величины). Чем больше вариантов — тем больше точность сигнала. Разрядность измеряется в битах: 16 bit (65.536 возможных значений, ДД 96 дБ), 24 bit (16.777.216 значений, ДД 144 дБ) и др.

Но это не единственный вариант представления звуковой волны в цифровом виде. Есть способ избавиться от такого параметра, как разрядность, оставить только два уровня амплитуды: -100% и +100% (0 или 1). Чтобы добиться этого, не потеряв в качестве, — нужно многократно увеличить частоту считывания величины сигнала (рис. 4).


Рис. 4. Преобразование аналогового сигнала в DSD

Такой вид представления цифрового звука называется импульсно-плотностной модуляцией, чаще всего для него используется аббревиатура DSD. Фактически, единственный качественный параметр такого сигнала — частота. Но так как частоты используются очень высокие (от 2.822.400 Hz), такие цифры сложно запомнить, принято делить частоту DSD сигнала на 44.100 Hz. Полученное число и является показателем качества: DSD64 (ДД 120 дБ), DSD128, DSD256 и т.д.

Восстановление аналогового сигнала из «цифры»

Но оцифровка аналогового сигнала – это полдела. Для прослушивания цифровой музыки нужно выполнить обратное преобразование. Для начала рассмотрим, каким образом превратить в звук цифровой DSD поток. Как мы уже знаем, этот поток представляет из себя высокочастотный (2,8 МГц и более) двухуровневый сигнал, средняя величина этого сигнала меняется со звуковой частотой. То есть, если подходить к решению задачи максимально просто, — нужно отфильтровать все высокочастотные составляющие DSD потока, оставив только полезный звуковой сигнал (частоты до 20. 22 кГц). Делается это с помощью аналогового фильтра низкой частоты (ФНЧ). Простейший ФНЧ – это RC цепочка. Сигнал полученный, после прохождения этой цепочки, показан на рис. 5.


Рис. 5. Восстановление аналогового сигнала из DSD

Как видим, полученный график лишь отдаленно напоминает исходную синусоиду. Но не забываем, что мы «применили» простейший фильтр, улучшая схему фильтра можно добиться практически полного отсутствия высокочастотного шума и получить аналоговый звук с хорошими качественными показателями.

Для восстановления аналогового сигнала из цифрового PCM недостаточно только лишь аналогового ФНЧ, нужно предварительно расшифровать цифровые данные, для этого используются цифро-аналоговые преобразователи (ЦАПы). Бывают они разных типов, но описывать их все в задачи данной статьи не входит. Остановимся на 2-х самых распространённых типах в звуковой технике. Во-первых, это так называемый ЦАП лестничного типа (его ещё называют мультибитным). Как вы, наверное, догадались, такой ЦАП преобразует PCM поток цифровых данных в поток величин звукового сигнала, которые на графике выглядят как лестница (рис. 6). Как и в случае DSD, обязательно использование аналогового фильтра для сглаживания «ступенек».


Рис. 6. Восстановление аналогового сигнала из PCM

Зачастую, в таких преобразователях используется промежуточная передискретизация цифрового PCM сигнала в более высокие значения частоты (например, 192 кГц): это уменьшает «ступеньки», что позволяет упростить схему аналогового фильтра.

Второй тип ЦАП – дельта-сигма – использует передискретизацию в ещё большие значения частоты с одновременным уменьшением разрядности до одного бита. Ничего не напоминает? Это же знакомый нам DSD сигнал! Как далее обработать такой сигнал и превратить его в аналоговый, мы уже рассматривали выше.

Применение PCM и DSD, достоинства/недостатки

Где же мы можем встретить каждый из способов кодирования? PCM формат очень распространён: CDDA диски, DVD Audio, файлы MP3, FLAC, ALAC, AAC, звук в фильмах, и далее, и далее, проще сказать, когда не-PCM. Super Audio CD диски, DSD диски, файлы DSF, DFF — это DSD формат. Что же всё-таки лучше? При воспроизведении какого формата мы получим более качественный звук?

В статьях, посвященных DSD формату, описано множество преимуществ перед PCM, но все ли описываемые преимущества верны или это мифы, придуманные для обывателей, не разбирающихся в технической составляющей, чтобы отвоевывать рынок, плотно занятый PCM форматом? Давайте кратенько пройдемся по списку.

  1. Первое преимущество, которое любят приводить сторонники DSD, довольно расплывчатое — помехоустойчивость и снижение влияния ошибок. Странно слышать про разную помехоустойчивость в цифровом мире: оба формата подвержены помехам ровно настолько, насколько подвержена помехам книжка в цифровом формате. Длительность хранения любого цифрового формата или качество передачи его между устройствами зависят только от носителя / способа передачи, но не от самого формата. Итак, помехоустойчивость одинаковая. А что по поводу снижения влияния ошибок? Допустим, мы храним 2 альбома на оптических дисках (один PCM, другой DSD), что будет, если диск поцарапать? При чтении поврежденного носителя будут возникать ошибки, но насколько они критичны? В PCM кодировании используются многоразрядные числа, ошибка в старшем разряде очень критична (как пример, разница между десятичными числами 11 и 91): на слух это будет ощущаться, как щелчок. В DSD кодировании один бит информации имеет небольшой вес в общем потоке, нечастые ошибки будут вызывать лишь повышение фонового шума, что на слух будет менее заметно.
  2. Второе преимущество описывается чуть конкретнее: больший динамический диапазон по сравнению с PCM. Что же, и здесь есть некоторое лукавство, ДД больше лишь по сравнению с классическим CDDA форматом: 120 … 140 дБ против 96 дБ. Если же сравнивать, например, с DVD Audio — ДД примерно одинаков.
  3. Третье преимущество: DSD более прост технически. Вот здесь поспорить не с чем: более простое декодирование сигнала, отсутствие необходимости синхронизации и буферизации потока при передаче сигнала с одного устройства на другое — полная победа DSD. Кстати говоря, на фоне этого преимущества странно видеть заоблачные цены на аппаратуру, поддерживающую воспроизведение DSD.
  4. Ну и ещё одно преимущество, которое любят приводить фанаты DSD: музыка в этом формате наиболее близка к оригинальному аналоговому звуку. Аргументируется это тем, что современные аналогово-цифровые преобразователи (АЦП) — работают на принципе дельта-сигма модуляции, то есть эти АЦП выдают цифровой DSD поток. И вот опять лукавство: запись будет полностью оригинальной только в случае прямой записи живого выступления либо при оцифровке готовой аналоговой записи с качественного носителя. Операции сведения, наложения эффектов, мастеринга, даже простой подстройки громкости — всего того, без чего не может обойтись создание студийного альбома, — невозможны для цифрой DSD записи по причине отсутствия нормальных алгоритмов ее обработки. Это означает, что все эти операции производятся с PCM форматом, и только после этого готовая PCM запись конвертируется в DSD. Впрочем, нужно отметить, что преобразование PCM > DSD и обратно — достаточно точное: лишь немного возрастает шум за пределами реального динамического диапазона (рис. 7). А значит, не имеет особого значения, в каком формате слушать запись: PCM Hi-Res или DSD — оба формата по качественным характеристикам очень схожи. Так же, фактически, нет смысла покупать отдельную звуковую карту для воспроизведения DSD, послушав совета приятеля, фаната данного формата.

Читать:
Как должен распознаваться символ gs в notepad

Похожие статьи