24 bit i32 что это

от admin

Цифровой аудиоформат 24/192, и почему в нем нет смысла. Часть 3 [Перевод]

Прим. перев.: Это перевод предпоследней части развернутой статьи Кристофера «Монти» Монтгомери (создателя Ogg Free Software и Vorbis) о том, почему обывателям нет никакого смысла хранить и воспроизводить музыку в формате 24/192 (и о том, кому действительно имеет смысл работать с 24-битным аудио).

Вернемся к вашим ушам

Мы обсудили диапазон частот, который способны распознавать уши, но что насчет динамического диапазона (это диапазон от наиболее тихого звука до самого громкого)?

Один из способов точно определить динамический диапазон – это снова посмотреть на кривые болевого порога и порога слышимости. Расстояние от наивысшей точки кривой болевого порога до самой низкой точки кривой слышимости составляет около 140 децибел – для молодого и здорового человека. Правда, слушать звук на такой громкости долго не получится, поскольку +130 дБ уже достаточно, чтобы повредить слух за несколько минут или даже секунд. Для справки скажу, что громкость отбойного молотка на расстоянии одного метра составляет 100-110 дБ.

Интересный момент: порог слышимости увеличивается с возрастом и потерей слуха, а болевой порог с возрастом уменьшается. Волосковые клетки улитки в ухе захватывают только часть всего диапазона в 140 дБ, поэтому мускулатура уха непрерывно регулирует количество звука, достигающего улитку, путем сдвига слуховых косточек – как радужка регулирует количество света попадающего в глаз [9]. Механизм костенеет с возрастом, что ограничивает слуховой динамический диапазон и снижает эффективность защитных механизмов.

Окружающий шум

Немногие люди осознают, насколько тихим может быть звук на пороге слышимости человека.

Самое слабое звуковое давление, которое способен воспринимать человек, составляет -8 дБ SPL [11]. По шкале А для измерения уровня шума, гул от лампы накаливания в 100 Вт на расстоянии одного метра составляет около 10 дБ SPL, что на 18 дБ громче. Гудение лампы будет намного громче, если подключить её к реостату.

Как пример звукового давления в 20 дБ SPL (что на 28 дБ громче самого тихого звука) часто приводится пустая студия звукозаписи или шумоизолированная комната. Найти место тише достаточно сложно, поэтому вы никогда не слышали шум, издаваемый лампочкой.

Динамический диапазон 16 бит

16-битная линейная импульсно-кодовая модуляция имеет динамический диапазон в 96 дБ, в соответствии с наиболее общим способом подсчета, когда динамический диапазон вычисляется как (6*кол-во бит) дБ. Многие верят, что 16-битное аудио не передает произвольные звуки тише, чем -96 дБ. Это большое заблуждение.

Ниже я привел две ссылки на 16-битные аудиофайлы. Один содержит звук частотой 1 кГц, при громкости 0 дБ (где 0 дБ – самый громкий звук), а другой – также звук частотой 1 кГц, с громкостью -105 дБ.

    : Звук 1 кГц при 0 dB (16 бит / 48 кГц WAV) : Звук 1 кГц при -105 dB (16 бит / 48 кГц WAV)

Выше изображен график спектрального анализа звука громкостью -105 дБ перекодированный в формат 16/48 с помощью ИКМ. Громкость 16-битного аудио с применением ИКМ очевидно ниже 96 дБ, иначе -105 дБ нельзя было бы представить или услышать.

Как такое возможно? Закодировать этот сигнал без искажений так, чтобы он был значительно выше уровня шума, в то время как его амплитуда занимает треть бита?

Часть загадки разрешается за счет правильного псевдослучайного сигнала, что как бы делает шум квантования независимым от входного сигнала. Косвенно, это означает, что такой способ квантования не вносит искажений, а только некоррелированный шум. Это, в свою очередь, означает, что мы можем кодировать сигналы с произвольной битовой глубиной, включая сигналы с пиковыми амплитудами, менее чем одним битом [12]. Тем не менее, псевдослучайный сигнал не меняет того факта, что если уровень сигнала опускается ниже уровня шума, то он практически исчезает. Как же звук громкостью -105 дБ по-прежнему различим на фоне шума в -96 дБ?

Ответ таков: мы неверно представляем характеристики шума в -96 дБ. Мы используем неприменимое определение динамического диапазона. Формула (6*кол-во бит) дБ дает нам среднеквадратичный шум всей полосы сигнала, а каждая волосковая клетка чувствительна только к узкому спектру от всей полосы частот. Поскольку каждая волосковая клетка слышит только часть общей энергии шумов, то уровень шума, принимаемый клеткой, будет намного ниже, чем весь диапазон частот громкостью -96 дБ.

16-битное аудио может обладать более глубокой модуляцией, чем 96 дБ, если использовать правильный псевдо-сигнал, который смещает энергию шума квантования в зону, где его сложнее расслышать. На практике [13] 16-битное аудио может достигать громкости в 120 дБ.

120 дБ – это больше, чем разница между звуком комара в комнате и отбойным молотком в футе от вас. Или разница между пустой звуконепроницаемой комнатой и достаточно громким звуком, который способен повредить слух в секунды.

16 битов хватает, чтобы хранить весь слышимый спектр, и будет хватать всегда.

Соотношение сигнал-шум

Стоит сделать небольшое замечание о том, что соотношение сигнал/шум для уха меньше, чем динамический слуховой диапазон. Внутри заданной критической полосы, обычно, сигнал/шум составляет лишь 30 дБ. Отношение сигнал/шум не достигнет рамок диапазона слышимости, даже при условии расширения полосы частот. Это гарантирует, что формат 16 бит ИКМ обеспечивает разрешающую способность сверх необходимого.

Также стоит отметить, что увеличение битовой глубины звука с 16 бит до 24 не увеличивает разрешающей способности и «качество» звука. Это всего лишь расширит динамический диапазон – расстояние между самым тихим и самым громким звуком, за счет снижения уровня шума. Как бы то ни было, 16 бит уже обеспечивают уровень шума, который мы не в состоянии услышать.

Когда 24 бита имеют значение?

Профессионалы используют для записи музыки 24-битные сэмплы [14] из-за меньшего уровня шумов и по соображениям удобства.

16 бит достаточно, чтобы охватить весь слышимый диапазон с запасом. Но он не охватывает весь возможный диапазон аудио-оборудования. Основная причина использования 24 бит во время записи – это избежание ошибок. Вместо того, чтобы осторожничать, выравнивая 16 бит по центру диапазона, рискуя отрезать верхние частоты или добавить шума, 24 бита позволяют оператору установить примерный уровень и более не думать об этом. Промах на пару бит не влечет за собой никаких последствий, а эффекты, которые динамически сжимают записанный спектр, имеют большее пространство для маневра.

Также инженеру требуется большее 16 бит при смешении сигналов и мастеринге. Современные рабочие процессы могут включать, буквально, тысячи эффектов и операций. Шум квантования и уровень собственных шумов 16-битной выборки могут быть незаметны при воспроизведении, но при увеличении такого шума в несколько тысяч раз, он сразу становится заметным, а 24-битный формат сохраняет накапливающийся шум на очень низком уровне. После того, как музыка готова к записи на диски, нет никаких причин оставлять больше чем 16 бит.

Тесты на прослушивание

Понимание живет там, где встречаются теория и реальность. Вопрос разрешается только тогда, когда они обе приходят в согласие.

Эмпирические данные, полученные из тестов на прослушивание позволили судить, что 44.1 кГц/16 бит обеспечивает максимально возможное качество воспроизведения. Множество контролируемых тестов подтвердили это, но я рекомендую недавнюю работу «Слышимость стандарта CD, аналогово-цифровое и цифро-аналоговое преобразование, использованное в воспроизведении аудио с высокой разрешающей способностью», проделанную местными ребятами из Бостонского аудио-сообщества.

К сожалению, для доступа к полному тексту работы нужно быть членом Общества звукоинженеров. Тем не менее, эта работа широко обсуждалась во многих статьях и на форумах, авторами, которые туда [в сообщество] входят. Вот несколько ссылок:

  • Новая частота дискретизации: насколько высоко качество современных CD? [ссылка]
  • Ветка форума Hydrogen Audio [ссылка]
  • Справочная информация со страницы Бостонского-аудио сообщества, включая перечень оборудования и список сэмплов [ссылка]

В ходе этой работы проводился эксперимент: были отобраны испытуемые, которые выбирали между записями на высококачественных аудио DVD/SACD, подобранными приверженцами звука высокой четкости, чтобы показать его превосходство, и теми же записями, но в CD формате 16/44.1 кГц. Слушателям нужно было выявить какие-либо различия между ними, используя методологию случайного выбора. Бостонское аудио-сообщество проводило эксперимент с использованием высокопрофессионального оборудования в шумоизолированной среде, как с обычными, так и с тренированными слушателями.

Среди 554 попыток, испытуемые выбирали «правильно» в 49.8% случаев. Другими словами, они пытались угадать. Ни один слушатель в течение всего теста не смог опознать, которая из записей была в формате 16/44.1, а какая была звуком высокой четкости [15]. А 16-битный сигнал даже не был сглажен!

В еще одном недавнем исследовании [16] изучалась возможность расслышать ультразвук, как предполагали более ранние исследования. Тест был построен таким образом, чтобы максимизировать возможность распознавания, для этого были добавлены интермодуляционные составляющие в места, где они были бы наиболее слышны. Было установлено, что нельзя услышать ультразвуковые волны… но оказалось, что искажения от интермодуляционных составляющих распознать можно.

Эта статья породила череду дальнейших исследований, результаты большей части которых противоречили друг другу. Некоторые неясности были разрешены, когда обнаружилось, что ультразвук может вызывать большее количество интермодуляционных искажений в усилителях мощности, чем ожидалось. Например, Дэвид Гризингер (David Griesinger) провел этот эксперимент [17] и обнаружил, что его акустическая установка не вносила заметных интермодуляционных искажений, но зато их вносил усилитель.

Читатель, будь осторожен

Очень важно не вырывать отдельные работы или «комментарии экспертов» из контекста или брать их только с ресурсов, интересных вам. Не все статьи полностью соглашаются с этими результатами (а несколько даже не соглашаются с большей частью), поэтому легко наткнуться на мнение меньшинства, которое может доказывать любую точку зрения, которую вы можете вообразить. Несмотря ни на что, статьи и ссылки, приведенные выше, представляют большую важность и серьезный объем знаний и экспериментальных записей. Нет ни одной известной статьи, которая бы прошла испытание временем и поставила бы под сомнение состоятельность этих результатов. Споры происходят только среди потребителей и внутри сообществ меломанов.

Во всяком случае, количество неоднозначных, незаконченных и откровенно несостоятельных экспериментальных результатов, доступных в поиске Google, подчеркивает, насколько сложно провести точное и объективное исследование. Различные ученые ищут всякие мелочи, требуют проводить строгий статистический анализ, чтобы выявить подсознательные выборы, которые непреднамеренно делали испытуемые. Таким образом, мы скорее пытаемся доказать что-то, чего в принципе не существует, что делает положение вещей еще сложнее. Доказательство нулевой гипотезы сродни разрешению проблемы остановки – это нереально. Единственный вариант подтвердить что-то в этом случае – собрать достаточно много эмпирических данных.

Несмотря на это, работы, подтверждающие нулевую гипотезу – это действительно серьезное доказательство; подтвердить «не слышимость» экспериментально гораздо сложнее, чем обсуждать её. Неизвестные ошибки в тестовых методиках и оборудовании почти всегда дают ложноположительные результаты (из-за случайного внесения звуковых различий), а не ложноотрицательные.

Если профессиональные исследователи с таким трудом проводят исследование отдельных аудио-различий, то вы можете представить, как это трудно для любителей.

Как (ненарочно) испортить результаты звукового эксперимента

Самый «лучший» комментарий, который я слышал от людей, верящих в высококачественное аудио (перефразировано): «Я слышал высококачественный звук лично, и улучшение качества звучания очевидно. Вы серьезно хотите, чтобы я не верил своим ушам?»

Разумеется, вы можете верить собственным ушам. Но дело в том, что это мозг чересчур доверчив. Я не пытаюсь кого-то оскорбить, это проблема всех людей.

Предвзятое мнение, эффект плацебо и двойное слепое тестирование

Любое испытание, где слушатель может опознать два варианта по любым признакам, кроме как на слух, обычно приводит к результатам, которые слушатель ожидал заранее. Это называется предвзятостью и имеет схожесть с эффектом плацебо. Это означает, что люди «слышат» различия, из-за подсознательных сигналов и предпочтений, которые не имеют отношения к звуку – это как предпочесть более дорогой (или более привлекательный) усилитель более дешевому.

Человеческий мозг устроен таким образом, чтобы подмечать особенности и различия там, где их нет. И эту особенность нельзя отключить, просто попросив человека принимать объективные решения – это происходит на подсознательном уровне. Предвзятость нельзя ликвидировать скепсисом. Контролируемые эксперименты доказывают, что осознание принятия предвзятых решений лишь усиливает эффект! Тест, во время которого не было устранено влияние предвзятых суждений, ничего не стоит [18].

При одностороннем слепом тестировании слушатель ничего не знает заранее о вариантах и не получает никакой обратной связи в ходе испытания. Такое тестирование лучше прямого сравнения, но не исключает предвзятости экспериментатора. Тот, кто проводит тест, может непреднамеренно повлиять на его ход или передать свою собственную предвзятость слушателю неосторожными репликами (например: «Вы уверены, что это то, что вы слышите?», язык тела также может указать на «неправильный» выбор, и заставить сомневаться, и так далее). Влияние предвзятости человека, проводящего тест, на результаты слушателя также было подтверждено экспериментально.

Двойные слепые тесты – это стандарт, в таких тестах ни экспериментатор, ни слушатель не получают какой либо информации о содержании теста и текущих результатах. Наиболее известный пример – это ABX-тесты, проводимые компьютером, которые есть в свободном доступе – их можно запустить на вашем собственном ПК [19]. ABX-тесты подразумевают минимальное количество результатов слухового теста, до достижения которых они считаются неполноценными. Имеющие хорошую репутацию аудио-форумы, такие как Hydrogen Audio, часто запрещают любые обсуждения результатов слуховых тестов, если они не соответствуют минимальным требованиям объективности [20].

Выше изображено рабочее окно Squishyball – простой командной строки инструмента ABX, запущенного в xterm.

Лично я не проводил ни одного качественного сравнительного теста в процессе исследований (неважно, насколько серьезных) без применения ABX. Наука есть наука, тут нет места нерадивости.

Проделки громкости

Человеческое ухо может сознательно различать амплитудные различия громкости примерно в 1 дБ, и эксперименты показывают возможность определения различий в пределах 0,2 дБ на подсознательном уровне. Люди практически повсеместно считают громкий звук лучше, и 0,2 дБ достаточно, чтобы человек выказал предпочтение. По результатам любого сравнения, в котором неаккуратно выставлены амплитуды, будет наблюдаться явно выраженное предпочтение громкому звуку, даже если различия в громкости малы для того, чтобы осознать это. Продавцы аудио знают об этом трюке уже очень давно.

Профессиональный стандарт тестирования требует различия амплитуд на величину, не превышающую 0,1 дБ. Это часто требует использования осциллографа или анализатора сигналов, потому что подгадывать и крутить ручки, пока звук не совпадет, достаточно нерационально.

Отсечение сигнала

Отсечение сигнала – это еще одна ошибка (иногда проявляющаяся только с течением времени), которую легко допустить. Может оказаться, что несколько обрезанных сэмплов и их производные сигналы сравниваются с необрезанным сигналом.

Опасность отсечения части сигнала особенно разрушительна в тестах, которые дискретизируют, передискретизируют цифровые сигналы и управляют ими «на лету». Допустим, мы хотим сравнить качество звучания сигналов с частотой дискретизации 48 кГц и 192 кГц. Обычный способ провести такой эксперимент – обеспечить субдискретизацию из 192 кГц в 48 кГц, а затем снова провести повышающую дискретизацию до 192 кГц, после чего сравнить два этих сигнала в ABX-тесте [21]. Такой порядок позволяет нам исключить любую возможность изменения параметров оборудования или подмены сэмплов, влияющую на результаты. Мы можем использовать тот же ЦАП для воспроизведения обоих сэмплов и переключаться между ними без каких-либо изменений в режиме работы оборудования.

К сожалению, большинство сэмплов используют весь цифровой диапазон. Невнимательное применение передискретизации часто может привести к случайному обрезанию звука. Очень важно или следить за отсечением (и отбрасывать обрезанный звук), или избегать его, применяя различные методы: например, ослабление (аттенуацию) звука.

Другой носитель – другая мастер-копия

Я просмотрел несколько статей и блогов, которые утверждали о достоинствах 24 бит или 96/192 кГц, путем сравнения CD и аудио-DVD с «одинаковыми» записями. Такое сравнение несостоятельно, потому что для этих записей используются разные мастер-диски.

Непреднамеренные сигналы

Непреднамеренные аудио-сигналы практически неизбежны в старых аналоговых и гибридных цифро-аналоговых тестовых установках. Очевидно, что цифровые установки могут полностью устранить проблему в некоторых формах тестирования, но могут и увеличить количество потенциальных ошибок программного обеспечения. Такие ограничения и баги уже достаточно давно дают ложноположительные результаты в тестированиях [22].

Статья «Цифровые испытания – больше о ABX-тестировании» рассказывает увлекательную историю об удивительном тестировании слуха, проведенном в 1984 году, призванном опровергнуть авторитет меломанов того времени, которые поначалу утверждали, что CD уступает винилу. Статья касается не столько результатов испытания (я подозреваю, вы сможете догадаться, какими они были), сколько хаотичности мира, вовлеченного в проведение такого теста. Например, ошибка со стороны организаторов теста случайно показала, что приглашенный эксперт по прослушиванию делал выбор, основываясь не на качестве звучания, а скорее на различных потрескиваниях, которые производили реле коммутаторов.

Анекдотические истории не заменяют реальные данные, но эта история показывает, с какой легкостью скрытые недостатки могут влиять на слуховые тесты. Некоторые из убеждений меломанов тоже довольно забавны, например кто-то надеется, что многие из современных исследований будут считаться глупыми через 20 лет.

Примечания к Части 3

9. Все знают это чувство, когда перепонки «разжимаются» после выключения громкой музыки.

10. Несколько отличных графиков можно найти на сайте HyperPhysics.

11. 20 мПа обычно принимаются за 0 дБ для удобства измерения. Это приблизительно равно порогу слышимости на частоте 1 кГц. На частотах от 2 до 4 кГц ухо настолько же чувствительно как на 8 дБ.

12. В приведенной ниже статье описано лучшее объяснение сглаживания, что я встречал, хотя она [статья] больше о сглаживании изображений. Но первая половина охватывает теорию и практику сглаживания в аудио, перед тем как перейти к теме изображений.

Кэмерон Николас Кристов, статья «Оптимальное сглаживание и ограничение шума на изображениях».

13. Инженеры, занятые в цифровой обработке сигналов, могли заметить, как это сделал мой всезнающий соотечественник, что 16-битное аудио, в теории, может иметь бесконечный динамический диапазон для чистого звука, если вы воспользуетесь бесконечным рядом Фурье, чтобы преобразовать его. Эта концепция очень важна для радиоастрономии.

Хотя работа уха не сильно отличается от преобразования Фурье, его разрешение относительно ограничено. Это накладывает ограничение на максимально возможную битовую глубину 16-битных сигналов.

14. В производстве цифровой музыки используют 32-битные числа с плавающей точкой, потому что это очень удобно для современных процессоров, и потому что это полностью устраняет вероятность того, что случайное обрезание останется незамеченным и погубит композицию.

15. Несколько читателей хотели узнать как тест Майера и Морана в 2007 году мог дать нулевой результат, если ультразвук может вызывать интермодуляционные искажения?

Должно быть очевидно, что «мог» и «иногда» не то же самое что «смог» и «всегда». Интермодуляционные искажения от ультразвуковых волн могут появиться, а могут и не появиться в любой системе, при любом наборе условий. Нулевой результат Майера и Морана означает, что интермодуляционные искажения были неслышны на системах, которые они использовали во время теста.

Вниманию читателей предлагается ознакомиться с простым тестом на определение интермодуляционных искажений, и определить интермодуляционный потенциал их собственного оборудования.

16. Кару и Шого (Karou and Shogo), статья «Определение порога для звука, частотой выше 22кГц» (2001). Материал номер 5401, представленный на 110 собрании 12-15 мая 2001 года в Амстердаме.

17. Дэвид Грезингер, статья «Восприятие средних частот и интермодуляционные искажения высоких частот в динамиках, и их взаимодействие с аудиозаписями высокого разрешения».

18. Со времени публикации несколько комментаторов отправили мне похожие версии одного анекдота (перефразировано): «Я как-то слушал какие-то наушники/ усилители/ записи ожидая результат А, но был очень удивлен, когда пришел к результату Б! Доказано: предвзятость – это чушь!» Я могу сказать две вещи.

Во-первых, предвзятость суждения не заменяет все верные результаты на неверные. Она склоняет результаты в труднопредсказуемом направлении на неизвестную величину. Как вы можете утверждать, что верно, а что – нет, наверняка, если тест был сфальсифицирован вашим подсознанием? Скажем, вы ожидали услышать большую разницу, но были удивлены, услышав малую разницу. Что если там не было разницы совсем? Или разница есть, но будучи осведомлённым о возможной предвзятости, ваш благонамеренный скептицизм скомпенсировал ваше мнение? Или, может быть, вы были совершенно правы? Объективное тестирование, например ABX, устраняет все эти неопределенности.

Во вторых: «Вы думаете, что вы не судите предвзято? Отлично! Докажите это!» Значимость объективного теста заключается не только в его способности убедить нас, но и в способности убедить в этом других. Заявления требуют доказательств. Чрезвычайные заявления требуют экстраординарных доказательств.

19. Наверно, самые простые инструменты для ABX-тестирования:

    с ABX-плагином , инструмент командной строки Linux, которым пользуемся мы в Xiph

20. На Hydrogen Audio, аббревиатура TOS8 (objective testing requirement) обозначает необходимое условие тестирования, цифра 8 обозначает восьмой пункт условий предоставления услуг.

21. Принято считать, что передискретизация наносит непоправимый вред сигналу. Это совсем не так. По крайней мере, до тех пор, пока кто-то не допустит ошибку, например, обрезав сигнал. Субдискретизированный, а потом дискретизированный снова сигнал будет неотличим от оригинала. Это обычный тест, используемый для установки более высоких параметров дискретизации, что не обязательно.

22. Это, может быть, не связано напрямую со звуком, но… нейтрино что, быстрее скорости света, серьезно?

Поделитесь статьёй:

Сравнение 24-битного и 16-битного звука: результаты аудиотеста

Блогер Archimago немало сил потратил, чтобы ответить на вопрос: какое качество звука человек способен определять на слух? В рамках одного из его последних аудиотестов респондентов просят вслепую различить звуки с динамическим диапазоном 24 бит и 16 бит. Каждый из них скачивал несколько пар 24-битных файлов, один из которых претерпел конверсию 24-16-24 бита, то есть на практике был 16-битным файлом. Их просили определить разницу.

В тесте приняли участие 140 добровольцев (138 мужчин и 2 женщины: честная демографическая картина для аудиофилов). Средний возраст респондентов: 44 года.

Согласно анкетам, более 20% респондентов назвались музыкантами и звукоинженерами, поэтому можно сравнить результаты среди «профессионалов» и любителей, с учётом статистической погрешности.

Стоимость аудиоаппаратуры у участников опроса чаще всего лежит в диапазоне от $1000 до $3000.

Результаты опроса по трём парам файлов довольно любопытны. В двух из трёх композиций правильные и неправильные ответы распределились ровно пополам.

А в композиции Bozza 52,85% пользователей ошиблись, приняв 16-битный файл за 24-битный.

20 респондентов правильно ответили на все вопросы, а 21 человек ошибся во всех вариантах, что тоже вписывается в рамки статистического распределения.

Ещё более удивительно, что музыканты показали результат хуже среднего, даже с учётом статистической погрешности! Особенно сильно напутали в композиции Вивальди.

А вот результат среди пользователей, у которых стоимость звукового оборудования превышает $6000.

Наушники тоже вовсе не помогают отличить 16-битную музыку от 24-битной.

Подводя итог. Конечно, есть приложения, в которых нужно работать именно с 24-битным звуком (тот же мастеринг). Но факт в том, что на слух 16- и 24-битный звук совершенно не различимы друг от друга. Если кто-то заявляет, что способен услышать разницу, то этот человек наверняка заблуждается.

Вопросы о ЦАПах: чипы и фильтры, мультибит, музыкальность и апскейлинг

Вопросы о ЦАПах: чипы и фильтры, мультибит, музыкальность и апскейлинг

На прошедшей онлайн-встрече было задано множество интересных и полезных вопросов о ЦАПах и цифровом сигнале. По итогам я сделал конспект-расшифровку наиболее важных из них, и по некоторым моментам дал расширенное объяснение. Будем считать, что получился своего рода FAQ по актуальному состоянию цифровых технологий в аудиокультуре.

На какие технические характеристики нужно обращать внимание при выборе ЦАПов — в порядке важности (силе влияния на звук), если можно так структурировать?

Ответ зависит от того, в какой вы точке вы находитесь. У вас уже что-то есть и нужен апгрейд — или вообще ничего нет? По ЦАПам можно посмотреть иерархию производителя. Если в линейке он такой один и стоит при этом не три копейки, то очевидно, что у производителя вся надежда только на него и это его предел возможностей. Т.е. производитель вложился в эту единственную модель.

Если же таких ЦАПов в линейке несколько, очевидно, что в младших моделях кое-что будет слабеньким — возможно, даже умышленно. Хотя по железной себестоимости разброс у пяти аппаратов может быть не таким и значительным.

Бывает, что производитель полагает, что он крепко упахался по теме и хочет разложить свои яички по всем корзинам. Поэтому он выстраивает свою линейку таким образом, чтобы сначала зацепить покупателей младших моделей чувством причастности к хорошему авторитетному бренду. Затем после обсуждения на форумах, где все щеголяют более дорогими аппаратами, человек настраивается в будущем занять более высокую ступеньку в этой иерархии.

Мне больше импонирует первый подход с минимальным количеством вариантов. ЦАП — это не колонка, которая может быть большого или маленького литража. Или усилитель, который должен выдавать много тока как сварочный аппарат. Здесь идет тихая тонкая работа — все это может работать хоть от батареек. Вот и сделайте одну модель на совесть!

Изучите все возможности чипа-конвертера, все его ключи, которые регулируют его работу и фильтрацию, поставьте лучший клок с минимальным джиттером, нормальные операционные усилители, исключите грязь питания. Хотя, повторюсь, для аудиолюбителей и в том числе журналистов второй вариант кажется более увлекательным — больше фактуры, можно посмаковать и поболтать о разнице начинок.

Приводимые технические параметры битности и дискретности принципиального значения не имеют. Если речь не идет о каком-то старье, сейчас даже дешевые чипы обеспечивают полную поддержку Hi-Res-аудио. Если на нем написано 32 бит или 24 бит — все это неважно. Официальной 32-битной музыки не бывает. Важно, какой у вас дальше обвес и была ли конструкция спроектирована адекватным человеком.

Читать:
Как перезагрузить посудомойку икеа

В чем разница выбора ЦАПа для CD и для FLAC и т.п., или они универсальны, кроме очевидного, типа необходимости порта USB в случае с FLAC с компьютера?

В CD-проигрывателях передача сигнала на ЦАП осуществляется в рамках одной платы, поэтому там используется протокол i2s. В нем синхронизация подается по отдельной линии. Его поддерживают все аудиочипы. Многие аудиофилы верят, что это самый лучший цифровой протокол на планете, но убедительных технических доказательств этому феномену пока не представлено. Случаи i2s-входов на внешних ЦАПах весьма редки. Причина банальна — стандартом не предусмотрено кабельное соединение для i2s. Поэтому некоторые Hi-Fi производители в частном порядке пытаются городить какие-то свои схемы на базе BNC, DIN, HDMI и др. С понятными итогами совместимости для этих агрегатов.

Поэтому если вы захотите вытащить из CD-транспорта PCM-код на внешний конвертер — понадобится кабель и SPDIF-протокол. Кабели — оптика или коаксиал, либо (реже) AES на разъеме XLR или BNC. Протокол SPDIF не использует отдельную шину, он содержит в себе тактовый сигнал синхронизации и ограничен параметрами 24 бит/192 кГц. SPDIF-ресивер на ЦАПе будет настраиваться строго по тактовой частоте транспорта, каков бы он ни был — хорош или плох.

USB-передача аудио — как это ни странно, находится ближе к старинному i2s, потому что фактически транслируется сигнал на i2s-шину в чипе ЦАПа. Здесь также существует возможность передачи до 32 бит и выделенный канал синхронизации. Первые USB-приемники имели синхронизацию с началом первого фрейма, но современные USB-ЦАП теперь владеют собственным клоком, и поэтому передача аудио по USB называется асинхронной. Подробнее можно почитать здесь.

Всегда интересовало выражение «музыкальный» ЦАП. Можно ли так характеризовать ЦАПы — и если да, то какие есть критерии «музыкальности»?

Не могу поручиться за каждого, кто злоупотребляет подобными терминами. В одних случаях подразумевается, что устройство принадлежит к аудиобренду High End, чей имидж обусловлен такой выраженной эмоциональной составляющей ее идеолога. Например, Питер Квортруп из Audio Note.

В других случаях этот термин могут приписывать мультибитным чипам — особенно, если они еще и работают в NOS-режиме, сглаживая высокочастотный диапазон. Окраска, ламповая или высокочастотная — все это может давать повод назвать такой ЦАП меломанским.

Предлагаю заодно рассмотреть и обратный вариант — почему некоторые слушатели обвиняют чипы ESS Sabre в антимузыкальности, хотя измерения у них такие, что не снились никаким «филипсам».

Какой чип ЦАПа лучше: AKM или ESS? Какие у них достоинства и недостатки?

В дешевых реализациях я бы избегал ESS. Если мы решим что-то выяснить с настройками чипов ESS, то обнаружим, что сделать это весьма непросто. В отличие от других производителей — Texas Instruments, Analog Devices или Asahi Kasei, — чипы ESS не имеют открытых кодов спецификаций.

Поэтому сразу предупреждаю самодельщиков не связываться наобум с «сейбрами». Это прибор с потенциально хорошими показателями, но сложный — и не все производители понимают, с чем имеют дело. Иногда некоторые не догадываются ставить сумматор из-за балансных выходов на чипе.

А кроме того, например, в модели ES9038 по умолчанию включена опция компенсации гармонических искажений 2-го и 3-го порядка. Бог весть, как она работает и чем жертвует. Как показывают более глубокие измерения, при уровне сигнала около -40 до -20 дБ на аудиовыходе у «сейбров» растут интермодуляционные искажения, которые принимают форму так называемого «горба».

Внутренняя архитектура модулятора Sabre мультибитная и работает с блоками по 5 бит, усредняя значения. Математика Hyperstream на деле оказалась более чувствительной к смещению постоянного тока и вызывает рост интермодуляционных искажений в определенной области.

И это будет происходить, если вы используете цифровой аттенюатор перед ЦАПом. Интермодуляционные искажения более выражены для слуха, чем THD, но реже попадают в спецификации. А в западных пабликах это явление теперь так и зовут — ESS Hump.

Части производителей (таким, как Benchmark) удалось победить этот «горб», но у большинства проблема сохранилась. Так что сами видите — необходимо понимание работы ЦАПа в разных режимах.

Часто говорят о частоте дискретизации, но редко о битности. Насколько в реальности повышение глубины до 24 или 32 бит — это хорошо? Например, если частота остается 44,1 — улучшится ли звук, став 24-битным вместо 16 бит?

Чтобы понимать битовую глубину (или разрядность), сперва определимся, что они описывают и как работают. В бинарном коде бит будет либо 1, либо 0. Дальше с увеличением битности варианты кодирования растут по экспоненте. Напомню апокриф с изобретателем шахмат, которого правитель спросил о награде.

Шахматист смиренно попросил начать с одного зернышка на первой клетке и удваивать их количество на следующей. В общем, через несколько дней подсчетов правитель и казначеи поняли, что над ними издеваются. Потому что такого количества зерна не собрать, даже если осушить океаны и засеять всю землю. 64 клетки в шахматах — посмотрите на инженерном калькуляторе, сколько будет 2 в 64 степени. Это и есть 64 бит пшеницы.

При оцифровке (т.е. квантовании) истинные уровни всегда будут где-то между двумя соседними значениями кода. 16-битный звук описывается в пределах 65 536 значений. 24-битный звук, то есть 2 в 24 степени — уже описывается 17 миллионами вариантов уровня. Ну и как полагаете, какая сетка более точно опишет оттенки аналогового сигнала?

Еще один важный момент — редактирование цифрового сигнала. При изменении уровней, эквализации и другой обработке все процедуры для уменьшения ошибок квантования желательно вести в более высокой битности, чем оригинал. Поэтому на железном оборудовании в самом конце 80-х сначала появились шины 20 бит разрядности, затем и 24. В современных DAW-комплексах, да и просто компьютерных аудиоредакторах или даже регулировки громкости в плеерах типа Foobar внутренний пересчет потока ведется в 32 бит с плавающей точкой. DSP-процессоры могут использовать еще более высокие показатели — 64 бит, как на той шахматной доске.

Для тиража финальный микс опрокидывают обратно в 24 бит — либо по старинке в 16. В 32-битном формате музыку не издают. Нет смысла: огромный объем, ни SPDIF, ни FLAC 32 бит не поддерживает. Некоторые аудиофилы утверждают, что нет смысла и в 24-битной музыке. Мне так не кажется.

Дело в том, что для конвертации 32-битного проекта в 16-битную форму нужна инъекция сглаживающего шума. Так снимаются ошибки квантования при отбросе младших битов. Работает функция дизеринга (dither). И при переводе из 32 в 24 бит его величина настолько незначительна, что им даже можно пренебречь. Так что вмешательство в оригинальный сигнал при такой конвертации куда более щадящее, и имеет смысл предпочитать более близкие к оригиналу 24-битные миксы — даже если у них «обычная» частота дискретизации 44,1 кГц.

Что касается вопроса, насколько это адекватно реалиям реальной аудиосистемы, то тепловой шум компонентов составляет где-то 22 бит из расчета 6 децибел на один бит — т.е. где-то -130 дБ. Так что 24 бит получается с запасом. В статье «Бит против килогерца» я именно 22 бит предлагал установить вместо 24, а самую ходовую частоту дискретизации поднять с 44 до 60 кГц, т.е. перенести верхнюю границу диапазона 30 кГц, чтобы избавиться от проблем фильтрации на границе слуха.

Если при воспроизведении 16-битный контент попадает на 24- или 32-битный ЦАП — ничего страшного. Просто младшие разряды останутся с нулями. А вот когда наоборот приходят 24 бит на старый 16-битный ЦАП, младшие 8 бит будут отброшены. Из-за транкейта ошибок квантования искажений в итоге станет больше.

Мультибитные ЦАПы — зачем они вообще нужны?

Мультибитные аппараты появились не нарочно, чтобы порадовать аудиофилов. Такая уж получилась технология — другой тогда еще не было. Хотя некоторые любители винтажа сейчас задним числом говорят, что такой ее сделали нарочно, чтобы отвадить потребителей от пластинок. Они же утверждают про «аналоговость» звучания мультибитных ЦАПов, с чем я не вполне согласен и на незнакомой системе вряд ли угадаю — вот это точно играет ЦАП на лестничной R-2R матрице. Если же намеренно ввести себя в аудиофильский транс и долго и изнурительно сравнивать, то я бы назвал мультибитный почерк иначе — жанровой «выразительностью».

Такой конвертер при грамотной реализации демонстрирует пластичность НЧ-диапазона, подчеркнет контур вокала или инструмента на акустических записях. Можно допустить, что у дельта-сигм при более уверенной и насыщенной «высоте» сцены, акустический тембр выглядит более постным и диффузным. Но, повторюсь, эта разница не в стиле «небо и земля».

В 80-90-х было выпущено множество CD-плееров с мультибитными чипами и грязноватым, утомительным звуком. Обвязка ведь тоже играет роль. К тому же не забывайте, что, например, DSD — это чистейшая дельта-сигма, однобитная. И у этой концепции вполне себе мягкий аналоговый (или псевдоаналоговый, как вам будет угодно) почерк.

Какие есть разновидности FIR-фильтров?

Информация по ним общеизвестна. Самый старый называется фазолинейным. После такого фильтра в волне будут паразитные колебания до и после импульса. В основном, сейчас применяют минимально фазовые — у него все колебания отложены на потом, после импульса. И эти флуктуации более выражены, чем у фазолинейного.

Если вы, как инженер, желаете уменьшить колебания, то ослабляете фильтр, делаете крутизну его спада мягче. Подобные фильтры называют уже не Sharp, а Slow. Они имеют спад на ВЧ. Если ваша система достаточно звонкая и прозрачная, Slow-фильтры ничего не испортят — мне они нравятся больше, чем Sharp.

1,2 – фазлинейные фильтры Sharp и Slow; 3, 4 – минимально-фазовые Sharp и Slow фильтры; 5 – без фильтрации non-oversampling (NOS); 6 – относительно новый вариант минимально-фазового фильтра Low Dispersion

Периодически поднимается тема апскейлинга частоты и битности цифрового сигнала. Насколько он нужен?

Если мы говорим не о записи, а о предварительном ресемплировании на более высокую частоту, то его цель — конвертировать и отфильтровать сигнал вне пределов человеческого слуха, сместить эту спорную область повыше. Но при пересчете такого сигнала на более высокий порядок тоже нарушается фаза. Так что оценивать успех этой процедуры придется вам на слух на конкретном устройстве. Лично мне это кажется лишней нагрузкой на процессор.

Самые современные и крутые ЦАПы поддерживают DSD1024 и апскейлинг PCM до 32 бит/768 кГц. Не убивает ли звук апскейлинг входящего сигнала до максимальных значений? Есть ли смысл (реальный прирост в качестве звука) в хранении и прослушивании DSD выше, чем DSD256?

Эта поддержка абстрактна и просто показывает вычислительные возможности. В идеале эти характеристики более приближены к аналоговому звуку с бесконечно затухающим спектром и бесконечной битностью. Но на практике никто не собирается записывать звук в таких форматах.

Вся кино- и музыкальная техника, а также персонал, который ее обслуживает, вполне удовлетворены частотами дискретизации 44,1 и 48 кГц. На эти частоты настроены и плагины обработки. Редко, когда используется 96 кГц на финальной стадии микширования, но сам мультритрек зачастую опять в 44,1. Нам может не нравиться такое положение дел в звукозаписи, но это данность. Что выросло, то выросло.

Есть ли разница в том, как техника воспроизводит разные представления одного и того же цифрового сигнала. Например, контейнеры без сжатия или со сжатием (без потерь)? Меняется ли что-то в разных версиях аудиоформатов? Например, FLAC был впервые представлен в 2001 году и пересматривался с тех пор десятки раз.

Сравнивал — ничего принципиального не заметил. Я знаю, что некоторые аудиофилы предпочитают не паковать в lossless-форматы, так как якобы без сжатия техника играет более «непринужденно». Те измерения, которые я провожу, не указывают на разницу при скармливании оригинального PCM или сжатого без потерь (архивированного) файла.

И я еще не дошел до той стадии паранойи, чтобы сравнивать версии FLAC. Это просто архиватор — какая-то версия жмет эффективнее, какая-то хуже. Он не трогает целостность потока, и у аудио в принципе не такая уж плотность данных, чтобы как-то переживать о нагрузке на современные чипы. Если не ошибаюсь, с какой-то поры все изменения версий FLAC затрагивали в основном кодировку тэгов. Но, опять же, находятся отдельные слушатели, которые скажут, что без тэгов файл звучит лучше.

Какое место у формата DSD в современной индустрии и есть ли у него будущее?

Будущего в современной индустрии звукозаписи у такого формата нет, поскольку в нем невозможно редактировать материал. Остается нишевое потребление. И если кому-то нравится звук DSD, то в него можно архивировать мастер-ленты с финальным миксом, что иногда и делается. И не забывайте, что в основе многих SACD, звучание которых вам нравится, использовались обычные записи PCM-рекордеров 16 бит/44,1 кГц.

На какую характеристику стоит обратить внимание в ЦАПах при построении настольной системы?

На коммутацию между ЦАПом и вашими активными колонками. Балансное подключение приветствуется. Также приветствуется USB-драйвер от XMOS или Amanero. Он должен обеспечивать нормальное ASIO-подключение.

Цифровой аудиоформат 24/192, и почему в нем нет смысла. Часть 2 [Перевод]

Цифровой аудиоформат 24/192, и почему в нем нет смысла. Часть 2 [Перевод]

Что является одним из наиболее распространенных и глубоко укоренившихся заблуждений в мире меломанов?

Сохранить и прочитать потом —

Прим. перев.:

Это перевод второй (из четырех) частей развернутой статьи Кристофера «Монти» Монтгомери (создателя Ogg Free Software и Vorbis) о том, что, по его мнению, является одним из наиболее распространенных и глубоко укоренившихся заблуждений в мире меломанов.

Частота 192 кГц считается вредной

Музыкальные цифровые файлы с частотой 192 кГц не приносят никакой выгоды, но всё же оказывают кое-какое влияние. На практике оказывается, что их качество воспроизведения немного хуже, а во время воспроизведения возникают ультразвуковые волны.

И аудиопреобразователи, и усилители мощности подвержены влиянию искажений, а искажения, как правило, быстро нарастают на высоких и низких частотах. Если один и тот же динамик воспроизводит ультразвук наряду с частотами из слышимого диапазона, то любая нелинейная характеристика будет сдвигать часть ультразвукового диапазона в слышимый спектр в виде неупорядоченных неконтролируемых нелинейных искажений, охватывающих весь слышимый звуковой диапазон. Нелинейность в усилителе мощности приведет к такому же эффекту. Эти эффекты трудно заметить, но тесты подтвердили, что оба вида искажений можно расслышать.

График выше показывает искажения, полученные в результате интермодуляции звука частотой 30 кГц и 33 кГц в теоретическом усилителе с неизменным коэффициентом нелинейных искажений (КНИ) около 0.09%. Искажения видны на протяжении всего спектра, даже на меньших частотах.

Неслышимые ультразвуковые волны способствуют интермодуляционным искажениям в слышимом диапазоне (светло-синяя зона). Системы, не предназначенные для воспроизведения ультразвука, обычно имеют более высокие уровни искажений, около 20 кГц, дополнительно внося вклад в интермодуляцию. Расширение диапазона частот для включения в него ультразвука требует компромиссов, которые уменьшат шум и активность искажений в пределах слышимого спектра, но в любом случае ненужное воспроизведение ультразвуковой составляющей ухудшит качество воспроизведения.

Есть несколько способов избежать дополнительных искажений:

  1. Динамик, предназначенный только для воспроизведения ультразвука, усилитель и разделитель спектра сигнала, чтобы разделить и независимо воспроизводить ультразвук, который вы не можете слышать, чтобы он не влиял на другие звуки.
  2. Усилители и преобразователи, спроектированные для воспроизведения более широкого спектра частот так, чтобы ультразвук не вызывал слышимых нелинейных искажений. Из-за дополнительных затрат и сложности исполнения, дополнительный частотный диапазон будет уменьшать качество воспроизведения в слышимой части спектра.
  3. Качественно спроектированные динамики и усилители, которые совсем не воспроизводят ультразвук.
  4. Для начала можно не кодировать такой широкий диапазон частот. Вы не можете (и не должны) слышать ультразвуковые нелинейные искажения в слышимой полосе частот, если в ней нет ультразвуковой составляющей.

Все эти способы нацелены на решение одной проблемы, но только 4 способ имеет какой-то смысл.

Если вам интересны возможности вашей собственной системы, то нижеследующие сэмплы содержат: звук частотой 30 кГц и 33 кГц в формате 24/96 WAV, более длинную версию в формате FLAC, несколько мелодий и нарезку обычных песен с частотой, приведенной к 24 кГц так, что они полностью попадают в ультразвуковой диапазон от 24 кГц до 46 кГц.

Тесты для измерения нелинейных искажений:

  • Звук 30 кГц + звук 33 кГц (24 бит / 96 кГц) [5-секундный WAV] [30-секундный FLAC]
  • Мелодии 26 кГц – 48 кГц (24 бит / 96 кГц) [10-секундный WAV]
  • Мелодии 26 кГц – 96 кГц (24 бит / 192 кГц) [10-секундный WAV]
  • Нарезка из песен, приведенных к 24 кГц (24 бит / 96 кГц WAV) [10-секундный WAV] (оригинальная версия нарезки) (16 бит / 44.1 кГц WAV)

Предположим, что ваша система способна воспроизводить все форматы с частотами дискретизации 96 кГц [6]. При воспроизведении вышеуказанных файлов, вы не должны слышать ничего, ни шума, ни свиста, ни щелчков или каких других звуков. Если вы слышите что-то, то ваша система имеет нелинейную характеристику и вызывает слышимые нелинейные искажения ультразвука. Будьте осторожны при увеличении громкости, если вы попадете в зону цифрового или аналогового ограничения уровня сигнала, даже мягкого, то это может вызвать громкий интермодуляционный шум.

В целом, не факт, что нелинейные искажения от ультразвука будут слышимы на конкретной системе. Вносимые искажения могут быть как незначительны, так и довольно заметны. В любом случае, ультразвуковая составляющая никогда не является достоинством, и во множестве аудиосистем приведет к сильному снижению качества воспроизведения звука. В системах, которым она не вредит, возможность обработки ультразвука можно сохранить, а можно вместо этого пустить ресурс на улучшение качества звучания слышимого диапазона.

Недопонимание процесса дискретизации

Теория дискретизации часто непонятна без контекста обработки сигналов. И неудивительно, что большинство людей, даже гениальные доктора наук в других областях, обычно не понимают её. Также неудивительно, что множество людей даже не осознают, что понимают её неправильно.

Дискретизированные сигналы часто изображают в виде неровной лесенки, как на рисунке выше (красным цветом), которая выглядит как грубое приближение к оригинальному сигналу. Однако такое представление является математически точным, и когда происходит преобразование в аналоговый сигнал, его график становится гладким (голубая линия на рисунке).

Наиболее распространенное заблуждение заключается в том, что, якобы, дискретизация – процесс грубый и приводит к потерям информации. Дискретный сигнал часто изображается как зубчатая, угловатая ступенчатая копия оригинальной идеально гладкой волны. Если вы так считаете, то можете считать, что чем больше частота дискретизации (и чем больше бит на отсчет), тем меньше будут ступеньки и тем точнее будет приближение. Цифровой сигнал будет все больше напоминать по форме аналоговый, пока не примет его форму при частоте дискретизации, стремящейся к бесконечности.

По аналогии, множество людей, не имеющих отношения к цифровой обработке сигналов, взглянув на изображение ниже, скажут: «Фу!» Может показаться, что дискретный сигнал плохо представляет высокие частоты аналоговой волны, или, другими словами, при увеличении частоты звука, качество дискретизации падает, и частотная характеристика ухудшается или становится чувствительной к фазе входного сигнала.

Это только так выглядит. Эти убеждения неверны!

Комментарий от 04.04.2013: В качестве ответа на всю почту, касательно цифровых сигналов и ступенек, которую я получил, покажу реальное поведение цифрового сигнала на реальном оборудовании в нашем видео Digital Show & Tell, поэтому можете не верить мне на слово.

Все сигналы частотой ниже частоты Найквиста (половина частоты дискретизации) в ходе дискретизации будут захвачены идеально и полностью, и бесконечно высокая частота дискретизации для этого не нужна. Дискретизация не влияет на частотную характеристику или фазу. Аналоговый сигнал может быть восстановлен без потерь – таким же гладким и синхронным как оригинальный.

С математикой не поспоришь, но в чем же сложности? Наиболее известной является требование ограничения полосы. Сигналы с частотами выше частоты Найквиста должны быть отфильтрованы перед дискретизацией, чтобы избежать искажения из-за наложения спектров. В роли этого фильтра выступает печально известный сглаживающий фильтр. Подавление помехи дискретизации, на практике, не может пройти идеально, но современные технологии позволяют подойти к идеальному результату очень близко. А мы подошли к избыточной дискретизации.

Избыточная дискретизация

Частоты дискретизации свыше 48 кГц не имеют отношения к высокой точности воспроизведения аудио, но они необходимы для некоторых современных технологий. Избыточная дискретизация (передискретизация) – наиболее значимая из них [7].

Идея передискретизации проста и изящна. Вы можете помнить из моего видео «Цифровое мультимедиа. Пособие для начинающих гиков», что высокие частоты дискретизации обеспечивают гораздо больший разрыв между высшей частотой, которая нас волнует (20 кГц) и частотой Найквиста (половина частоты дискретизации). Это позволяет пользоваться более простыми и более надежными фильтрами сглаживания и увеличить точность воспроизведения. Это дополнительное пространство между 20 кГц и частотой Найквиста, по существу, просто амортизатор для аналогового фильтра.

На рисунке выше представлены диаграммы из видео «Цифровое мультимедиа. Пособие для начинающих гиков», иллюстрирующие ширину переходной полосы для ЦАП или АЦП при частоте 48 кГц (слева) и 96 кГц (справа).

Это только половина дела, потому что цифровые фильтры имеют меньше практических ограничений в отличие от аналоговых, и мы можем завершить сглаживание с большей точностью и эффективностью. Высокочастотный необработанный сигнал проходит сквозь цифровой сглаживающий фильтр, который не испытывает проблем с размещением переходной полосы фильтра в ограниченном пространстве. После того, как сглаживание завершено, дополнительные дискретные отрезки в амортизирующем пространстве просто откидываются. Воспроизведение передискретизированного сигнала проходит в обратном порядке.

Это означает, что сигналы с низкой частотой дискретизации (44.1 кГц или 48 кГц) могут обладать такой же точностью воспроизведения, гладкостью АЧХ и низким уровнем наложений, как сигналы с частотой дискретизации 192 кГц или выше, но при этом не будет проявляться ни один из их недостатков (ультразвуковые волны, вызывающие интермодуляционные искажения, увеличенный размер файлов). Почти все современные ЦАП и АЦП производят избыточную дискретизацию на очень высоких скоростях, и мало кто об этом знает, потому что это происходит автоматически внутри устройства.

ЦАП и АЦП не всегда умели передискретизировать. Тридцать лет назад некоторые звукозаписывающие консоли использовали для звукозаписи высокие частоты дискретизации, используя только аналоговые фильтры. Этот высокочастотный сигнал потом использовался для создания мастер-дисков. Цифровое сглаживание и децимация (повторная дискретизация с более низкой частотой для CD и DAT) происходили на последнем этапе создания записи. Это могло стать одной из ранних причин, почему частоты дискретизации 96 кГц и 192 кГц стали ассоциироваться с производством профессиональных звукозаписей.

16 бит против 24 бит

Хорошо, теперь мы знаем, что сохранять музыку в формате 192 кГц не имеет смысла. Тема закрыта. Но что насчет 16-битного и 24-битного аудио? Что же лучше?

16-битное аудио с импульсно-кодовой модуляцией действительно не полностью покрывает теоретический динамический звуковой диапазон, который способен слышать человек в идеальных условиях. Также есть (и будут всегда) причины использовать больше 16 бит для записи аудио.

Ни одна из этих причин не имеет отношения к воспроизведению звука – в этой ситуации 24-битное аудио настолько же бесполезно, как и дискретизация на 192 кГц. Хорошей новостью является тот факт, что использование 24-битного квантования не вредит качеству звучания, а просто не делает его хуже и занимает лишнее место.

Примечания к Части 2

Многие из систем, которые неспособны воспроизводить сэмплы 96 кГц, не будут отказываться их воспроизводить, а будут незаметно субдискретизировать их до частоты 48 кГц. В этом случае звук не будет воспроизводиться совсем, и на записи ничего не будет, вне зависимости от степени нелинейности системы.

Передискретизация – не единственный способ работы с высокими частотами дискретизации в обработке сигналов. Есть несколько теоретических способов получить ограниченный по полосе звук с высокой частотой дискретизации и избежать децимации, даже если позже он будет субдискретизирован для записи на диски. Пока неясно, используются ли такие способы на практике, поскольку разработки большинства профессиональных установок держатся в секрете.

Неважно, исторически так сложилось или нет, но многие специалисты сегодня используют высокие разрешения, потому что ошибочно полагают, что звук с сохраненным содержимым за пределами 20 кГц звучит лучше. Прямо как потребители.

Эту статью прочитали 86 201 раз

Статья входит в разделы:

Интересное о звуке

Посмотрим что у нас с форматами высокого разрешения, начнем с Flac:

Flac 96000 Hz 24 bit

  • 24000 Hz 4p(2b) -12дБ
  • 12000 Hz 8p(3b) -18дБ
  • 6000 Hz 16p(4b) -24дБ
  • 3000 Hz 32p(5b) -30дБ
  • 20 Hz 4800p(13b) -78дБ

Flac 192000 Hz 24 bit

  • 24000 Hz 8p(3b) -18дБ
  • 12000 Hz 16p(4b) -24дБ
  • 6000 Hz 32p(5b) -30дБ
  • 3000 Hz 64p(6b) -36дБ
  • 20 Hz 9600p(14b) -84дБ

Видно, что с увеличением частоты качество становится лучше, но не на много.

Дополнительно рассмотрим пару форматов WAVE, с ультравысокой частотой дискретизации

WAVE 384000 Hz 32 bit

  • 24000 Hz 16p(4b) -24дБ
  • 12000 Hz 32p(5b) -30дБ
  • 6000 Hz 64p(6b) -36дБ
  • 3000 Hz 128p(7b) -42дБ
  • 20 Hz 19200p(15b) -90дБ

WAVE 768000 Hz 32 bit

  • 24000 Hz 32p(5b) -30дБ
  • 12000 Hz 64p(6b) -36дБ
  • 6000 Hz 128p(7b) -42дБ
  • 3000 Hz 256p(8b) -48дБ
  • 20 Hz 38400p(16b) -96дБ

Результаты уже значительно лучше, но все еще не идеальные =) Понятно что форматы с сверхвысокой частотой еще недоступны практически ни кому.

Похожие статьи