суббота, 17 ноября 2012 г.

Hi-Fi звук на базе ПК. Часть 1.

В рамках данной статьи мы рассмотрим вариант сборки аудиотракта с источником в виде ПК в ценовой категории от $300 за компонент. Думаю - это самый востребованный сегмент. Начало большого пути в дебри. Сама аббревиатура Hi-Fi означает High Fidelity, что в переводе с английского означает «высокая точность».
 
В классическом варианте в качестве источника звука в высококачественном тракте используется виниловый проигрыватель или же стационарный CD-плеер. Здесь мы попробуем разобраться, в какой степени их способен заменить обычный ПК.

Здесь сразу отметим – слушать MP3 на колонках и усилителе немалой стоимости смысла нет. Проигрывать CD-аудио диски на обычном компьютерном приводе также не следует. Наиболее подходящий вариант с моей точки зрения – это сжатый звук без потери качества (Lossless). Теперь обо всем по порядку.


Начнем с проблем, с которыми меломан обязательно столкнется при создании высококачественного звукового тракта на базе ПК. В первую очередь стоит позаботиться о максимальном снижении шумности работы ПК. Варианты тут различные – от замены кулеров на более качественные и эффективные до сборки отдельного маломощного и практически бесшумного мультимедийного центра исключительно для «музыкальных» нужд. Вопросам бесшумного охлаждения, а также различным аспектам подборки оптимальной конфигурации домашнего компьютера посветим отдельные статьи.


Далее следует обратить внимание на качество блока питания. Даже самая лучшая в мире звуковая карта не сможет раскрыть свой потенциал, если она питается  от низкокачественного БП. В целом, именно импульсные помехи по питанию, которые типичны для ПК, и побуждают скептиков отрицательно относиться к компьютеру, как источнику высококачественного звука. Посему качеству питания следует уделить первостепенное внимание.


В погоне за качественным звучанием музыки весьма популярной ошибкой является покупка типично «геймерской» звуковой карты, например, такой, как Creative Audigy 2/4. Основным недостатком таких устройств является частота центрального аудиопроцессора (ЦАП) 48 кГц, в то время как стандарт CD-аудио устанавливает частоту 44.1 кГц. Таким образом, если звуковой сигнал прослушивается через ЦАП, работающий на частоте 48 кГц, происходит передискретизация. Именно она и вносит в звучание искажения. Кроме того, типичные «геймерские» звуковые карты с поддержкой ЕАХ и т.п. комплектуются аналоговой частью из далеко не самых лучших деталей (в основном операционных усилителей).
Поскольку в самом ПК именно звуковая карта наиболее важна с точки зрения меломана, то на выборе оной мы и остановимся подробнее.

  • Creative Audigy 2 (6.1) существенно отличается от своего младшего собрата. Здесь была введена поддержка EAX3 (а впоследствии и EAX4), заявлена поддержка режимов воспроизведения 192kHz/24bit. В силу применения в аналоговой части компонентов сравнительно высокого качества звучание Creative Audigy 2 можно охарактеризовать как приемлемое.
  • Creative Audigy 2 ZS представляет собой обновленную версию Audigy2. Появилась поддержка EAX4 (также была введена и в Audigy2). Качество звучания улучшилось. Из приятных мелочей стоит отметить появление консоли управления, эквалайзера и THX-калибровки. THX-калибровка позволяет указать расстояние и угол поворота каждой колонки относительно рабочего места.
  •  Creative Audigy 4 Pro является улучшенной модификацией Audigy 2ZS. Игровые возможности – те же. Благодаря применению элементов, которые используются в профессиональной линейке звуковых карт от Creative, было достигнуто не сильно значительное улучшение звучания.
  • Creative X-Fi Elite Pro позиционируется как топовая звуковая карта в линейке. На борту также установлены 64 Мб памяти. Игровые возможности не отличаются от X-Fi Fatality. В плане качества звучания отметим, что это бесспорно лидер среди карт Creative. Однако несколько завышенная цена не позволяет нам однозначно рекомендовать приобрести именно этот вариант.
  • Terratec Aureon Space 7.1 (M-Audio Revolution 7.1) является одной из самых дешевых звуковых карт на чипе VIA ENVY24-HT. Качество звучания хорошее. Стоит отметить один не очень серьезный недостаток – это скудные возможности драйверов. 
  • Audiotrak ProDigy 7.1 похожа на две предыдущие звуковые карты. Если быть совсем точным, эти карты являются практически близнецами. Но стоит отметить, что качество воспроизведения музыки на ProDigy все же выше, чем на Space/Revolution. Разница не велика, но слышна.
  • M-Audio Revolution 5.1 является обновленной версией старой Revolution 7.1. При производстве это карты были использованы более качественные элементы и более новый ЦАП. Естественно, что качество звучания возросло. На данных момент это, наверное, самая качественная в плане воспроизведения музыки звуковая карта, выполненная на чипе Envy24-HT. Также стоит отметить, что в этом устройстве были убраны два никому не нужных дополнительных канала и вместо них появился специальный выход для наушников.  
 Следующие звуковые карты к рассмотрению, так называемые профи. Они ориентированы в первую очередь для студийной работы: записи звукового материала, работы в редакторах, воспроизведения сведенного материала на высококачественных мониторах, – поэтому не стоит удивляться отсутствию каких-либо элементарных функций, которые есть даже на встроенном звуке. Однако в силу высокого качества звучания полупроф-карточки все чаще можно встретить в домашнем ПК. Но здесь имеются ограничения: звуковые карты данной категории смогут раскрыть все свои достоинства только на очень качественной аппаратуре. Давай рассмотрим наиболее популярные на нашем рынке полупрофессиональные карты.

  • E-MU 0404 является самой младшей звуковой картой в профессиональной звуковой линейке производства Creative. Она оснащена неплохой элементной базой. Звучание можно оценить как очень хорошее.
  • E-MU 1820 является расширенной версией 0404 с дополнительным коммутационным блоком управления. Качество звучание идентично предыдущему устройству.
  • E-MU 1212m имеет практически лучшее звучание в категории полупрофессиональных решений, благодаря чему эта звуковая карта приобрела заслуженную любовь как у профессионалов, так и просто у любителей качественного звука.  
  •  ESI Juli@ – это профессиональная звуковая карта уровня Home Studio. Построена она на базе чипа ENVY24. Карта предназначена в первую очередь для записи звука, но также очень хорошо подходит и для воспроизведения оного. Имеет балансные TRS и небалансные RCA разъемы (одновременное использование и тех, и других – невозможно). Качество звучания очень хорошее. Если сравнить с решениями от Creative, то это устройство по воспроизведению звука находится где-то на уровне E-MU 0404. ESI Juli@ имеет очень удобную и понятную панель управления.
 Подводя итог по полупрофессиональным картам, хотелось бы подчеркнуть, что здесь были описаны далеко не все модели данного сегмента, а только те, которые наиболее распространены на рынке. Их отличительная особенность – очень качественное звучание за сравнительно невысокую (по отношению к стационарным проигрывателям компакт-дисков класса Hi-Fi) стоимость.

Продвинутый аудио-плейер для платформы Windows

Рекомендую Вам попробовать Foobar2000 Media Player. Этот плейер разработан Peter Pawlowski, который ранее участвовал в создании Winamp.

Foobar2000 представляет собой довольно мощный аудио плеер, который по своим возможностям может сравниться, даже, с такими программами, как WinAmp или AIMP. Этот программный продукт способен воспроизводить, практически, все известные на сегодняшний день форматы аудио, позволяет подключать множество дополнительных модулей обработки звука и обладает весьма широкой функциональностью.

Основные возможности программы Foobar2000

Самым необычным, что сразу же бросается в глаза, является то, что программа может использоваться в двух основных вариантах: стационарная установка и портативная версия. С портативной версией, наверное, все понятно. Она просто не требует установки и может запускаться с любого съемного носителя, что весьма удобно для использования ее на сторонних компьютерах. В свою очередь, стационарная установка может производиться в стандартной версии и версии, которая включает в себя множество дополнительных плагинов. Дистрибутив стандартной версии имеет размер чуть более 3 МБ, а версия с дополнительными модулями занимает около 16,5 МБ. Скачать можно  с сайта www.foobar2000.org.

Среди самых основных особенностей программы стоит отметить то, что она абсолютно не требовательна к системным ресурсам и не нагружает систему. Естественно, это огромный плюс, поскольку, можно, к примеру, играть на компьютере в игры, а попутно, в фоновом режиме, слушать музыку.

Поддерживаемые форматы аудио представлены довольно разнообразно. Сюда относятся MP3, MP4, AAC, CD Audio, WMA, Vorbis, FLAC, WavPack, WAV, AIFF, Musepack, Speex, AU, SND. Совершенно без усилий, при условии установки дополнительных средств, расширяющих возможности приложения, можно работать с архивами, производить рипинг любых аудио дисков, а также полностью перенастраивать назначения горячих клавиш для удобства управления проигрывателем.

И, естественно, плеер поддерживает работу с совершенно различными плейлистами. Кстати, в отличие от старого формата, в нем реализован новый формат плейлистов M3U8. Также, программа позволяет использовать и некоторые расширенные возможности, а именно, плавное проигрывание, полную поддержка Unicode, легко настраиваемый интерфейс, поддержку тэгов APEv2, поддержку функции ReplayGain. Плюс ко всему, приложение имеет открытую архитектуру с возможностью расширения функционала сторонними разработчиками, а также позволяет производить доступную прямо из меню справки онлайн диагностику. Кроме того, в этом релизе была добавлена возможность работы с тэгами для аудио файлов формата WAV (даже с 16-битной структурой).

В общем и целом, плеер довольно прост в использовании и управлении, тем более, что имеет весьма широкие возможности, распространяется совершенно бесплатно, а главное, не требует использования мощных компьютеров, что, конечно же, делает честь этому программному продукту.

Сжатие звуковых файлов без потерь. ALAC и другие форматы.

Кодек сжатия аудиоданных без потерь ALAC (Apple Lossless Audio Codec), другое название ALE (Apple Lossless Encoder) разработан компанией Apple. Формат был представлен в 2004 году.
По эффективности сжатия ALAC находится на обычном для Lossless-кодеков уровне 40-60%. Файлы этого формата упакованы в стандартный MP4-контейнер и имеют расширение .m4a. Эти файлы, в основном, предназначены для MP3-плееров iPod от Apple, причем, их умеют проигрывать не все плееры.

Формат не поддерживает DRM, однако защита содержимого файлов от несанкционированного использования реализована на уровне контейнера.

 Для кодирования файлов в формат ALAC предлагаю использовать вам утилиту dBpoweramp

 Meridian Lossless Packing - MLP то же самое, Dolby TrueHD, DVD-Audio, HD DVD, Blu-ray. В DVD Video отсутствует! DVD-Audio в структуре диска содержит директорию AUDIO_TS, в которой содержится мультимедиа-контейнер DVD Audio Object Files (расширение .aob), где и содержится MLP-поток (.mlp)

 DTS (DTS Surround Sound) - формат звука, созданный Digital Theater System, конкурирующий со схожим Dolby Digital. Формат DTS использует меньший уровень сжатия, чем Dolby, так что теоретически он звучит лучше. Формат DTS Stereo практически идентичен Dolby Surround. DTS поддерживает как 5.1-канальный, так и 7.1-канальный варианты звука. DTS в домашних театрах допускает полный битрейт (1509,75 кбит/с). Здесь нужно быть внимательным, кодек DTS сжимает звук без потерь только в настроках DTS-HD Master Audio или по старому DTS++! Все остальные форматы с красивыми названиями DTS-HD High Resolution Audio, DTS Digital Surround 96/24 (DTS 96/24) НЕ являются беспотерьными, а значит априори качество звука теряется на стадии кодирования!

 RealAudio Lossless - впервые представленный в составе пакета RealAudio 10 проприетарный кодек для сжатия звука без потери качества. Среди плюсов данного кодека - поддержка потокового вещания, очень быстрое декодирование. К минусам относят закрытость кода и отсутствие многоканальности. Доступен для Microsoft Windows, Macintosh и GNU/Linux.
Используемые расширения файлов - .ra, .ral.

 ТАК (нем. Tom’s verlustfreier Audio Kompressor) - аудио-кодек и формат сжатия цифрового звука без потерь. Отличается высокой степенью сжатия и скоростью кодирования и декодирования. Распространяется бесплатно вместе c набором программного обеспечения для кодирования и воспроизведения, а также плагинами к популярным плеерам. В поддержке на уровне железа замечен пока не был, но кодек активно развивается. Настройки по умолчанию являются разумным компромисом: takc -e. Используемые расширения файлов - .tk, .tak.

 True Audio (TTA) - свободный аудио-кодек, осуществляющий сжатие обеспечивает сжатие мультиканальных 8-, 16- и 24-битных аудиофайлов без потерь, способен работать в режиме реального времени. Бесплатный и открытый исходный код и документация, есть аппаратная поддержка медиа-боксами. По настройкам сказать ничего не могу, не использовал.
Используемые расширения файлов - .ta, .tta.

 Lossless Audio (LA) - беспотерьный аудио-кодек от Майкла Бевина. По степени сжатия превосходит все существующие лосслесс кодеки (только кодеки, некоторые аудио-архиваторы жмут лучше). Скорость кодирования/декодирования низкая. Аппаратная поддержка - никакая как в принципе и программная. Используемые расширения файлов - .la.

 OptimFROG имеет один из лучших показателей сжатия аудио. Реализован на платформах Windows, Linux, Mac, использует технологию аудио сжатия: концепцию декорелляции стерео (совместно с оптимальным предсказателем). Благодаря этому нововведению, эта технология позволила достичь значительного улучшения (~1.5%) сжатия по сравнению с существующими показателями аудио кодеров без потерь. Но несмотря на все "фичи", распространения не получил. Используемые расширения файлов - .ofr, .ofs.

Сжатие звуковых файлов без потерь. WavPack и Monkey’s Audio.

Бесплатно распространяемый кодек для сжатия аудиоинформации без потерь WavPack был разработан Дэвидом Бриантом (David Bryant) в 1998 году. Файлы, обработанные этим кодеком, имеют расширение .wv, эффективность сжатия колеблется от 30 до 70%. WavPack поддерживает множество форматов аудио, в том числе – многоканальный звук.
   Особенность формата заключается в том, что кодек имеет гибридный режим работы. В таком режиме вместо одного файла, содержащего информацию о музыкальной композиции в цифровом виде, создаются два файла – один – файл, содержащий композицию, сжатую с потерями качества (этот файл имеет расширение .wv), а второй – так называемый коррекционный файл (с расширением .wvc). Используя первый файл, музыку можно прослушать, однако, с потерями в качестве, а используя оба файла – восстановить музыкальный файл в исходном виде, то есть – без потери качества. Таким образом, можно использовать один и тот же кодек и для хранения звука в сжатом с потерями виде, и для хранения аудиоматериала исходного качества.
 
WavPack отличает достаточно высокая скорость кодирования файлов, существует множество программных проигрывателей этого формата, однако, что касается портативных проигрывателей, там он пока представлен довольно слабо. В частности, из достаточно известных и распространенных плееров, поддерживающих его, можно назвать устройства (плееры Apple, iRiver), которые можно прошить уже не раз упоминаемой RockBox.

 Для кодирования WavPack-файлов скачайте WavPack Win32 – утилиту командной строки для кодирования с сайта http://wavpack.com/downloads.html/. Скачиваемый архив имеет небольшой размер – 327 Кб. Для удобства работы можете сразу же скачать архив Frontend-программы с сайта http://members.home.nl/w.speek/wavpack.htm/ - он занимает всего 24 Кб.

 Распакуйте оба архива в одну папку и запустите файл WavPack frontend.exe.

 Формат Monkey’s Audio еще называют форматом APE – по расширению файла, которое он использует Этот формат сжимает данные без потери качества. Среди его особенностей производители отмечают эффективность (которая сопоставима с другими кодеками сжатия без потерь), скорость работы, достаточно широкую программную поддержку (например, его поддерживает программный проигрыватель WinAmp), простоту использования, бесплатность, поддержку тегов, доступность исходных кодов.

Официальная версия кодека выпущена для платформы Windows, однако существуют ее порты на другие платформы. Подробности о формате можно узнать на
http://www.monkeysaudio.com/.  Для кодирования Monkey’s Audio создана специальная программа, которую можно бесплатно скачать на http://www.monkeysaudio.com/download.html/. Работа с программой предельно проста. Надо добавить файлы в ее окно, воспользовавшись кнопками Add Files (Добавить файлы) или Add Folder (Добавить папку), после чего настроить параметры кодека – с помощью кнопки настройки (вторая слева на панели инструментов). По умолчанию это – Normal (Нормальный), для лучшего уровня сжатия можно установить параметр Insane (Наилучший), для повышения скорости работы кодера за счет уровня сжатия можно установить параметр Fast (Быстрый). После этого достаточно нажать на кнопку Compress (Сжать) – и программа начнет работу. Если кликнуть по черному треугольнику рядом с кнопкой Compress – откроется список действий, среди которых можно отметить параметр Decompress (Разжать) – кодек декодирует APE-файл в WAV-файл, и Convert (Конвертировать) – используйте этот режим работы если вы хотите, например, "пережать" Monkey’s Audio файлы, сжатые в режиме Fast, в режиме Insane.  Среди другого ПО для кодирования Monkey’s Audio можно отметить ImTOO Audio Encoder. Среди доступных в этой программе настроек кодека можно отметить лишь уровень сжатия, количество каналов файла и наличие APE-тегов.

Сжатие звуковых файлов без потерь. FLAC.

Кодеки, сжимающие звук без потерь, стали пользоваться популярностью в мире портативного аудио сравнительно недавно. Дело в том, что этим кодекам не под силу такие огромные степени сжатия, которыми могут похвастаться кодеки, сжимающие звук с потерями качества. Большие объемы памяти стали широко доступны пользователям современных плееров лишь последние года три-четыре – и с приходом больших объемов памяти в плееры, сжатие музыки без потерь стало популярным. Конечно, те, кто хотел слушать музыку без потерь качества, делали это всегда (например, с помощью Audio CD-проигрывателей), а в наше время все желающие (естественно, при наличии поддержки соответствующих кодеков их плеерами) могут попробовать Lossless-кодеки в действии.

Главное отличие кодеков, сжимающих аудиоданные без потери качества от кодеков, сжимающих с потерями, заключается в том, что кодеки без потери качества не удаляют из аудиопотока информацию, которая при сжатии с потерями может считаться избыточной. Главная задача Lossless-кодека заключается в том, чтобы как можно сильнее сжать исходную звуковую информацию, не потеряв при этом ни единого бита информации.

Ситуация с поддержкой Lossless-кодеков в настоящее время такова, что наиболее широко распространена поддержка кодека ALAC, который имеет непосредственное отношение к фирме Apple и ее плеерам. Остальные же кодеки поддерживаются пока немногими плеерами, иногда для того, чтобы плеер поддерживал кодек, требуется перепрошивка плеера, причем, пожалуй, наиболее известная прошивка для плееров, поддерживающая Lossless-кодеки, RockBox – это альтернативная, а никак не официальная прошивка.

В ходе работы с Lossless-кодеками вам могут встретиться так называемые Cue-файлы или индексные карты файлов. Cue-файлы распространяются, например, вместе с FLAC или APE-файлами, реже – с MP3 и WAV-файлами, которые представляют собой один большой (порядка 300 Мб) файл, в котором хранится целый альбом. Cue-файл – содержит в себе информацию о разбиении большого файла на треки и о названиях этих треков. С отдельными файлами работать удобнее, однако, даже если к вам в руки попадет, скажем, большой FLAC-файл с CUE-файлом, на основе информации, содержащейся в CUE-файле, исходный файл можно разделить на отдельные треки.
 
Начнем описание форматов сжатия данных без потерь с популярного формата FLAC.
 
FLAC (Free Lossless Audio Codec) – это формат сжатия аудиоданных без потерь, который разработала Xiph.Org Foundation. Это абсолютно бесплатный формат, которым могут пользоваться все желающие. Что немаловажно для большинства любителей музыки. Многие начали переводить домашние музыкальные коллекции в этот формат, для хранения на своих музыкальных серверах. об этом мы еще поговорим, позже....

Работа FLAC и других кодеков, сохраняющих аудиоданные без потерь, напоминает работу обычных архиваторов. Однако, за счет специальных алгоритмов эффективность таких кодеков при сжатии аудиоинформации гораздо выше, чем у обычных архиваторов. Формат FLAC разрабатывался как поточный – информация во FLAC-файле разбита на фреймы (кадры), каждый из которых может быть раскодирован отдельно от других фреймов.

Как правило, FLAC способен сжать исходный файл, например, Audio CD-качества на 40-50%. В итоге битрейт полученной записи оказывается равным порядка 800 Кбит/c. В формате FLAC предусмотрена возможность сохранения CD-дисков таким образом, что при необходимости можно полностью воссоздать исходный диск – это очень удобно для тех, кто хочет создать цифровые копии своих CD с возможностью последующего восстановления.

Скорость кодирования и декодирования FLAC-файлов неодинакова. Скорость кодирования зависит от уровня сжатия и от скорости системы – на высоких уровнях сжатия она может быть достаточно медленной. Однако раскодирование ведется очень быстро – с ним без труда могут справиться современные портативные плееры и медиапроигрыватели.

За счет возможности бесплатного свободного использования, с FLAC можно работать на базе практически любой современной ОС, все больше портативных плееров поддерживают этот формат.

Кодирование в формат FLAC

Скачать утилиту для кодирования FLAC-файлов можно на http://flac.sourceforge.net/download.html/. Она включает в себя сам кодек и так называемый Frontend – программную оболочку для кодека. Размер дистрибутива занимает порядка 2,5-3 Мб. Работа с кодеком проста: вы добавляете интересующие вас файлы в окно программы с помощью кнопки Add Files (Добавить файлы), настраиваете опции кодирования и нажимаете кнопку Encode (Кодировать) – программа создает FLAC-файл.

Музыкальные файлы.

Направление развития звукозаписывающей индустрии ясно – на смену распространению музыки на физических носителях приходит загрузка ее из Интернета.

Однако, музыка, выложенная в Интернете, представлена в основном в форматах со сжатием – MP3, WMA и некоторых других. Сколь бы ни был высоким битрейт, все равно настоящие аудиофилы не будут довольными. Однако, существуют технологии, которые позволяют распространять музыку через Интернет без потери качества.

Простейший способ передавать музыку через Интернет с высоким качеством – скопировать информацию, записанную на CD «один-в-один». Если все биты при копировании сохраняются, то загруженная из глобальной компьютерной сети музыка будет воспроизведена без искажений.

Проблема заключается в том, что формат записи на аудио CD не тождественен принятому формату записи для компьютерных дисков. И файловая система на диске как таковая отсутствует. Так что сначала нужно сделать из диска файл или несколько файлов, которые уже можно будет выставить на сервер для скачивания.

Простейший способ заключается в создании так называемых рипов. На компьютере считывается информация с аудио CD и на основании нее формируются так называемые волновые файлы (с расширением *.wav). Как правило, на каждый трек диска делают отдельный WAV-файл. Потом эти файлы могут быть выставлены для скачивания. Преимущество такого подхода заключается в том, что формат WAV-файлов стандартизован и их можно воспроизвести практически на любом компьютере без установки дополнительного программного обеспечения. К тому же, файлы можно воспроизводить с жесткого диска компьютера.

Более сложный вариант подразумевает создание так называемого образа диска - файла, в котором записана информация о расположении битов на диске. Скачав образ диска, можно с помощью одной из программ записи на CD-R получить его полную копию. В итоге получится аудио CD, который можно воспроизводить как на компьютере, так и на любой аппаратуре, способной воспроизводить CD-R. То есть, практически на любой современной аудиоаппаратуре. Но на компьютере непосредственно с образа CD, хранящегося на жестком диске, без использования специального программного обеспечения воспроизвести музыку нельзя.

Формат для образов дисков обычно привязан к программе, с помощью которой потом можно записать диск. Самым популярным форматом для образов является *.nrg, используемый программой для записи дисков Nero.

Оба варианта подразумевают передачу музыки без какого-либо сжатия. Даже при современных широкополосных каналах связи процесс загрузки WAV-файлов или образов дисков происходит слишком медленно. Другой проблемой является отсутствия защиты от нелегального копирования файлов. Поэтому продажа музыки таким способом легальными продавцами, за редким исключением, не практикуется. Хотя распространение музыки в виде образов дисков широко используется пиратами.

Кроме этого, изготовление рипов или образов с дисков привязывает качество передаваемой музыки к качеству записи на CD. Однако, сам по себе формат CD является уже устаревшим. Нужны форматы, позволяющие распространять музыку с большей разрядностью кодирования и большей частотой дискретизации.

 Сжатие без потерь

Способы сжатия музыкальных записей можно условно разделить на две категории. При сжатии с потерями (например, в формате MP3) из сигнала удаляются мелкие детали, потерю которых большинство слушателей не заметят. Сжатие без потерь можно сравнить с работой программы-архиватора. Файл, сжатый без потерь, при распаковке восстанавливается полностью. Только, в отличие от универсальных архиваторов, используются алгоритмы, учитывающие особенности музыкальных записей. Форматы сжатия без потерь иногда называются lossless-форматами (lossless – по-английски «без потерь»).

По размеру файл, полученный сжатием без потерь, больше файла, сжатого с потерями, но значительно меньше исходной записи. Кроме этого, в некоторые форматы сжатия без потерь добавлена функциональность, защищающая их от пиратского копирования. Размер файла зависит от свойств музыкального произведения. В среднем файл lossless-формата в 1,5 - 3 раза меньше WAV-файла с той же записью.

В настоящее время наиболее распространены следующие lossless-форматы:

  • FLAC - формат для обмена музыкой, поддерживается практически на всех компьютерных платформах. Разрядность 16 бит, частота дискретизации – до 96 кГц. Не имеет средств защиты от копирования. Поддерживается не только компьютерами, но и некоторыми моделями аудиоаппаратуры.
  • Apple Lossless – фирменный стандарт Apple. В нем заложена возможность защиты от пиратского копирования, но пока на практике она не используется. Основное преимущество – совместимость с программным и аппаратным обеспечением, а также сервисами Apple.
  • APE – один из самых популярных lossless-форматов для обмена музыкальными записями через Интернет. В коммерческих целях не используется. Поддержка реализована пока только в компьютерных программах.
  • Lossless WMA – вариант формата WMA без сжатия. Главное преимущество формата – за ним стоит Microsoft. В этом формате уже сейчас легально продается музыка через Интернет. Поддерживается широким кругом производителей аппаратуры. Ну и, наконец, можно записывать 5.1-канальную музыку с разрядностью до 24 бит и частотой дискретизации до 96 кГц.
  • Monkey’s Audio – Lossless-формат, используемый только на компьютерах. По утверждению разработчиков, позволяет получать более компактные файлы по сравнению с другими lossless-форматами. Однако, небольшой выигрыш в размере файла вряд ли может быть серьезным аргументом, если учесть, что за это придется заплатить проблемами, обусловленными малой распространенностью формата.
  • WavPack – формат, имеющие варианты как сжатия с потерями, так и lossless. Отличительная особенность – возможность записи звука с разрядностью до 32 бит. Кроме этого, можно записывать пространственное звучание 5.1. Поддержка lossless-варианта WavPack реализована в новых версиях архиватора WinZip. Пока используется только на компьютерах.
Во времена, когда скорость доступа в Интернет была низкой, формат MP3 и ему подобные, совершили настоящую революцию, изменившую музыкальную индустрию. Сейчас же, с повышением скорости доступа, наступает время lossless-форматов. И если раньше музыкальные записи, загруженные из Интернета, не могли соперничать с CD по качеству звука, то сейчас они иногда даже превосходят его по качеству.

Восприятие и сжатие звука.

Статья Дмитрий Шмунк (dmitrijs@qdesign.com)
  
Простые методы сжатия

Традиционные методы сжатия без потерь (Huffman, LZW, итд.) обычно плохо применимы для сжатия аудио информации (по тем же причинам что и при сжатии визуальной информации).
Ниже перечислены некоторые методы сжатия с потерями:
  • Сжатие тишины(пауз) - определяет периоды "тишины", работает аналогично run-length кодированию.
  • ADPCM - Adaptive Differential Pulse Code Modulation (в русскоязычной литературе применяется термин адаптивная дельта-импульсно-кодовая модуляция (АДИКМ).
    Например, стандарт CCITT G.721 -- от 16 до 32 Kbits/sec:
    Кодирование разницы между двумя или более последовательными отсчетами; затем разница квантуется --> при квантовании часть информации теряется. Квантование адаптивно (меняет параметры в зависимости от сигнала), в результате меньшее количество бит необходимо для достижения лучшего SNR. Необходимо предсказывать как звук изменится --> сложно
  • Apple разработал собстенную систему названную ACE/MACE. Сжатие с потерями, пытается предсказать, каково будет значение следующего отсчета. Сжатие порядка 2:1.
  • Linear Predictive Coding (LPC) - пытается описать сигнал с помощью "речевой модели" и передает параметры модели --> звучит как компьютерно синтезированная речь, 2.4 kbits/sec.
  • Code Excited Linear Predictor (CELP) - тоже самое что и LPC, однако дополнительно передает ошибку квантования (используя предопределенный набор "кодовых слов") --> телефонное качество при 4.8 kbits/sec.

Методы сжатия, основанные на психоакустике

Представители: MPEG layers 2, MPEG layer 3 (MP3), AAC (Advanced audio coding), TwinVQ, Ogg Vorbis, и др.
Алгоритм кодека использующего психоакустику обычно состоит из следующих шагов:
  • Обсчет психоакустической модели (маскирования).
  • Разделение сигнала на частотные подполосы (FFT, DCT/MDCT, FilterBanks, и т.д.).
  • Квантование сигнала в подполосах в соответствии с результатами психоакустической модели. Возможно использование одного квантового уровня. сразу для нескольких входных значений (векторное квантование - Vector Quantization) - TwinVQ.

Некоторые факты о восприятии звука

  • Частотный спектр воспринимаемый человеком (примерно) от 20 Hz до 20 kHz, наибольшая чувствительность в диапазоне от 2 до 4 KHz.
  • Динамический диапазон (от самых тихих воспринимаемых звуков до самых громких) около 96 dB (более чем 1 к 30000 по линейной шкале).
  • Общеизвестно, что человек в состоянии различить изменение частоты на 0.3% на частоте порядка 1kHz.
  • Если два сигнала различаются менее чем на 1дб по амплитуде - они трудноразличимы. Разрешение по амплитуде зависит от частоты и наибольшая чувствительность наблюдается в диапазоне от 2 до 4 KHz.
  • Пространственное разрешение (способность к локализации источника звука) - до 1 градуса.
  • Звуки различной частоты распространяются в воздухе с разной скоростью. В результате высокочастотная часть спектра от источника находящегося на удалении от слушателя несколько запаздывает.
  • Человек не в состоянии заметить внезапное исчезновение высоких частот, если оно не превышает порядка 2ms.
  • Некоторые исследования показывают, что человек в состоянии ощущать частоты выше 20kHz. С возрастом частотный диапазон сужается.
Речь
  • Частотный спектр, несущий информацию в человеческой речи: от 500 Hz до 2 kHz
    Низкие частоты - басы и гласные
    Высокие частоты - согласные
  • Лучшее сжатие речи достигается с использованием параметрических кодеров (LPC, CELP, и пр.), пытающихся представить речь как набор параметров некоторой речевой модели. Кодеки общего назначения (MPEG и др.), как правило, дают худшее сжатие.

Устройство уха

В общем случае ухо - нелинейная система и не может быть точно описано с помощью только линейных элементов (таких как фильтры и линии задержки). Как побочный результат нелинейности может проявляться, например, следующий эффект: при подаче двух тонов с частотой 1000 и 1200Hz может также быть слышен третий тон с частотой 800Hz. Однако в интересующем нас диапазоне амплитуд нелинейность достаточно слаба и ей обычно пренебрегают.

Строение

Ухо состоит из трех частей: ушной раковины (также называемой внешним ухом), среднего уха и внутреннего уха - улитки. Проходя через различные части уха звук претерпевает изменения.
  • Одна из функций внешнего уха (ушной раковины) - улучшение локализации источника звука в пространстве. Благодаря ее несимметричной форме АЧХ сигналов приходящих из разных точек пространства изменяется по разному. Ушная раковина может влиять лишь на сигналы с длинной волны, сопоставимой с размерами уха (>3kHz). Внешний ушной канал резонирует на частоте около 2kHz , что дает повышенную чувствительность в данном диапазоне.
  • Среднее ухо выполняет роль гидравлического усилителя. Так как в улитке находится жидкость а снаружи - воздух, то необходимо согласование сопротивления среды. Среднее ухо также защищает от низкочастотных звуков чрезмерной амплитуды.
  • Внутреннее ухо - улитка. В развернутом виде будет представлять из себя трубочку, с постепенно уменьшающимся к одному из концов диаметром. Улитка выполняет роль частотного анализатора. Внутри улитки находятся до 4000 нервных окончаний. Различные области улитки входят в резонанс при подаче сигнала определенной частоты.
Восприятие в зависимости от частоты
  • Так как нейрон может возбуждаться не чаще чем 500 раз в секунду, то для получения информации о более высоких частотах слуховой аппарат человека прибегает к некоторым "ухищрениям":
    На частотах до 500 Hz --> колебания непосредственно переходят в нервные импульсы.
    Примерно до 1.5кГц проблема решается подключением одновременно до 3 нейронов к одному нервному окончанию. Нейроны в данном случае возбуждаются последовательно, один за другим и, соответственно, помогают улучшить частотное разрешение в 3 раза.
    На более высоких частотах регистрируется лишь амплитуда сигнала.
  • Таким образом бинауральный слух, играющий большую роль в локализации источника звука, лучше всего развит на частотах меньших 1.5кГц. Выше этой частоты источником информации о местоположении служит лишь разница амплитуд сигнала для левого и правого уха. Это делает возможным применение при кодировании режимов Joint Stereo - запоминается либо информация для суммы правого и левого каналов и их разница, со значительно меньшей точностью (Mid/Side coding), либо вообще запоминается лишь амплитуда сигнала (Intensity coding).
Психоакустика
Критические полосы (Critical Bands)
  • Человеческая система восприятия звука имеет ограниченное, зависящее от частоты разрешение. Равномерное, с точки зрения восприятия человеком измерение частоты может быть выражено в единицах ширины Критических Полос.
    Их ширина менее 100 Hz для нижних слышимых частот, и более 4 kHz для наиболее высоких. Весь частотный диапазон может быть разделен на 25 критических полос.
  • Новый отсчет частоты был назван барк (bark, after Barkhausen):
    1 Барк = ширина одной критической полосы
    Для частот < 500 Hz, может быть рассчитан по формуле:   частота / 100  Барк,
    Для частот > 500 Hz:   9 + 4log2(частота / 1000)  Барк.
Чувствительность человеческого уха в зависимости от частоты
  • Эксперимент: Слушатель в тихой комнате. Повышаем громкость тона частотой 1 kHz до уровня когда он становится слышимым. Изменяя частоту тона получим:
Частотное(параллельное) маскирование
Вопрос: Взаимодействуют ли звуковые рецепторы друг с другом ?
  • Эксперимент: Воспроизводим тон частотой 1 kHz (маскирующий сигнал), с фиксированной громкостью (60 dB). Воспроизводим тестовый (маскируемый) тон с различной громкостью (скажем с частотой 1.1 kHz), и повышаем его уровень до тех пор пока он не становится слышимым.
  • Изменяем частоту тестового тона и рисуем границу слышимости:
  • Повторяем эксперимент для различных частот маскирующего сигнала:
  • Частотное маскирование с частотной шкалой выраженной в Барках:
Временное(последовательное) маскирование
Если мы слышим громкий звук, который внезапно прекращается, требуется некоторое время чтобы услышать более тихий тон.
Эксперимент: Воспроизводим 1 kHz маскирующий тон на уровне 60 dB, и тестовый тон с частотой 1.1 kHz на уровне 40 dB. Тестовый тон не слышен (он замаскирован).
Отключаем маскирующий тон, затем, после небольшой задержки отключаем тестовый тон.
Уменьшаем время задержки до тех пор пока тестовый тон еще слышен (например 5 ms).
Повторяем используя различную громкость тестового тона и получаем:

 
Общий эффект от частотного и временного маскирования:


Транзиентные сигналы

Представленная выше теория маскирования верна в случае рассмотрения квазистационарных, медленно меняющихся по амплитуде и частотным характеристикам сигналов. В случае же рассмотрения сигналов с резко меняющимися параметрами (транзиентные сигналы) она неприменима.
Ухо в данном случае невозможно описать с помощью линейной системы. Теоретически обоснованных подходов для описания восприятия в данном случае автору не известно. Можно описать лишь несколько хорошо известных эффектов проявляющихся при кодировании данных сигналов:
  • Пре-эхо (pre-echo, ringing). Возникает перед резкими увеличениями амплитуды сигнала (атаками). При кодировании с недостаточным временным разрешением (и выделением недостаточного количества бит при квантовании) часть сигнала предшествующая атаке существенно искажается шумом квантования. Так как существует эффект пре-маскирования, то некоторое искажение допустимо, однако оно должно быть достаточно коротким по времени. Некоторые исследования показывают, что время пре-маскирования уменьшается с увеличением частоты сигнала.
  • Речевой сигнал. Голосовые участки речевого сигнала являются по своей природе часто идущими атаками с быстрым затуханием (pitched signals):
  • Стандартная психоакустическая модель маскирования сигналов в данном случае выдает завышенные пороги слышимости (из-за недостаточного временного разрешения) и, как результат, становится слышимым шум квантования.