Способ и устройство для сжатия и распаковки представления на основе амбиофонии высшего порядка

Иллюстрации

Показать все

Изобретение относится к средствам для сжатия и распаковки представления на основе амбиофонии высшего порядка. Технический результат заключается в повышении эффективности сжатия. Для текущего кадра оценивают набор доминирующих направлений и соответствующий набор данных индексов обнаруженных направленных сигналов. Отделяют от последовательностей HOA-коэффициентов упомянутого текущего кадра нефиксированное число направленных сигналов с соответствующими направлениями, содержащимися в упомянутом наборе оценок доминирующих направлений и с соответствующим задержанным набором данных индексов упомянутых направленных сигналов, при этом упомянутое нефиксированное число меньше упомянутого фиксированного числа. Назначают направленные сигналы и последовательности HOA-коэффициентов окружающего HOA-компонента каналам, число которых соответствует фиксированному числу, при этом для назначения используются задержанный набор данных индексов направленных сигналов и набор данных индексов сокращенного числа окружающих последовательностей HOA-коэффициентов. Перцепционно кодируют каналы связанного кадра таким образом, чтобы предоставлять кодированный сжатый кадр. 4 н. и 18 з.п. ф-лы, 5 ил.

Реферат

Область техники

Изобретение относится к способу и к устройству для сжатия и распаковки представления на основе амбиофонии высшего порядка посредством обработки направленных и окружающих компонентов сигнала по-разному.

Уровень техники

Амбиофония высшего порядка (HOA) является одной из возможностей представления трехмерного звука из числа других технологий, таких как синтез волнового поля (WFS) или канальные подходы, к примеру 22.2. Тем не менее, в отличие от канальных способов, HOA-представление обеспечивает преимущество независимости от конкретной компоновки громкоговорителей. Тем не менее, эта гибкость обеспечивается за счет процесса декодирования, который требуется для воспроизведения HOA-представления на конкретной компоновке громкоговорителей. По сравнению с WFS-подходом, в котором число требуемых громкоговорителей обычно является очень большим, HOA также может быть подготовлена посредством рендеринга для компоновок, состоящих только из небольшого числа громкоговорителей. Дополнительное преимущество HOA состоит в том, что идентичное представление также может использоваться без модификации для бинаурального рендеринга в наушники.

HOA основана на представлении пространственной плотности амплитуд гармонической плоской волны сложной формы посредством усеченного разложения в ряд по сферическим гармоникам (SH). Каждый коэффициент разложения в ряд представляет собой функцию от угловой частоты, которая может быть эквивалентно представлена посредством функции во временной области. Следовательно, без потери общности, полное HOA-представление звукового поля фактически может предполагаться как состоящее из 0 функций во временной области, где 0 обозначает число коэффициентов разложения в ряд. Эти функции во временной области эквивалентно упоминаются как "последовательности HOA-коэффициентов" или как "HOA-каналы".

Пространственное разрешение HOA-представления повышается с растущим максимальным порядком N разложения в ряд. К сожалению, число коэффициентов разложения в ряд в 0 растет квадратично с порядком N, в частности . Например, типичные HOA-представления с использованием порядка N=4 требуют 0=25 HOA-коэффициентов (разложения в ряд). Согласно вышеприведенным соображениям, полная скорость передачи битов для передачи HOA-представления, с учетом требуемой одноканальной частоты дискретизации и числа битов в расчете на выборку, определяется посредством . Следовательно, передача HOA-представления порядка N=4 с частотой дискретизации =48 кГц с использованием =16 битов на выборку приводит к скорости передачи битов в 19,2 Мбит/с, которая является очень высокой для многих практических вариантов применения, например, для потоковой передачи.

Сжатие HOA-представлений звукового поля предложено в заявках на патент EP 12306569.0 и EP 12305537.8. Вместо перцепционного кодирования каждой из последовательностей HOA-коэффициентов по отдельности, которое выполняется, например, в работе авторов E. Hellerud, I. Burnett, A. Солвенг и U.P. Svensson, "Encoding Higher Order Ambisonics with AAC", 124th AES Convention, Амстердам, 2008 год, предпринимается попытка сокращать число сигналов, которые должны быть перцепционно кодированы, в частности, посредством выполнения анализа звукового поля и разложения данного HOA-представления на направленный и остаточный окружающий компонент. В общем, предполагается, что направленный компонент представлен посредством небольшого числа доминирующих направленных сигналов, которые могут рассматриваться в качестве общих функций плоской волны. Порядок остаточного окружающего HOA-компонента уменьшается, поскольку предполагается, что после извлечения доминирующих направленных сигналов, HOA-коэффициенты низшего порядка переносят наиболее релевантную информацию.

Сущность изобретения

В итоге, посредством такой операции, начальное число последовательностей HOA-коэффициентов, которые должны быть перцепционно кодированы, уменьшается до фиксированного числа D доминирующих направленных сигналов и числа последовательностей HOA-коэффициентов, представляющих остаточный окружающий HOA-компонент с усеченным порядком, в силу чего число сигналов кодироваться является фиксированным, т.е. . В частности, это число является независимым от фактически обнаруженного числа активных доминирующих направленных источников звука во временном кадре k. Это означает то, что в k временных кадрах, в которых фактически обнаруженное число активных доминирующих направленных источников звука меньше максимального разрешенного числа D направленных сигналов, некоторые или даже все доминирующие направленные сигналы, которые должны быть перцепционно кодированы, являются нулевыми. В конечном счете, это означает то, что эти каналы вообще не используются для захвата релевантной информации звукового поля. В этом контексте, дополнительное возможно слабое место в обработках согласно EP 12306569.0 и EP 12305537.8 представляет собой критерий для определения количества активных доминирующих направленных сигналов в каждом временном кадре, поскольку предпринимается попыток определять оптимальное количество активных доминирующих направленных сигналов относительно последовательного перцепционного кодирования звукового поля. Например, в EP 12305537.8, количество доминирующих источников звука оценивается с использованием простого критерия мощности, а именно, посредством определения размерности подпространства матрицы корреляции между коэффициентами, принадлежащей наибольшим собственным значениям. В EP 12306569.0 предложено инкрементное обнаружение доминирующих направленных источников звука, причем направленный источник звука считается доминирующим, если мощность функции плоской волны из соответствующего направления является достаточно высокой относительно первого направленного сигнала. Использование критериев на основе мощности, как указано в EP 12306569.0 и EP 12305537.8, может приводить к направленно-окружающему разложению, которое является субоптимальным относительно перцепционного кодирования звукового поля.

Проблема, которая должна разрешаться посредством изобретения, состоит в том, чтобы улучшать HOA-сжатие посредством определения для текущего HOA-контента аудиосигнала того, как назначать для предварительно определенного сокращенного числа каналов, направленные сигналы и коэффициенты для окружающего HOA-компонента. Эта проблема разрешается посредством способов, раскрытых в пунктах 1 и 3 формулы изобретения. Устройства, которые используют эти способы, раскрыты в пунктах 2 и 4 формулы изобретения.

Изобретение улучшает обработку сжатия, предложенную в EP 12306569.0, в двух аспектах. Во-первых, лучше используется полоса пропускания, предоставленная посредством данного числа каналов, которые должны быть кодированы. Во временных кадрах, в которых сигналы доминирующих источников звука не обнаруживаются, каналы, первоначально зарезервированные для доминирующих направленных сигналов, используются для захвата дополнительной информации относительно окружающего компонента, в форме дополнительных последовательностей HOA-коэффициентов остаточного окружающего HOA-компонента. Во-вторых, с учетом цели использовать данное число каналов для того, чтобы перцепционно кодировать данное HOA-представление звукового поля, критерий определения количества направленных сигналов, которые должны извлекаться из HOA-представления, адаптирован относительно этого назначения. Число направленных сигналов определяется таким образом, что декодированное и восстановленное HOA-представление предоставляет наименьшую воспринимаемую ошибку. Этот критерий сравнивает ошибки моделирования, либо возникающие в результате извлечения направленного сигнала и использования последовательности HOA-коэффициентов меньше для описания остаточного окружающего HOA-компонента, либо возникающие в результате неизвлечения направленного сигнала и использования вместо этого дополнительной последовательности HOA-коэффициентов для описания остаточного окружающего HOA-компонента. Этот критерий дополнительно учитывает для обоих случаев пространственное распределение мощности шума квантования введенным посредством перцепционного кодирования направленных сигналов и последовательностей HOA-коэффициентов остаточного окружающего HOA-компонента.

Чтобы реализовывать вышеописанную обработку, перед началом HOA-сжатия, указывается общее число сигналов (каналов), по сравнению с которым уменьшается исходное число 0 последовательностей HOA-коэффициентов. Окружающий HOA-компонент предположительно должен быть представлен посредством минимального числа последовательностей HOA-коэффициентов. В некоторых случаях, это минимальное число может быть нулем. Оставшиеся каналы предположительно содержат либо направленные сигналы, либо дополнительные последовательности коэффициентов окружающего HOA-компонента, в зависимости от того, что обработка извлечения направленных сигналов определяет в качестве перцепционно (то есть с точки зрения восприятия) более значимого. Предполагается, что назначение либо направленных сигналов, либо последовательностей коэффициентов окружающего HOA-компонента оставшимся D каналов может изменяться на покадровой основе. Для восстановления звукового поля на стороне приемного устройства информация относительно назначения передается в качестве дополнительной вспомогательной информации.

В принципе, изобретаемый способ сжатия подходит для сжатия с использованием фиксированного числа перцепционных кодирований представления на основе амбиофонии высшего порядка звукового поля, обозначаемой HOA, с входными временными кадрами последовательностей HOA-коэффициентов, причем упомянутый способ включает в себя следующие этапы, которые выполняются на покадровой основе:

- для текущего кадра, оценка набора доминирующих направлений и соответствующего набора данных индексов обнаруженных направленных сигналов;

- разложение последовательностей HOA-коэффициентов упомянутого текущего кадра на нефиксированное число направленных сигналов с соответствующими направлениями, содержащимися в упомянутом наборе оценок доминирующих направлений, и с соответствующим набором данных индексов упомянутых направленных сигналов, при этом упомянутое нефиксированное число меньше упомянутого фиксированного числа, и на остаточный окружающий HOA-компонент, который представлен посредством сокращенного числа последовательностей HOA-коэффициентов и соответствующего набора данных индексов упомянутого сокращенного числа остаточных окружающих последовательностей HOA-коэффициентов, причем это сокращенное число соответствует разности между упомянутым фиксированным числом и упомянутым нефиксированным числом;

- назначение упомянутых направленных сигналов и последовательностей HOA-коэффициентов упомянутого остаточного окружающего HOA-компонента каналам, число которых соответствует упомянутому фиксированному числу, при этом для упомянутого назначения используются упомянутый набор данных индексов упомянутых направленных сигналов и упомянутый набор данных индексов упомянутого сокращенного числа остаточных окружающих последовательностей HOA-коэффициентов;

- перцепционное кодирование упомянутых каналов связанного кадра таким образом, чтобы предоставлять кодированный сжатый кадр.

В принципе, изобретаемое устройство сжатия подходит для сжатия с использованием фиксированного числа перцепционных кодирований представления на основе амбиофонии высшего порядка звукового поля, обозначаемой HOA, с входными временными кадрами последовательностей HOA-коэффициентов, причем упомянутое устройство выполняет обработку на покадровой основе и включает в себя:

- средство, выполненное с возможностью оценки для текущего кадра набора доминирующих направлений и соответствующего набора данных индексов обнаруженных направленных сигналов;

- средство, выполненное с возможностью с возможностью разложения последовательностей HOA-коэффициентов упомянутого текущего кадра на нефиксированное число направленных сигналов с соответствующими направлениями, содержащимися в упомянутом наборе оценок доминирующих направлений, и с соответствующим набором данных индексов упомянутых направленных сигналов, при этом упомянутое нефиксированное число меньше упомянутого фиксированного числа, и на остаточный окружающий HOA-компонент, который представлен посредством сокращенного числа последовательностей HOA-коэффициентов и соответствующего набора данных индексов упомянутого сокращенного числа остаточных окружающих последовательностей HOA-коэффициентов, причем это сокращенное число соответствует разности между упомянутым фиксированным числом и упомянутым нефиксированным числом;

- средство, выполненное с возможностью назначения упомянутых направленных сигналов и последовательностей HOA-коэффициентов упомянутого остаточного окружающего HOA-компонента каналам, число которых соответствует упомянутому фиксированному числу, при этом для упомянутого назначения используются упомянутый набор данных индексов упомянутых направленных сигналов и упомянутый набор данных индексов упомянутого сокращенного числа остаточных окружающих последовательностей HOA-коэффициентов;

- средство, выполненное с возможностью перцепционного кодирования упомянутых каналов связанного кадра таким образом, чтобы предоставлять кодированный сжатый кадр.

В принципе, изобретаемый способ распаковки подходит для распаковки представления на основе амбиофонии высшего порядка, сжатого согласно вышеуказанному способу сжатия, причем упомянутая распаковка включает в себя следующие этапы:

- перцепционное декодирование текущего кодированного сжатого кадра таким образом, чтобы предоставлять перцепционно декодированный кадр каналов;

- перераспределение упомянутого перцепционно декодированного кадра каналов, с использованием упомянутого набора данных индексов обнаруженных направленных сигналов и упомянутого набора данных индексов выбранных окружающих последовательностей HOA-коэффициентов, с тем чтобы воссоздавать соответствующий кадр направленных сигналов и соответствующий кадр остаточного окружающего HOA-компонента;

- повторное составление текущего распакованного кадра HOA-представления из упомянутого кадра направленных сигналов и из упомянутого кадра остаточного окружающего HOA-компонента, с использованием упомянутого набора данных индексов обнаруженных направленных сигналов и упомянутого набора оценок доминирующих направлений,

- при этом направленные сигналы относительно равномерно распределенных направлений прогнозируются из упомянутых направленных сигналов, и после этого упомянутый текущий распакованный кадр повторно составляется из упомянутого кадра направленных сигналов, упомянутых прогнозированных сигналов и упомянутого остаточного окружающего HOA-компонента.

В принципе, изобретаемое устройство распаковки подходит для распаковки представления на основе амбиофонии высшего порядка, сжатого согласно вышеуказанному способу сжатия, причем упомянутое устройство включает в себя:

- средство, выполненное с возможностью перцепционного декодирования текущего кодированного сжатого кадра таким образом, чтобы предоставлять перцепционно декодированный кадр каналов;

- средство, выполненное с возможностью перераспределения упомянутого перцепционно декодированного кадра каналов, с использованием упомянутого набора данных индексов обнаруженных направленных сигналов и упомянутого набора данных индексов выбранных окружающих последовательностей HOA-коэффициентов, с тем чтобы воссоздавать соответствующий кадр направленных сигналов и соответствующий кадр остаточного окружающего HOA-компонента;

- средство, выполненное с возможностью повторного составления текущего распакованного кадра HOA-представления из упомянутого кадра направленных сигналов, упомянутого кадра остаточного окружающего HOA-компонента, упомянутого набора данных индексов обнаруженных направленных сигналов и упомянутого набора оценок доминирующих направлений, при этом направленные сигналы относительно равномерно распределенных направлений прогнозируются из упомянутых направленных сигналов, и после этого упомянутый текущий распакованный кадр повторно составляется из упомянутого кадра направленных сигналов, упомянутых прогнозированных сигналов и упомянутого остаточного окружающего HOA-компонента.

Преимущественные дополнительные варианты осуществления изобретения раскрыты в соответствующих зависимых пунктах формулы изобретения.

Краткое описание чертежей

Примерные варианты осуществления изобретения описаны со ссылкой на прилагаемые чертежи, из которых:

Фиг. 1 является блок-схемой для HOA-сжатия;

Фиг. 2 является оценкой направлений доминирующих источников звуков;

Фиг. 3 является блок-схемой для HOA-распаковки;

Фиг. 4 является сферической системой координат;

Фиг. 5 является нормализованной дисперсионной функцией для различных порядков N амбиофонии и для углов .

Подробное описание вариантов осуществления

A. Улучшенное HOA-сжатие

Обработка сжатия согласно изобретению, которая основана на EP 12306569.0, проиллюстрирована на фиг. 1, на котором блоки обработки сигналов, которые модифицированы или введены как новые по сравнению с EP 12306569.0, представлены с помощью полужирного поля, и на котором (оценки направлений как таковые) и в этой заявке соответствуют (матрице оценок направлений) и в EP 12306569.0, соответственно. Для HOA-сжатия используется покадровая обработка с неперекрывающимися входными кадрами C(k) последовательностей HOA-коэффициентов длины L, где k обозначает индекс кадра. Кадры задаются относительно последовательностей HOA-коэффициентов, указываемых в уравнении (45), следующим образом:

, (1)

где указывает период дискретизации. Первый этап или стадия 11/12 на фиг. 1 является необязательной и состоит из конкатенации неперекрывающихся k-ого и (k-1)-ых кадров последовательностей HOA-коэффициентов в длинный кадр следующим образом:

, (2)

причем этот длинный кадр перекрывается на 50% со смежным длинным кадром, и этот длинный кадр последовательно использован для оценки направлений доминирующих источников звуков. Аналогично обозначению для , символ тильды используется в нижеприведенном описании для указания того, что соответствующая величина означает длинные перекрывающиеся кадры. Если этап/стадия 11/12 не присутствует, символ тильды не имеет конкретного смысла. В принципе, этап или стадия 13 оценки доминирующих источников звука выполняется так, как предложено в EP 13305156.5, но с важной модификацией. Модификация связана с определением количества направлений, которые должны обнаруживаться, т.е. того, сколько направленных сигналов предположительно извлекаются из HOA-представления. Это осуществляется с намерением извлекать направленные сигналы, только если это является перцепционно более релевантным по сравнению с использованием вместо этого дополнительных последовательностей HOA-коэффициентов для лучшей аппроксимации окружающего HOA-компонента. Подробное описание этой технологии приведено в разделе 2.

Оценка предоставляет набор данных индексов направленных сигналов, которые обнаружены, а также набор соответствующих оценок направлений. D обозначает максимальное число направленных сигналов, которое должно задаваться перед началом HOA-сжатия.

На этапе или стадии 14, текущий (длинный) кадр последовательностей HOA-коэффициентов разлагается (как предложено в EP 13305156.5) на число направленных сигналов, принадлежащих направлениям, содержащимся в наборе , и остаточный окружающий HOA-компонент . Задержка в два кадра вводится в результате обработки суммирования с перекрытием, чтобы получать сглаженные сигналы. Предполагается, что содержит всего D каналов, из которых, тем не менее, только каналы, которые соответствуют активным направленным сигналам, являются ненулевыми. Индексы, указывающие эти каналы, предположительно должны выводиться в наборе данных. Дополнительно, разложение на этапе/стадии 14 предоставляет некоторые параметры, которые используются на стороне распаковки для прогнозирования частей исходного HOA-представления из направленных сигналов (дополнительную информацию см. в EP 13305156.5). На этапе или стадии 15, число коэффициентов окружающего HOA-компонента обоснованно уменьшено, так что они содержат только последовательностей ненулевых HOA-коэффициентов, где указывает число элементов набора данных, т.е. число активных направленных сигналов в кадре k-2. Поскольку окружающий HOA-компонент предположительно должен всегда быть представлен посредством минимального числа последовательностей HOA-коэффициентов, эта проблема может быть фактически сведена к выбору оставшихся последовательностей HOA-коэффициентов из возможных . Чтобы получать сглаженное уменьшенное окружающее HOA-представление, этот выбор выполняется таким образом, что по сравнению с выбором, осуществленным в предыдущем кадре k-3, возникает минимально возможное число изменений.

В частности, следует различать следующе три случая:

a) : В этом случае, предположительно должны выбираться последовательности HOA-коэффициентов, идентичные последовательностям HOA-коэффициентов в кадре k-3.

b) : В этом случае, большее число последовательностей HOA-коэффициентов по сравнению с последним кадром k-3 может использоваться для представления окружающего HOA-компонента в текущем кадре. Эти последовательности HOA-коэффициентов, которые выбраны в k-3, предположительно также должны выбираться в текущем кадре. Дополнительные последовательности HOA-коэффициентов могут выбираться согласно различным критериям. Например, выбор этих последовательностей HOA-коэффициентов в с наибольшей средней мощностью или выбор последовательностей HOA-коэффициентов относительно их перцепционной значимости.

c) : В этом случае, меньшее число последовательностей HOA-коэффициентов по сравнению с последним кадром k-3 может использоваться для представления окружающего HOA-компонента в текущем кадре. Здесь вопрос, на который следует ответить, заключается в том, какая из ранее выбранных последовательностей HOA-коэффициентов должна деактивироваться. Обоснованное решение заключается в том, чтобы деактивировать те последовательности, которые назначены каналам на этапе или стадии 16 назначения сигналов в кадре k-3. Для недопущения неоднородностей на границах кадров, когда дополнительные последовательности HOA-коэффициентов активируются или деактивируются, преимущественно обеспечивать плавное постепенное усиление или затухание соответствующих сигналов.

Конечное окружающее HOA-представление с сокращенным числом последовательностей ненулевых коэффициентов обозначается посредством . Индексы выбранных окружающих последовательностей HOA-коэффициентов выводятся в наборе данных.

На этапе/стадии 16, активные направленные сигналы, содержащиеся в , и последовательности HOA-коэффициентов, содержащиеся в , назначаются кадру I-каналов для отдельного перцепционного кодирования. Если подробнее описывать назначение сигналов, кадры и предположительно должны состоять из отдельных сигналов и следующим образом:

(3)

Активные направленные сигналы назначаются таким образом, что они поддерживают свои индексы каналов, для того чтобы получать непрерывные сигналы для последовательного перцепционного кодирования. Это может выражаться следующим образом:

(4)

Последовательности HOA-коэффициентов окружающего компонента назначаются таким образом, что минимальное число последовательностей коэффициентов всегда содержится в последних сигналах , т.е.:

(5)

Для дополнительных последовательностей HOA-коэффициентов окружающего компонента, следует различать, выбраны они также или нет в предыдущем кадре:

a) Если они также выбраны для передачи в предыдущем кадре, т.е. если соответствующие индексы также содержатся в наборе данных, назначение этих последовательностей коэффициентов сигналам в является идентичным назначению для предыдущего кадра. Эта операция обеспечивает сглаженные сигналы , что является предпочтительным для последовательного перцепционного кодирования на этапе или стадии 17.

b) В противном случае, если некоторые последовательности коэффициентов выбираются как новые, т.е. если их индексы содержатся в наборе данных, а не в наборе данных, они сначала размещаются относительно своих индексов в порядке по возрастанию и в этом порядке назначаются каналам , которые еще не заняты посредством направленных сигналов.

Это конкретное назначение обеспечивает такое преимущество, что в ходе процесса HOA-распаковки, перераспределение и составление сигналов может выполняться без знания того, какая окружающая последовательность HOA-коэффициентов содержится в каком канале . Вместо этого, назначение может быть восстановлено во время HOA-распаковки с простым знанием наборов и данных. Преимущественно, эта операция назначения также предоставляет вектор назначений, элементы , которого обозначают индексы каждой из дополнительных последовательностей HOA-коэффициентов окружающего компонента. Иначе говоря, элементы вектора назначений предоставляют информацию в отношении того, какие из дополнительных последовательностей HOA-коэффициентов окружающего HOA-компонента назначаются в каналах с неактивными направленными сигналами. Этот вектор может передаваться дополнительно, но менее часто, чем посредством частоты кадров, для получения возможности инициализации процедуры перераспределения, выполняемой для HOA-распаковки (см. раздел B). Этап/стадия 17 перцепционного кодирования кодирует I-каналы кадра и выводит кодированный кадр .

Для кадров, для которых вектор не передается из этапа/стадии 16 на стороне распаковки, наборы и параметров данных вместо вектора используются для выполнения перераспределения.

A.1. Оценка направлений доминирующих источников звуков

Этап/стадия 13 оценки для направлений доминирующих источников звуков по фиг. 1 подробнее проиллюстрирован на фиг. 2. Он, по сути, выполняется согласно этапу из EP 13305156.5, но с определяющим отличием, которое состоит в способе определения количества доминирующих источников звука, соответствующих числу направленных сигналов, которые должны извлекаться из данного HOA-представления. Это число является значительным, поскольку оно используется для управления тем, данное HOA-представление представляется лучше либо посредством использования более направленных сигналов, либо вместо этого посредством использования более последовательностей HOA-коэффициентов, с тем чтобы лучше моделировать окружающий HOA-компонент.

Оценка направлений доминирующих источников звуков начинается на этапе или стадии 21 с предварительного поиска направлений доминирующих источников звуков с использованием длинного кадра входных последовательностей HOA-коэффициентов. Вместе с предварительными оценками направлений, вычисляются соответствующие направленные сигналы и HOA-компоненты звукового поля, которые предположительно созданы посредством отдельных источников звука, как описано в EP 13305156.5. На этапе или стадии 22, эти количества используются вместе с кадром входных последовательностей HOA-коэффициентов для определения числа направленных сигналов, которые должны извлекаться. Следовательно, оценки направлений, соответствующие направленные сигналы и HOA-компоненты звукового поля отбрасываются. Вместо этого, только оценки , направлений затем назначаются ранее найденным источникам звука.

На этапе или стадии 23, результирующие траектории направлений сглажены согласно модели перемещения источников звука, и определяется то, какие из источников звука предположительно являются активными (см. EP 13305156.5). Последняя операция предоставляет набор индексов активных направленных источников звука и набор соответствующих оценок направлений.

A.2. Определение числа извлеченных направленных сигналов

Для определения числа направленных сигналов на этапе/стадии 22, предполагается ситуация, в которой имеется данное общее количество I-каналов, которые должны быть использованы для захвата перцепционно наиболее релевантной информации звукового поля. Следовательно, определяется число направленных сигналов, которые должны извлекаться, обусловленное вопросом касательно того, для общего качества HOA-сжатия/распаковки текущее HOA-представление представляется лучше либо посредством использования более направленных сигналов, либо посредством использования более последовательностей HOA-коэффициентов, для лучшего моделирования окружающего HOA-компонента. Чтобы извлекать на этапе/стадии 22 критерий определения числа направленных источников звука, которые должны извлекаться, причем этот критерий связан с человеческим восприятием, учитывается то, что HOA-сжатие достигается, в частности, посредством следующих двух операций:

- уменьшение последовательностей HOA-коэффициентов для представления окружающего HOA-компонента (что означает уменьшение числа связанных каналов);

- перцепционное кодирование направленных сигналов и последовательностей HOA-коэффициентов для представления окружающего HOA-компонента. В зависимости от числа M, , извлеченных направленных сигналов, первая операция приводит к аппроксимации:

(6)

, (7)

где (8)

обозначает HOA-представление направленного компонента, состоящее из HOA-компонентов , звукового поля, которые предположительно должны создаваться посредством M отдельно рассматриваемых источников звука, и обозначает HOA-представление окружающего компонента только последовательностей ненулевых HOA-коэффициентов. Аппроксимация из второй операции может выражаться следующим образом:

(9)

, (10)

где и обозначают составленные направленные и окружающие HOA-компоненты после перцепционного декодирования, соответственно.

Формулирование критерия

Число направленных сигналов, которые должны извлекаться, выбирается таким образом, что полная ошибка аппроксимации:

, (11)

где