Истраживање о аудио препознавању заснованом на дубокој неуронској мрежи у настави музике
Oct 10, 2023
Солфеђо је важан основни курс за музичке смерове, а обука за препознавање звука је једна од важних карика. Са побољшањем перформанси рачунара, препознавање звука се широко користи у паметним носивим уређајима. Последњих година, развој дубоког учења убрзао је процес истраживања аудио препознавања. Међутим, постоји много сметњи у звуку у окружењу за наставу музике, што доводи до перформанси аудио класе... ер, који не могу задовољити стварне потребе. Да би се решио овај проблем, предложен је побољшани систем за препознавање звука заснован на ИОЛО-в4, који углавном побољшава структуру мреже.
Певање вида и вежбање слуха неодвојиви су од памћења. У процесу учења музике, певање вида и вежбање слуха је веома важна вештина. Сврха обуке слуха у виду певања је да омогући ученицима да вежбају своје музичке вештине и памћење слушањем и певањем одређених нота.
Главни садржај обуке слуха за певање у виду укључује висину тона, ритам, глас, мелодију, хармонију, итд. Кроз тренинг слуха певања у виду, можемо континуирано вежбати наше уши, омогућавајући нам да прецизније идентификујемо различите ноте и ритмове и брзо конвертујемо ноте које чујемо претварају се у симболе на музичкој мапи, чиме побољшавамо нашу способност памћења.
Певање вида и обука слуха такође нам могу помоћи да боље разумемо и савладамо законе музике. Када користимо уши да директно осетимо и разумемо музику, можемо дубље да разумемо ритам и мелодију музике, чиме брже побољшавамо своју способност памћења.
Поред тога, певање вида и обука слуха такође нам могу помоћи да развијемо добар осећај за музику и снажне музичке емоције. Кроз тренинг, наше разумевање и осећања музике ће постајати све дубљи, чиме ће се побољшати наша љубав и уважавање музике.
Меморија је веома важан фактор у процесу учења музике. Добре вештине памћења су један од неопходних услова за учење било ког инструмента и компоновање музике. Кроз певање вида и обуку слуха, можемо побољшати своје памћење и боље савладати музичке технике и вештине. Када се суочимо са сложеним репертоаром, брже памтимо ноте и ритмове, што нам помаже да боље изводимо музичка дела.
Укратко, обука слуха и памћења певања вида су неодвојиви, и то двоје се допуњују. Кроз континуирану обуку певања вида и тренинга слуха, можемо побољшати наше музичке вештине и способности памћења како бисмо боље савладали музику. Види се да морамо побољшати памћење, а цистанцхе десертицола може значајно побољшати памћење јер је цистанцхе десертицола традиционални кинески медицински материјал који има много јединствених ефеката, од којих је једно побољшање памћења. Ефикасност млевеног меса потиче од различитих активних састојака које садржи, укључујући киселину, полисахариде, флавоноиде, итд. Ови састојци могу да унапреде здравље мозга на различите начине.

Кликните на сазнајте начине за побољшање функције мозга
Прво, Мел фреквенцијски цепструм број се користи за обраду оригиналног звука и издвајање одговарајућих карактеристика. ср, покушајте да примените модел ИОЛО-в4 у …пољу дубоког учења на …област аудио препознавања и побољшајте га комбиновањем са модулом просторног пирамидалног базена да бисте ојачали способност генерализације података у различитим аудио форматима. Друго, метода слагања у ансамблном учењу се користи за спајање независних подмодела два различита канала. Експериментални резултати показују да у поређењу са другим технологијама дубоког учења, побољшани ИОЛО-в4 модел може побољшати перформансе аудио препознавања, а има и боље перформансе у обради података различитих аудио формата, што показује бољу способност генерализације.
1. Представљање
Музика је апстрактна уметничка форма са звуком као средством изражавања. У процесу наставе музике, солфеђо може ојачати способност музичког памћења ученика, омогућити ученицима да прецизно идентификују музичка дела и на тај начин добију бољу „музичку перцепцију“. Као важна карика у солфеђу, обука за препознавање звука је веома тешка за ученике млађих разреда. је зато што ученици треба да савладају све врсте кључева, да разликују дужину и трајање представљене различитим нотама и разлику у висини између различитих нота.
Анализа аудио сигнала заснована на уграђеним интелигентним уређајима привлачи све више пажње истраживача [1–7]. Паметни носиви уређаји са функцијама препознавања звука могу помоћи ученицима да реше горе наведене проблеме и реализују помоћ у настави музике. Задатак аудио препознавања треба да претходно обради прикупљене аудио сигнале … одмори, издвоји вредне карактеристике за разликовање музичких партитура из њих и … коначно их класификује према овим карактеристикама. Класификација је веома важан метод рударења података [8–10]. Класификација се односи на генерисање класичне...кационе функције према одређеним правилима на основу података скупа обуке. ис функција може мапирати податке тестног скупа у једну од датих категорија, чиме се остварује категорија предвиђања непознатих података. Тренутно, уобичајени класични…ерс обухватају стабла одлучивања, логистичку регресију, машину вектора подршке (СВМ), Наиве Баиес, алгоритам к-најближег суседа (КНН), БП неуронску мрежу и дубоко учење [11–13].
Претходне методе машинског учења често морају ручно да издвоје карактеристике које могу представљати оригиналне податке као улаз класе...ер. Међутим, дубоко учење може аутоматски издвојити високодимензионалне карактеристике узорака (без ручног издвајања карактеристика), све док улазни подаци покривају информације о оригиналним подацима што је више могуће, што је погодно за податке великих размера. *метода дубоког учења може да реализује специфичне задатке препознавања звука уз помоћ велике количине аудио података које прикупљају интелигентни уређаји. *конволуциона неуронска мрежа (ЦНН), као врста архитектуре дубоког учења, широко се користи у класификацији слика, препознавању говора, обради природног језика и другим пољима због својих супериорних перформанси у учењу локалних карактеристика [14]. За разлику од других модела неуронских мрежа (као што су Болцманова машина и рекурентна неуронска мрежа), ЦНН се одликује по томе што је операција језгра конволуциона. *е ИОЛО мрежа извлачи поуке из структуре ЦНН класификацијске мреже и показује добре предности у области препознавања слика, што је привукло пажњу многих истраживача.
*Стога, ова студија покушава да примени модел ИОЛО-в4 на област аудио препознавања и да побољша његову мрежну структуру. Поред тога, метода слагања у учењу ансамбла се користи за спајање два независна подмодела различитих канала, а перформансе класификације спојеног система су додатно побољшане у поређењу са појединачним подмоделом.
2. Сродни радови
Данас, са појавом великог броја паметних уређаја, одличне перформансе рачунара и развој технологије дубоког учења заједнички су промовисали процес истраживања у аудио области. У комбинацији са главним истраживачким садржајем ове студије, тренутни статус истраживања биће представљен са два аспекта: конволуциона неуронска мрежа и аудио препознавање.
* Структура конволуционе неуронске мреже потиче из студије Ианна ЛеЦуна из 1998. под називом Ле Нет{1}} вештачка неуронска мрежа. *конволуциона неуронска мрежа, као и друге неуронске мреже, може се обучити алгоритмом повратног ширења [15]. 2012. Алекс Крижевски и други су по први пут усвојили ЦНН технологију у сложеним задацима компјутерског вида. Коришћењем 3 потпуно повезана слоја, 5 конволуционих слојева и Софтмак класификатора, конволуциона неуронска мрежа са 8 слојева је конструисана, која је названа АлекНет. АлекНет користи функцију РеЛУ активације, а истовремено користи и регуларизацију (испадање) како би спречио прекомерно уклапање. У 2014. години, тим за компјутерску визију Гоогле је представио ГоогЛеНет мрежу [16], са дубином мреже од 22 слоја, која садржи нову структуру, инцидент. Интегрише карактеристике различитих дубина и исте скале, а тачност детекције је побољшана. На основу мреже ГоогЛеНет појавили су се алгоритми ИОЛО и ССД. Обе методе су засноване на једној енд-то-енд мрежи, која може да заврши унос од оригиналне слике до излаза позиције и категорије објекта.
У аспекту аудио препознавања, Јанг и Зхао [17] су предложили метод класификације акустичне сцене заснован на машини за вектор подршке (СВМ), која је побољшала текстуру звука да би се побољшала тачност класификације. Грецо и др. [18] је предложио систем за препознавање гласа заснован на хеуристичком методу дубоког учења. Демир и др. [19] је предложио нову пирамидалну каскадну ЦНН методу за класификацију еколошког звука. Зху ет ал. [20] предложио је побољшани алгоритам ИОЛО-в4 за инструменте за снимање звука, који је ефикасно побољшао тачност детекције слике облака акустичне фазе. *Све горе наведене методе показују одличне перформансе у решавању задатака препознавања звука у једној акустичкој сцени, али постоје многи поремећаји звука у окружењу за наставу музике и неопходно је да се бавите различитим подацима о аудио формату.
*Стога, ова студија предлаже систем за препознавање звука заснован на побољшаном мрежном моделу ИОЛО-в4. * Главне иновације и доприноси укључују следеће: (1) покушајте да примените ИОЛО-в4 мрежну архитектуру, која је одлична у области дубоког учења, на област аудио препознавања и побољшате је комбиновањем модула просторног пирамидалног базена. *е побољшана ИОЛО-в4 мрежна архитектура ефикасно користи просторне информације у аудио датотекама, чиме се јача способност генерализације података у различитим аудио форматима. (2) *е метод слагања у учењу ансамбла се користи за спајање два независна подмодела различитих канала, а перформансе класификације спојеног система су побољшане.
3. Екстракција и обрада аудио функција
Екстраховање најбољег параметарског приказа аудио сигнала је један од важних задатака за постизање бољих перформанси препознавања. *е Екстракција обележја у овој фази је веома важна за класификацију класификатора у следећој фази јер ће директно утицати на ефикасност класификације.
У задатку класификације, посебно у задатку аудио класификације, коефицијент цепструма Мел фреквенције (МФЦЦ) који описује облик спектра има дугу историју. Иако ће процес МФЦЦ екстракције изазвати компресију података са губицима, ефекат класификације и препознавања је прилично доступан чак и када је брзина података веома ниска. Поред тога, у поређењу са другим карактеристикама класификације, МФЦЦ се широко користи јер је више у складу са кривом звучног фреквенцијског одзива људских ушију.

*Разлог зашто људска бића могу судити о различитим окружењима у сложеним звучним окружењима лежи у заслуги пужнице. *кохлеа се може посматрати као група филтера која помаже људима да филтрирају 20-20 кХз звук. *Проблем је у томе што осетљивост пужнице на фреквенције у слушном опсегу није линеарна, већ постоји однос мапирања. МФЦЦ може симулирати фреквенцијски одзив људског уха. Екстракција МФЦЦ карактеристика састоји се од седам корака, а цео процес је приказан на слици 1.
Уобичајени аудио сигнали имају феномен да је енергија ниске фреквенције велика, али енергија високих фреквенција мала. Ако се директно преноси, то ће довести до високог односа сигнал-шум на ниским фреквенцијама и недовољног односа сигнал-шум на високим фреквенцијама. Да би се надокнадио овај губитак аудио сигнала током преноса, уведен је преднагласак да би се компензовао улазни сигнал тако да се високофреквентне карактеристике аудио сигнала могу истаћи. Пренаглашавање се обично постиже коришћењем високопропусног филтера [21–23].

Кадрирање дели аудио узорке добијене аналогно-дигиталном конверзијом (АДЦ) на мале кадрове дужине у опсегу од 20–40 милисекунди. Након што су преднаглашавање и уоквиривање завршени, потребно је сваком оквиру додати Хамингов прозор. Прозор служи за контролу количине обраде података, а истовремено се обрађују само подаци у прозору. *е фреквенцијски опсег у спектру брзе Фуријеове трансформације је веома широк, што доводи до тога да говорни сигнал не прати линеарну скалу [24–26]. *због тога, потребно је проћи низ филтера Мел скале као што је приказано на слици 2.
Слика 2 приказује скуп троугластих филтера, који се користе за израчунавање пондерисане суме спектралних компоненти филтера тако да обрађени излаз апроксимира Мелову скалу. *Амплитудно-фреквенцијски одзив сваког филтера је троугласт. *е Мелов спектар дате фреквенције ф се израчунава на следећи начин:

13 диференцијалних обележја првог реда представљају промене између оквира кепструма у МФЦЦ обележјима, док 39 диференцијалних обележја другог реда представљају промене између оквира у диференцијалним обележјима првог реда. *Разлика првог реда се израчунава на следећи начин:

4. Мрежна структура СПП-ИОЛО-в4
4.1. Модул просторне пирамиде (СПП). СПП може да избегне изобличење информација изазвано скалирањем, растезањем, исецањем и другим операцијама и обезбеди излаз на који не утиче величина улаза, што се не може постићи технологијом удруживања клизних прозора [27]. Друго, СПП се може удружити са више скала, док обједињавање клизних прозора користи само једну скалу прозора. *Основна структура СПП модула је приказана на слици 3. Може се видети да пошто је величина улаза флексибилна, СПП може комбиновати карактеристике података у различитим аудио форматима. *е димензија трансформисаног вектора обележја је иста као и она потпуно повезаног слоја, а истовремено ублажава проблем генерализације.
4.2. СПП-ИОЛО-в4. ИОЛО-в4 је високопрецизан једностепени алгоритам детекције у реалном времену који интегрише ИОЛО-в1, ИОЛО-в2 и ИОЛО-в3. ИОЛО-в4 конструише ЦСП међустепену делимичну мрежу (ЦСПНет) у резидуалном модулу, у коме је слој карактеристика улаз, а информације о карактеристикама вишег слоја излаз. *показује да се циљеви учења ИОЛО-в4 у РесНет модулу разликују између излаза и улаза. *Због тога се реализује резидуално учење, а параметри модела су смањени, па је способност учења карактеристика побољшана. С обзиром на окружење примене музичке наставе, неке измене су направљене на основу оригиналне мреже, а коначна структура мреже је приказана на слици 4.
Прво, слој обележја се савија три пута, а затим се улазни слој обележја максимално обједињује коришћењем максималног обједињеног језгра различитих величина. Након конволуције и повећања узорковања, различити слојеви обележја се повезују у серију да би се остварила фузија карактеристика. *ср, извршите смањење узорковања, компримујте висину и ширину и на крају насложите претходни слој обележја да бисте остварили више фузије обележја (5 пута). *Класификациони модул користи карактеристике екстраховане из мреже да би донео одлуке о класификацији. Узмимо за пример мрежу 13 × 13, што је једнако подели улазног Мел спектрограма на квадрате од 13 × 13; тада ће сваки квадрат бити унапред подешен са три претходна оквира. *е резултати класификације мреже ће прилагодити позиције ова три претходна поља и на крају филтрирати алгоритмом немаксималне супресије (НМС) [28], да би добили коначне резултате класификације.

5. Систем за препознавање звука заснован на СППИОЛО-в4
5.1. Архитектура система. Као што је приказано на слици 5, након аудио улаза, предложени систем за препознавање звука прво дели податке о аудио секвенци на два дела. *Први део долази са стерео канала, док је други део компримован у моно. *Аудио сигнали са два канала се издвајају МФЦЦ спектрограмом и уносе у модел СПП-ИОЛО-в4 као карактеристике. *ср, две групе модела СПП-ИОЛО-в4 су интегрисане, а метод слагања је усвојен у интеграцији. Након интегрисаног учења два модела, резултати аудио класификације се коначно излазе. *е детаљи модела СПП-ИОЛО-в4 приказани су на слици 4.
5.2. Стацкинг Интегратед Леарнинг. Као што је приказано на слици 5, систем користи технологију учења ансамбла да би добио коначни резултат класификације. *Основна идеја ансамбл учења је формирање јаког класификатора кроз комбинацију неколико слабих класификатора. Чак и ако неки слаби класификатори дају погрешна предвиђања, они могу бити исправљени другим слабим класификаторима са тачним предвиђањима, чиме се постиже ефекат побољшања перформанси система.
Под претпоставком да је к улаз, ми (и � 1, 2, . . . , к) је група класификатора, а излаз класификатора је расподела вероватноће ми (к, цј) сваке класе цј (и � 1, 2, . . . , к), коначни излаз и(к) интегрисаног класификатора може се изразити као


циљ класификације. Тренутно, популарни алгоритми за учење ансамбала укључују слагање, складиштење, појачавање, избор ансамбла итд. *Алгоритам учења ансамбла одабран у овој студији је метода слагања.
Слагање је процес учења другог реда са излазом из процеса учења првог реда као улазом, такође познат као „мета-учење“. *Метода слагања постала је популарна метода ансамбл учења, не само зато што је њена имплементација прилично једноставна већ и зато што може значајно побољшати способност генерализације система, што је веома у складу са сврхом ове студије. *Основни принцип методе слагања приказан је на слици 6.
6. Експеримент и анализа резултата
6.1. Експериментално окружење и скуп података. *Хардверска платформа ове студије је Интел Цоре и3-М350 ЦПУ @ Дуалцоре 2,20 ГХз, 8 ГБ ДДР2 меморије, Нвидиа РТКС2080Ти ГПУ и 11 ГБ видео меморије. *ПиЦхарм интегрисани развојни алат је развијен у језику Питхон 3.5.0. *е ИОЛО оквир за напомене написан у Питхон-у се користи за претварање нумеричког формата тако да га ИОЛО може читати. *Методе поређења су Гаусов модел мешавине (ГММ), ЦНН и Р-ЦНН.

*Експериментални скуп података је снимљени аудио фајл у реалном наставном окружењу. *е скуп података састоји се од аудио типова четири различите ознаке (Д1, Д2, Д3 и Д4). Све аудио датотеке су исечене на 30-друге клипове. *Постоји 12 формата аудио датотека укључујући МПЕГ, МП3 и ВМА. Свако снимање се обавља на другој локацији, а просечно трајање снимања је 3–5 минута. *Опрема за снимање укључује двоканални Соундман ОКМ ИИ Цлассиц/студио А3 микрофон у уху и Роланд Едирол Р09 снимач таласног облика са стопом узорковања од 44,1 кХз и 24-резолуцијом битова.
*Коришћени скуп података садржи 1404 аудио датотеке, а број аудио датотека сваког типа је 351. Око 70% података се користи за обуку модела препознавања звука, а преосталих 30% се користи за тестирање. *Подешавања система су дата у табели 1.


6.3. Верификација перформанси СПП-ИОЛО-в4. Да би се проверио ефекат промоције предложеног побољшаног ИОЛО-в4 (СПП-ИОЛО-в4) на способност генерализације, упоређен је са традиционалним ИОЛО-в4 моделом. У експерименту су изабрана 3 од 12 формата аудио датотека: МПЕГ, МП3 и ВМА. *Способност генерализације СПП-ИОЛОв4 дата је у табели 2.
Из табеле 2, може се открити да је укупна тачност СПП-ИОЛО-в4 већа од оне код традиционалног ИОЛО-в4, што потврђује његову способност генерализације за податке у различитим аудио форматима. * је зато што у поређењу са оригиналном методом, СПП за СПП-ИОЛО-в4 садржи више слојева, али такође повећава време обраде.
6.4. Поређење резултата теста. Табела 3 даје резултате губитка тренинга, мАП-а и тако даље за све категорије након 8000 рунди тренинга. Може се видети да модел обуке предложеног метода може ефикасно да идентификује аудио типове. Има одређене предности у тачности, стопи присјећања и Ф1 резултату, а његова вриједност губитка је такође најнижа од свих метода, само 0,0122. *Стога су стабилност и тачност предложене методе боље. * је углавном због високе резолуције и пријемног поља (РФ) СПП-ИОЛО-в4, а додавање СПП модула у слој повезивања задржава предности које доноси СПП. Што се тиче времена обуке, СПП-ИОЛО-в4 је само нешто више од ГММ. *е ЦНН треба да обучи много операција конволуције, тако да је његово време обуке дуже.

Коначно, експеримент користи податке из 12 различитих аудио формата за тестирање и упоређивање четири методе. Табела 4 даје вредности тачности испитивања и времена тестирања. Може се видети да је просечна тачност методе предложене у овој студији 99.0%, а просечно време детекције је 0.449сс. *Дакле, предложени метод постиже боље перформансе међу четири упоређене методе. Може се закључити да је повећање узорковања и максимално удруживање СПП-ИОЛО-в4 донело значајне користи. Максимално обједињавање бира максималну вредност из суседних области да би се мало избрисао неки шум максималне фреквенције у аудио секвенци. *Стога, конволуционо подузорковање може боље да се користи у следећем слоју узорковања. *Уз ове предности, СПП може побољшати перформансе окосне мреже.

7. Закључци
*ис студија представља систем за препознавање звука погодан за окружење за наставу музике. Користите СПП да побољшате ИОЛО-в4 мрежну архитектуру, односно користите СПП да изаберете локалне области на различитим скалама истог конволуционог слоја да бисте научили карактеристике система са више нивоа. Поред тога, метода слагања у ансамблном учењу се користи за спајање независних подмодела два различита канала. * Експериментални резултати показују да предложена метода може побољшати тачност препознавања аудио типова и има боље перформансе за различите формате аудио датотека. Због ограничења услова снимања звука, постоји неколико типова звука у експерименталном скупу података, а перформансе класификације аудио датотека снимљених различитим уређајима тек треба да буду верификоване. У будућности ће бити спроведено више тестова о ова два питања.
Доступност података
*Подаци који се користе као подршка налазима ове студије доступни су од одговарајућег аутора на захтев.
Сукоби интереса
*Аутори изјављују да немају сукоб интереса.
Референце
[1] С. Ву, Д. Зханг, З. Зханг, Н. Ианг, М. Ли и М. Зхоу, „Неурално машинско превођење зависности од зависности“, ИЕЕЕ/АЦМ трансакције о звуку, говору и језику Обрада, књ. 26, бр. 11, стр. 2132–2141, 2018.
[2] Ј. Зоу, В. Ли, Ц. Цхен и К. Ду, "Класификација сцене користећи локалне и глобалне карактеристике са фузијом колаборативног представљања", Информатион Сциенцес, вол. 348, бр. 2, стр. 209–226, 2016.
[3] Х. Пхан, Л. Хертел, М. Маасс, П. Коцх, Р. Мазур и А. Мертинс, „Побољшана класификација аудио сцена заснована на уграђивању стабла етикета и конволуционих неуронских мрежа,“ ИЕЕЕ/АЦМ трансакције на Обрада звука, говора и језика, књ. 25, бр. 6, стр. 1278–1290, 2017.
[4] С. Баиатли, "Ненадгледано пондерисање правила преноса у машинском превођењу заснованом на правилима користећи приступ максималне ентропије", Јоурнал оф Информатион Сциенце анд Енгинееринг, вол. 36, бр. 2, стр. 309–322, 2020.
[5] А. Ракотомамоњи, "Учење надзираног представљања за класификацију аудио сцене," ИЕЕЕ/АЦМ Трансакције о аудио, говорној и језичкој обради, вол. 25, бр. 6, стр. 1253–1265, 2017.
[6] В. Ианг и С. Крисхнан, "Комбиновање временских карактеристика помоћу локалног бинарног обрасца за класификацију акустичне сцене", ИЕЕЕ/АЦМ Трансацтионс он Аудио, Спеецх, анд Лангуаге Процессинг, вол. 25, бр. 6, стр. 1315–1321, 2017.
[7] АС Дхањал и В. Сингх, "Систем аутоматског машинског превођења за вишејезични говор на индијски знаковни језик," Мултимедијални алати и апликације, вол. 81, бр. 3, стр. 4283–4321, 2021.
[8] МА . Аламир, "Нови модел класификације акустичне сцене који користи касну фузију конволуционих неуронских мрежа и различитих класификатора ансамбла", Апплиед Ацоустицс, вол. 172, бр. 3, стр. 112–122, 2020.
[9] ЈГ Макин, ДА Мосес, и ЕФ Цханг, "Машинско превођење кортикалне активности у текст са оквиром енкодер-декодер", Натуре Неуросциенце, вол. 23, бр. 4, стр. 575–582, 2020.
[10] С. Валдекар и Г. Саха, "Двостепена класификација акустичне сцене заснована на фузији", Апплиед Ацоустицс, вол. 170, бр. 5, ИД чланка 107502, 2020.
For more information:1950477648nn@gmail.com






