Badania nad rozpoznawaniem dźwięku w oparciu o głęboką sieć neuronową w nauczaniu muzyki
Oct 10, 2023
Solfeggio jest ważnym kursem podstawowym dla kierunków muzycznych, a szkolenie w zakresie rozpoznawania dźwięku jest jednym z ważnych ogniw. Wraz z poprawą wydajności komputera rozpoznawanie dźwięku stało się szeroko stosowane w inteligentnych urządzeniach do noszenia. W ostatnich latach rozwój głębokiego uczenia się przyspieszył proces badawczy rozpoznawania dźwięku. Jednakże w środowisku nauczania muzyki występuje dużo zakłóceń dźwięku, co prowadzi do wydajności zajęć audio… hm, które nie są w stanie sprostać rzeczywistym wymaganiom. Aby rozwiązać ten problem, zaproponowano ulepszony system rozpoznawania dźwięku oparty na YOLO-v4, który głównie poprawia strukturę sieci.
Śpiew wzrokowy i kształcenie słuchu są nierozerwalnie związane z pamięcią. W procesie uczenia się muzyki bardzo ważną umiejętnością jest śpiew i kształcenie słuchu. Celem kształcenia słuchu w zakresie śpiewu wzrokowego jest umożliwienie uczniom ćwiczenia umiejętności muzycznych i pamięci poprzez słuchanie i śpiewanie określonych nut.
Główne treści kształcenia słuchu metodą śpiewu wzrokowego obejmują wysokość dźwięku, rytm, głos, melodię, harmonię itp. Dzięki ćwiczeniu słuchu polegającego na śpiewaniu wzrokowym możemy w sposób ciągły ćwiczyć uszy, co pozwala nam dokładniej identyfikować różne nuty i rytmy oraz szybko je konwertować. nuty, które słyszymy, przekształcamy w symbole na mapie muzycznej, poprawiając w ten sposób naszą zdolność zapamiętywania.
Śpiew wzrokowy i kształcenie słuchu mogą również pomóc nam lepiej zrozumieć i opanować prawa muzyki. Kiedy używamy naszych uszu do bezpośredniego odczuwania i rozumienia muzyki, możemy głębiej zrozumieć rytm i melodię muzyki, dzięki czemu szybciej poprawiamy zdolność zapamiętywania.
Ponadto śpiew wzrokowy i kształcenie słuchu mogą również pomóc nam rozwinąć dobre wyczucie muzyki i silne emocje muzyczne. Dzięki treningowi nasze zrozumienie i odczuwanie muzyki stanie się coraz głębsze, co poprawi naszą miłość i uznanie dla muzyki.
Pamięć jest bardzo ważnym czynnikiem w procesie uczenia się muzyki. Dobra pamięć jest jednym z niezbędnych warunków nauki każdego instrumentu i komponowania muzyki. Poprzez śpiew wzrokowy i trening słuchu możemy poprawić naszą pamięć oraz lepiej opanować techniki i umiejętności muzyczne. W obliczu złożonego repertuaru szybciej zapamiętujemy nuty i rytmy, co pomaga nam lepiej wykonywać utwory muzyczne.
Krótko mówiąc, kształcenie słuchu i pamięć śpiewu wzrokowego są nierozłączne i wzajemnie się uzupełniają. Dzięki ciągłemu ćwiczeniu śpiewu wzrokowego i kształcenia słuchu możemy doskonalić nasze umiejętności muzyczne i zdolności pamięci, aby lepiej opanować muzykę. Widać, że musimy poprawić pamięć, a Cistanche desericola może znacznie poprawić pamięć, ponieważ Cistanche desericola to tradycyjny chiński materiał leczniczy, który ma wiele unikalnych efektów, z których jednym jest poprawa pamięci. Skuteczność mięsa mielonego wynika z różnych zawartych w nim składników aktywnych, w tym kwasów, polisacharydów, flawonoidów itp. Składniki te mogą na różne sposoby promować zdrowie mózgu.

Kliknij i poznaj sposoby na poprawę funkcjonowania mózgu
Po pierwsze, liczba cepstrum częstotliwości Mel jest używana do przetwarzania oryginalnego dźwięku i wyodrębniania odpowiednich cech. pl, spróbuj zastosować model YOLO-v4 w …obszarze głębokiego uczenia się do …rozpoznawania dźwięku i udoskonal go, łącząc go z modułem puli piramid przestrzennych, aby wzmocnić zdolność uogólniania danych w różnych formatach audio. Po drugie, metoda zestawiania w uczeniu zespołowym służy do łączenia niezależnych podmodeli dwóch różnych kanałów. Wyniki eksperymentów pokazują, że w porównaniu z innymi technologiami głębokiego uczenia się ulepszony model YOLO-v4 może poprawić wydajność rozpoznawania dźwięku i ma lepszą wydajność w przetwarzaniu danych w różnych formatach audio, co wykazuje lepszą zdolność generalizacji.
1. Wstęp
Muzyka jest abstrakcyjną formą sztuki, której środkiem wyrazu jest dźwięk. W procesie nauczania muzyki solfeggio może wzmacniać pamięć muzyczną uczniów, umożliwiać im trafną identyfikację utworów muzycznych, a co za tym idzie uzyskanie lepszej „percepcji muzycznej”. Jako ważne ogniwo w solfeggio, szkolenie w zakresie rozpoznawania dźwięku jest bardzo trudne dla młodszych uczniów. Dzieje się tak dlatego, że uczniowie muszą opanować wszystkie rodzaje kluczy, rozróżnić długość i czas trwania różnych nut oraz różnicę wysokości między różnymi nutami.
Analiza sygnału audio w oparciu o wbudowane inteligentne urządzenia przyciąga coraz większą uwagę badaczy [1–7]. Inteligentne urządzenia do noszenia z funkcjami rozpoznawania dźwięku mogą pomóc uczniom rozwiązać powyższe problemy i uzyskać pomoc w nauczaniu muzyki. Zadanie rozpoznawania dźwięku wymaga wstępnego przetworzenia zebranych sygnałów audio… odpoczynku, wydobycia z nich cennych cech umożliwiających odróżnienie partytur muzycznych i… ostatecznie sklasyfikowania ich według tych cech. Klasyfikacja jest bardzo ważną metodą eksploracji danych [8–10]. Klasyfikacja odnosi się do generowania funkcji klasycznej…kationu według określonych zasad w oparciu o dane zbioru uczącego. Ta funkcja może przypisać dane zbioru testowego do jednej z podanych kategorii, realizując w ten sposób przewidywanie kategorii nieznanych danych. Obecnie popularne klasyki obejmują drzewa decyzyjne, regresję logistyczną, maszynę wektorów nośnych (SVM), Naive Bayes, algorytm k-najbliższego sąsiada (KNN), sieć neuronową BP i głębokie uczenie się [11–13].
Poprzednie metody uczenia maszynowego często wymagały ręcznego wyodrębnienia funkcji, które mogą reprezentować oryginalne dane jako dane wejściowe klasy… hm. Jednak głębokie uczenie się może automatycznie wyodrębnić wielowymiarowe cechy próbek (bez ręcznej ekstrakcji cech), o ile dane wejściowe w jak największym stopniu pokrywają informacje z oryginalnych danych, co jest odpowiednie w przypadku danych o dużej skali. *Metoda głębokiego uczenia się może realizować określone zadania rozpoznawania dźwięku przy pomocy dużej ilości danych audio zebranych przez inteligentne urządzenia. *Konwolucyjna sieć neuronowa (CNN), jako rodzaj architektury głębokiego uczenia się, jest szeroko stosowana w klasyfikacji obrazów, rozpoznawaniu mowy, przetwarzaniu języka naturalnego i innych dziedzinach ze względu na doskonałą wydajność w lokalnym uczeniu się cech [14]. W odróżnieniu od innych modeli sieci neuronowych (takich jak maszyna Boltzmanna i rekurencyjna sieć neuronowa), CNN charakteryzuje się tym, że podstawową operacją jest operacja splotu. *Sieć YOLO czerpie wnioski ze struktury sieci klasyfikacyjnej CNN i wykazuje dobre zalety w zakresie rozpoznawania obrazów, co przyciągnęło uwagę wielu badaczy.
*Dlatego w tym badaniu podjęto próbę zastosowania modelu YOLO-v4 w dziedzinie rozpoznawania dźwięku i ulepszenia struktury sieci. Ponadto metoda układania w uczeniu zespołowym jest wykorzystywana do łączenia dwóch niezależnych podmodeli różnych kanałów, a wydajność klasyfikacji połączonego systemu jest jeszcze lepsza w porównaniu z pojedynczym podmodelem.
2. Prace powiązane
Obecnie, wraz z pojawieniem się dużej liczby inteligentnych urządzeń, doskonała wydajność komputera i rozwój technologii głębokiego uczenia się wspólnie promują proces badawczy w dziedzinie audio. W połączeniu z główną treścią badawczą tego badania, obecny stan badań zostanie przedstawiony w dwóch aspektach: splotowej sieci neuronowej i rozpoznawania dźwięku.
*Struktura splotowej sieci neuronowej powstała w wyniku badania Yanna LeCuna z 1998 r. zwanego sztuczną siecią neuronową Le Net-5. *Konwolucyjna sieć neuronowa, podobnie jak inne sieci neuronowe, może być trenowana za pomocą algorytmu propagacji wstecznej [15]. W 2012 roku Alex Krizhevsky i inni po raz pierwszy zastosowali technologię CNN w złożonych zadaniach związanych z wizją komputerową. Wykorzystując 3 w pełni połączone warstwy, 5 warstw splotu i klasyfikator Softmax, konstruowana jest splotowa sieć neuronowa z 8 warstwami, którą nazwano AlexNet. AlexNet wykorzystuje funkcję aktywacji ReLU, a jednocześnie wykorzystuje regularyzację (dropout), aby zapobiec nadmiernemu dopasowaniu. W 2014 roku zespół ds. wizji komputerowej Google zaproponował sieć GoogLeNet [16] o głębokości sieci 22 warstw, która zawiera nową strukturę, incydent. Łączy w sobie cechy różnych głębokości i tej samej skali, a dokładność wykrywania jest poprawiona. W oparciu o sieć GoogLeNet pojawiły się algorytmy YOLO i SSD. Obie metody opierają się na jednej kompleksowej sieci, która może uzupełnić dane wejściowe z oryginalnego obrazu na dane wyjściowe dotyczące pozycji i kategorii obiektu.
W aspekcie rozpoznawania dźwięku Yang i Zhao [17] zaproponowali metodę klasyfikacji scen akustycznych opartą na maszynie wektorów nośnych (SVM), która poprawiała teksturę dźwięku w celu poprawy dokładności klasyfikacji. Greco i in. [18] zaproponowali system rozpoznawania głosu oparty na heurystycznej metodzie głębokiego uczenia się. Demir i in. [19] zaproponowali nową metodę kaskady piramidalnej CNN do klasyfikacji dźwięków środowiskowych. Zhu i in. [20] zaproponowali ulepszony algorytm YOLO-v4 dla instrumentów do obrazowania dźwięku, który skutecznie poprawił dokładność wykrywania obrazu chmury fazy akustycznej. * Wszystkie powyższe metody wykazują doskonałą wydajność w przypadku zadań rozpoznawania dźwięku w pojedynczej scenie akustycznej, ale w środowisku nauczania muzyki występuje wiele zakłóceń dźwięku i konieczne jest radzenie sobie z wieloma różnymi danymi w formacie audio.
*Dlatego w tym badaniu zaproponowano system rozpoznawania dźwięku oparty na ulepszonym modelu sieci YOLO-v4. *Główne innowacje i wkład obejmują: (1) próbę zastosowania architektury sieciowej YOLO-v4, która jest doskonała w dziedzinie głębokiego uczenia się, w dziedzinie rozpoznawania dźwięku i ulepszenia jej poprzez połączenie modułu puli piramidy przestrzennej. *ulepszona architektura sieciowa YOLO-v4 skutecznie wykorzystuje informacje przestrzenne zawarte w plikach audio, wzmacniając w ten sposób zdolność uogólniania danych w różnych formatach audio. (2) *Metoda zestawiania w uczeniu zespołowym jest wykorzystywana do łączenia dwóch niezależnych podmodeli różnych kanałów, co poprawia wydajność klasyfikacji połączonego systemu.
3. Ekstrakcja i przetwarzanie cech audio
Wyodrębnienie najlepszej reprezentacji parametrów sygnału audio jest jednym z ważnych zadań zapewniających lepszą wydajność rozpoznawania. *e Ekstrakcja cech na tym etapie jest bardzo ważna dla klasyfikacji klasyfikatora w kolejnym etapie, ponieważ będzie miała bezpośredni wpływ na efektywność klasyfikacji.
W zadaniu klasyfikacyjnym, zwłaszcza w zadaniu klasyfikacji dźwięku, współczynnik cepstrum częstotliwości Mel (MFCC), który opisuje kształt widmowy, ma długą historię. Chociaż proces ekstrakcji MFCC spowoduje stratną kompresję danych, jego klasyfikacja i efekt rozpoznawania są całkiem dostępne nawet przy bardzo małej szybkości transmisji danych. Ponadto, w porównaniu z innymi cechami klasyfikacyjnymi, MFCC jest szeroko stosowany, ponieważ jest bardziej zgodny z krzywą odpowiedzi częstotliwościowej słuchu ludzkiego.

*Powodem, dla którego ludzie potrafią oceniać różne środowiska w złożonych środowiskach dźwiękowych, jest zasługa ślimaka. *Ślimak można postrzegać jako bank filtrów pomagający ludziom filtrować dźwięk o częstotliwości 20-20 kHz. *Problem polega na tym, że wrażliwość ślimaka na częstotliwości z zakresu słuchowego nie jest liniowa, ale istnieje zależność mapowania. MFCC może symulować charakterystykę częstotliwościową ludzkiego ucha. Ekstrakcja cech MFCC składa się z siedmiu etapów, a cały proces pokazano na rysunku 1.
Typowe sygnały audio charakteryzują się tym, że energia o niskiej częstotliwości jest duża, ale energia o wysokiej częstotliwości jest mała. Jeżeli jest transmitowany bezpośrednio, prowadzi to do wysokiego stosunku sygnału do szumu przy niskich częstotliwościach i niewystarczającego stosunku sygnału do szumu przy wysokich częstotliwościach. Aby zrekompensować tę utratę sygnału audio podczas transmisji, wprowadza się preemfazę w celu kompensacji sygnału wejściowego, tak aby można było podkreślić charakterystykę wysokiej częstotliwości sygnału audio. Preemfazę uzyskuje się zwykle za pomocą filtra górnoprzepustowego [21–23].

Ramkowanie dzieli próbki audio uzyskane w wyniku konwersji analogowo-cyfrowej (ADC) na małe klatki o długości w zakresie 20–40 milisekund. Po zakończeniu preemfazy i kadrowania konieczne jest dodanie okna Hamminga do każdej klatki. Okienkowanie polega na kontrolowaniu ilości przetwarzanych danych i jednocześnie przetwarzane są tylko dane znajdujące się w oknie. *zakres częstotliwości w widmie szybkiej transformacji Fouriera jest bardzo szeroki, co powoduje, że sygnał mowy nie przebiega zgodnie ze skalą liniową [24–26]. *dlatego konieczne jest przepuszczenie banku filtrów skali Mel, jak pokazano na rysunku 2.
Rysunek 2 przedstawia zestaw filtrów trójkątnych, które służą do obliczenia sumy ważonej składowych widmowych filtrów, tak aby przetworzony wynik był zbliżony do skali Mel. * Odpowiedź amplitudowo-częstotliwościowa każdego filtra jest trójkątna. *e Widmo Mel dla danej częstotliwości f oblicza się w następujący sposób:

13 cech różniczkowych pierwszego rzędu reprezentuje zmiany pomiędzy klatkami cepstrum w cechach różniczkowych MFCC, podczas gdy 39 cech różniczkowych drugiego rzędu reprezentuje zmiany pomiędzy klatkami w cechach różniczkowych pierwszego rzędu. *różnicę pierwszego rzędu oblicza się w następujący sposób:

4. Struktura sieci SPP-YOLO-v4
4.1. Moduł piramidy przestrzennej (SPP). SPP może uniknąć zniekształceń informacji spowodowanych skalowaniem, rozciąganiem, przycinaniem i innymi operacjami oraz zapewnia dane wyjściowe, na które nie ma wpływu rozmiar wejściowy, czego nie można osiągnąć za pomocą technologii łączenia okien przesuwnych [27]. Po drugie, SPP może łączyć wiele skal, podczas gdy łączenie przesuwanych okien wykorzystuje tylko jedną skalę okna. *Podstawowa struktura modułu SPP pokazana jest na rysunku 3. Można zauważyć, że ze względu na elastyczność rozmiaru sygnału wejściowego, SPP może łączyć cechy danych w różnych formatach audio. *Wymiar przekształconego wektora cech jest taki sam jak w pełni połączonej warstwy, łagodząc przy tym problem uogólnienia.
4.2. SPP-YOLO-v4. YOLO-v4 to wysoce precyzyjny, jednoetapowy algorytm wykrywania w czasie rzeczywistym, integrujący YOLO-v1, YOLO-v2 i YOLO-v3. YOLO-v4 konstruuje międzystopniową sieć częściową CSP (CSPNet) w module resztkowym, w którym warstwa obiektowa jest wejściem, a informacja o cechach wyższej warstwy jest wyjściem. *pokazuje, że cele nauczania YOLO-v4 w module ResNet różnią się pomiędzy danymi wyjściowymi i wejściowymi. * Dlatego realizowane jest uczenie się resztkowe, a parametry modelu są redukowane, co zwiększa zdolność uczenia się funkcji. Biorąc pod uwagę środowisko aplikacji nauczania muzyki, wprowadzono pewne zmiany w oparciu o oryginalną sieć, a ostateczną strukturę sieci pokazano na rysunku 4.
Najpierw warstwa obiektowa jest splatana trzykrotnie, a następnie wejściowa warstwa obiektowa jest maksymalnie łączona w pulę przy użyciu maksymalnej puli rdzeni o różnych rozmiarach. Po splocie i upsamplingu różne warstwy funkcji są łączone szeregowo w celu uzyskania fuzji funkcji. *en, wykonaj downsampling, skompresuj wysokość i szerokość, a na koniec połącz z poprzednią warstwą obiektową, aby uzyskać większą fuzję funkcji (5 razy). *Moduł klasyfikacji wykorzystuje funkcje wyodrębnione z sieci do dokonywania ocen klasyfikacyjnych. Weźmy jako przykład siatkę 13 × 13, która jest równa podzieleniu wejściowego spektrogramu Mel na kwadraty 13 × 13; wówczas każdy kwadrat będzie wstępnie ustawiony trzema wcześniejszymi klatkami. * Wyniki klasyfikacji sieci dostosują pozycje tych trzech poprzednich bloków i ostatecznie przefiltrują według algorytmu tłumienia niemaksymalnego (NMS) [28], aby uzyskać ostateczne wyniki klasyfikacji.

5. System rozpoznawania dźwięku oparty na SPPYOLO-v4
5.1. Architektura systemu. Jak pokazano na rysunku 5, po wprowadzeniu sygnału audio proponowany system rozpoznawania dźwięku najpierw dzieli dane sekwencji audio na dwie części. *Pierwsza część pochodzi z kanału stereo, druga część jest skompresowana do formatu mono. *Sygnały audio obu kanałów są wyodrębniane za pomocą spektrogramu MFCC i wprowadzane do modelu SPP-YOLO-v4 jako funkcje. *pl, zintegrowane są dwie grupy modeli SPP-YOLO-v4, a w integracji przyjęto metodę układania w stosy. Po zintegrowanym nauczeniu się obu modeli, wyniki klasyfikacji audio są ostatecznie wyprowadzane. *szczegóły modelu SPP-YOLO-v4 przedstawiono na rysunku 4.
5.2. Układanie zintegrowanego uczenia się. Jak pokazano na rysunku 5, system wykorzystuje technologię uczenia zespołowego, aby uzyskać ostateczny wynik klasyfikacji. *Podstawową ideą uczenia się zespołowego jest utworzenie silnego klasyfikatora poprzez połączenie kilku słabych klasyfikatorów. Nawet jeśli niektóre słabe klasyfikatory dokonają błędnych przewidywań, można je skorygować innymi słabymi klasyfikatorami z poprawnymi przewidywaniami, uzyskując w ten sposób efekt poprawy wydajności systemu.
Zakładając, że x jest wejściem, mi (i � 1, 2,..., k) jest grupą klasyfikatorów, a wyjściem klasyfikatorów jest rozkład prawdopodobieństwa mi (x, cj) każdej klasy cj (i � 1, 2, . . . , k), wynik końcowy y(x) zintegrowanego klasyfikatora można wyrazić jako


cel klasyfikacji. Obecnie popularne algorytmy uczenia się zespołowego obejmują układanie w stosy, pakowanie, wzmacnianie, wybór zespołu i tak dalej. * Algorytm uczenia zespołowego wybrany w tym badaniu to metoda układania w stosy.
Układanie w stosy to proces uczenia się drugiego rzędu, którego dane wejściowe stanowią wynik procesu uczenia się pierwszego rzędu, znany również jako „meta-uczenie się”. *Metoda układania stała się popularną metodą uczenia zespołowego, nie tylko dlatego, że jej wdrożenie jest dość proste, ale także dlatego, że może znacząco poprawić zdolność systemu do generalizacji, co jest bardzo zgodne z celem tego badania. *Podstawową zasadę metody układania w stosy pokazano na rysunku 6.
6. Analiza eksperymentu i wyników
6.1. Środowisko eksperymentalne i zbiór danych. *Platforma sprzętowa objęta tym badaniem to procesor Intel Core i3-M350 @ Dualcore 2,20 GHz, 8 GB pamięci DDR2, procesor graficzny Nvidia RTX2080Ti i 11 GB pamięci wideo. *Zintegrowane narzędzie programistyczne PyCharm zostało opracowane w języku Python 3.5.0. *e Struktura adnotacji YOLO napisana w Pythonie służy do konwersji formatu liczbowego, tak aby mógł być odczytany przez YOLO. *Metody porównawcze to model mieszaniny Gaussa (GMM), CNN i R-CNN.

*Eksperymentalny zbiór danych to nagrane pliki audio w rzeczywistym środowisku dydaktycznym. *Zbiór danych składa się z typów audio czterech różnych etykiet (D1, D2, D3 i D4). Wszystkie pliki audio są cięte na 30-sekundowe klipy. *Istnieje 12 formatów plików audio, w tym MPEG, MP3 i WMA. Każde nagranie odbywa się w innym miejscu, a średni czas nagrania wynosi 3–5 minut. *Sprzęt nagrywający obejmuje dwukanałowy mikrofon douszny Soundman OKM II Classic/studio A3 i rejestrator przebiegów Roland Edirol R09 z częstotliwością próbkowania 44,1 kHz i rozdzielczością 24-bitową.
*Wykorzystany zbiór danych zawiera 1404 plików audio, a liczba plików audio każdego typu wynosi 351. Około 70% danych służy do uczenia modelu rozpoznawania dźwięku, a pozostałe 30% służy do testowania. *Ustawienia systemu podano w Tabeli 1.


6.3. Weryfikacja wydajności SPP-YOLO-v4. Aby zweryfikować wpływ proponowanego ulepszonego YOLO-v4 (SPP-YOLO-v4) na zdolność generalizacji, porównuje się go z tradycyjnym modelem YOLO-v4. W eksperymencie wybrano 3 z 12 formatów plików audio: MPEG, MP3 i WMA. *Zdolność uogólniania SPP-YOLOv4 podano w Tabeli 2.
Z Tabeli 2 można stwierdzić, że ogólna dokładność SPP-YOLO-v4 jest wyższa niż tradycyjnego YOLO-v4, co weryfikuje jego zdolność do uogólniania danych w różnych formatach audio. *wynika z tego, że w porównaniu z pierwotną metodą SPP SPP-YOLO-v4 zawiera więcej warstw, ale zwiększa również czas przetwarzania.
6.4. Porównanie wyników testów. Tabela 3 przedstawia wyniki strat treningowych, mAP itd. dla wszystkich kategorii po 8000 rundach treningu. Można zauważyć, że model szkoleniowy proponowanej metody pozwala skutecznie identyfikować typy audio. Ma pewne zalety w zakresie dokładności, szybkości przypominania i wyniku F1, a jego wartość strat jest również najniższa ze wszystkich metod, tylko 0,0122. * Dlatego stabilność i dokładność proponowanej metody są lepsze. *wynika głównie z wysokiej rozdzielczości i pola recepcyjnego (RF) SPP-YOLO-v4, a dodanie modułu SPP w warstwie łączącej zachowuje zalety SPP. Pod względem czasu szkolenia SPP-YOLO-v4 jest tylko nieznacznie większy niż GMM. *CNN musi trenować wiele operacji splotu, więc czas szkolenia jest dłuższy.

Na koniec w eksperymencie wykorzystano dane z 12 różnych formatów audio do przetestowania i porównania czterech metod. W tabeli 4 przedstawiono wartości dokładności i czasu badania. Można zauważyć, że średnia dokładność metody zaproponowanej w tym badaniu wynosi 99,0%, a średni czas detekcji wynosi 0,449ss. *Dlatego proponowana metoda osiąga lepszą wydajność spośród czterech porównywanych metod. Można stwierdzić, że upsampling i maksymalne łączenie SPP-YOLO-v4 przyniosło znaczne korzyści. Maksymalne łączenie wybiera maksymalną wartość z sąsiednich obszarów, aby nieznacznie usunąć część szumu o maksymalnej częstotliwości z sekwencji audio. * Dlatego też podpróbkowanie splotowe może być lepiej obsługiwane w kolejnej warstwie próbkowania. *Dzięki tym zaletom SPP może poprawić wydajność sieci szkieletowej.

7. Wnioski
*w badaniu przedstawiono system rozpoznawania dźwięku odpowiedni dla środowiska nauczania muzyki. Użyj SPP, aby ulepszyć architekturę sieci YOLO-v4, to znaczy użyj SPP, aby wybrać obszary lokalne w różnych skalach tej samej warstwy splotu, aby poznać charakterystykę systemu wieloskalowego. Ponadto metoda układania w uczeniu zespołowym służy do łączenia niezależnych podmodeli dwóch różnych kanałów. *Wyniki eksperymentów pokazują, że proponowana metoda może poprawić dokładność rozpoznawania typów audio i zapewnia lepszą wydajność w przypadku różnych formatów plików audio. Ze względu na ograniczenia warunków nagrywania dźwięku w eksperymentalnym zbiorze danych występuje niewiele typów plików audio, a skuteczność klasyfikacji plików audio nagranych przez różne urządzenia nie została jeszcze zweryfikowana. W przyszłości zostaną przeprowadzone dalsze testy dotyczące tych dwóch kwestii.
Dostępność danych
*Dane wykorzystane do poparcia wyników tego badania są dostępne na żądanie u odpowiedniego autora.
Konflikt interesów
*Autorzy oświadczają, że nie mają konfliktu interesów.
Bibliografia
[1] S. Wu, D. Zhang, Z. Zhang, N. Yang, M. Li i M. Zhou, „Neuronowe tłumaczenie maszynowe zależności od zależności”, IEEE/ACM Transactions on Audio, Speech, and Language Przetwarzanie, tom. 26, nie. 11, s. 2132–2141, 2018.
[2] J. Zou, W. Li, C. Chen i Q. Du, „Klasyfikacja scen przy użyciu cech lokalnych i globalnych z fuzją reprezentacji opartej na współpracy”, Information Sciences, tom. 348, nie. 2, s. 209–226, 2016.
[3] H. Phan, L. Hertel, M. Maass, P. Koch, R. Mazur i A. Mertins, „Ulepszona klasyfikacja scen audio w oparciu o osadzanie drzewa etykiet i splotowe sieci neuronowe”, Transakcje IEEE/ACM na Przetwarzanie dźwięku, mowy i języka, tom. 25, nie. 6, s. 1278–1290, 2017.
[4] S. Bayatli, „Nienadzorowane ważenie reguł transferu w tłumaczeniu maszynowym opartym na regułach przy użyciu podejścia maksymalnej entropii”, Journal of Information Science and Engineering, tom. 36, nie. 2, s. 309–322, 2020.
[5] A. Rakotomamonjy, „Uczenie się nadzorowanej reprezentacji na potrzeby klasyfikacji scen audio”, IEEE/ACM Transactions on Audio, Speech, and Language Processing, tom. 25, nie. 6, s. 1253–1265, 2017.
[6] W. Yang i S. Krishnan, „Łączenie cech czasowych według lokalnego wzorca binarnego w celu klasyfikacji scen akustycznych”, IEEE/ACM Transactions on Audio, Speech, and Language Processing, tom. 25, nie. 6, s. 1315–1321, 2017.
[7] AS Dhanjal i W. Singh, „System automatycznego tłumaczenia maszynowego wielojęzycznej mowy na indyjski język migowy”, Multimedia Tools and Applications, tom. 81, nie. 3, s. 4283–4321, 2021.
[8] MA. Alamir, „Nowatorski model klasyfikacji scen akustycznych wykorzystujący późną fuzję splotowych sieci neuronowych i różnych klasyfikatorów zespołowych”, Applied Acoustics, tom. 172, nie. 3, s. 112–122, 2020.
[9] JG Makin, DA Moses i EF Chang, „Tłumaczenie maszynowe aktywności kory mózgowej na tekst za pomocą struktury kodera-dekodera”, Nature Neuroscience, tom. 23, nie. 4, s. 575–582, 2020.
[10] S. Waldekar i G. Saha, „Dwupoziomowa klasyfikacja scen akustycznych oparta na fuzji”, Applied Acoustics, tom. 170, nie. 5, nr artykułu 107502, 2020.
For more information:1950477648nn@gmail.com






