Nieprawidłowe wykrywanie w wideo Big Data dzięki ulepszonemu autoenkoderowi
Jul 12, 2023
1. Wstęp
Jako zadanie wizji komputerowej wysokiego poziomu, wykrywanie anomalii wideo odnosi się do automatycznego wykrywania nietypowych zdarzeń w danej sekwencji wideo, które może skutecznie rozróżniać nieprawidłowe i normalne działania oraz nieprawidłowe kategorie w wideo. W ciągu ostatnich kilku lat naukowcy przeprowadzili wiele badań związanych z wykrywaniem anomalii [1–9]. W porównaniu ze zwykłymi zdarzeniami zdarzenia, które występują rzadko lub mają niskie prawdopodobieństwo wystąpienia, są zwykle uważane za nienormalne. Jednak w praktyce ustalenie skutecznego modelu wykrywania anomalii jest trudne ze względu na nieznane typy zdarzeń i niejasne definicje anomalii. Większość istniejących metod wykrywania anomalii zaprojektowano w oparciu o założenie, że każdy wzorzec inny niż wyuczony wzorzec normalny jest traktowany jako anomalia. Na podstawie takich założeń ta sama czynność w różnych scenariuszach może być reprezentowana jako zdarzenia normalne lub nienormalne. Na przykład scena walki, w której dwie osoby walczą na ulicy, może zostać uznana za nienormalną, podczas gdy te dwie osoby są normalne podczas boksu. Ponadto w wielowymiarowych danych wideo występuje duża ilość nadmiarowych informacji wizualnych, co zwiększa trudność reprezentacji zdarzeń w sekwencji wideo.

Cistanche z chińskich ziół
Zgodnie z dotychczasowymi pracami, metody wykrywania anomalii można ogólnie podzielić na dwa rodzaje. Niektóre metody wykrywania anomalii są projektowane na podstawie błędów rekonstrukcji, które koncentrują się na modelowaniu normalnych wzorców w sekwencjach wideo [3–5, 7, 8, 10, 11]. (metody te uczą się modelu reprezentacji cech wzorca normalnego w fazie uczenia i wykorzystują różnice między próbkami nieprawidłowymi i normalnymi do określenia ostatecznego wyniku nieprawidłowego danych testowych podczas fazy testowania, takiego jak błędy rekonstrukcji lub określone progi [7 –14]. Chociaż metody wykrywania anomalii oparte na rekonstrukcji są dobre w odtwarzaniu normalnych wzorców w sekwencjach wideo, kluczowym problemem związanym z tymi metodami jest to, że polegają one w dużej mierze na danych treningowych. Inny typ metody traktuje wykrywanie anomalii jako problem klasyfikacyjny [ 15, 16]. W przypadku tych metod wynik anomalii sekwencji wideo jest przewidywany przy użyciu przeszkolonego klasyfikatora w celu wyodrębnienia cech, takich jak histogram optycznego kolesia (HOF) lub dynamiczna tekstura (DT). (Wydajność tych metod jest wysoce zależy od próbek treningowych.Aby uzyskać zadowalającą wydajność, wyodrębnianie efektywnych i dyskryminujących cech jest niezbędne dla takich metod wykrywania anomalii [17–20]. Jednak te dwa typy metod zazwyczaj modelują relacje między zdarzeniami w stosunkowo prosty sposób [7, 10, 21–23]. Na przykład brana jest pod uwagę tylko zależność liniowa, co w wielu rzeczywistych przypadkach nie wystarcza w przypadku złożonych, wysoce nieliniowych relacji.

Cistanche życia na pustyni
W ostatnich latach metody oparte na uczeniu głębokim znalazły zastosowanie w dziedzinie detekcji wideo i poczyniły duże postępy [24–26]. Na przykład autoenkodery (AE) wykorzystują błędy rekonstrukcji do wykrywania anomalii i na tej podstawie udoskonalono szereg metod. Ponadto do rozwiązania problemu wykrywania anomalii zastosowano również generatywne sieci przeciwstawne (GAN) i pamięć długookresową (LSTM). Jednak AE może mieć silną zdolność uogólniania, co skutkuje zdolnością do rekonstrukcji nieprawidłowych zdarzeń. W [14] badacze zwrócili uwagę, że ponieważ nie ma nieprawidłowych próbek treningowych, rekonstrukcja nieprawidłowych próbek powinna być nieprzewidywalna, co może prowadzić do większych błędów rekonstrukcji nieprawidłowych próbek. Jeśli niektóre anomalie mają wspólny wzór składu z normalnymi danymi treningowymi lub dekoder jest „zbyt silny” i nie może dobrze zdekodować niektórych kodów anomalii, AE może dobrze zrekonstruować anomalię. Aby przezwyciężyć wady AE, w tym artykule wykorzystano moduł pamięci do wzmocnienia głębokiej AE i opracowano metodę AE wspomaganą pamięcią (Memory AE). Po wprowadzeniu nowej próbki testowej Memory AE nie zakoduje jej bezpośrednio i nie wprowadzi do dekodera, ale użyje jej jako zapytania w celu pobrania odpowiedniej zawartości z modułu pamięci. (en, treść jest agregowana i przekazywana do dekodera. (to proces jest realizowany przez adresowanie uwagi. Ponadto w tym artykule zastosowano różniczkowalne operatory kurczenia, aby wywołać rzadkie wagi adresowania pamięci, co może zachęcić zawartość pamięci do zbliżania się do zapytań w funkcji miejsca. Podczas fazy uczenia koder i dekoder aktualizują moduł pamięci w tym samym czasie, aby uzyskać niższy średni błąd rekonstrukcji. W fazie testowania wyuczona zawartość pamięci jest ustalana i używana jest niewielka ilość normalnych elementów pamięci do rekonstrukcji. Jeśli zostaną one wybrane jako sąsiedztwo kodu wejściowego, błąd rekonstrukcji będzie bardzo oczywisty. Eksperymenty na kilku publicznych zestawach danych porównawczych pokazują, że wydajność wykrywania Memory AE osiągnęła najnowocześniejszy poziom.

Główne składniki chemiczne Cistanche deserticola
2. Zasada algorytmu
Rysunek 1 przedstawia ogólną strukturę sieci Memory AE, która jest podzielona na trzy podstruktury: koder (używany do kodowania danych wejściowych i generowania zapytań), dekoder (używany do rekonstrukcji) oraz moduł pamięci (z pamięcią i powiązanymi operacjami adresowania). Jak pokazano na rysunku 1, biorąc pod uwagę testowane zdarzenie, koder najpierw uzyskuje swoją zakodowaną wartość. Wykorzystując zakodowaną wartość jako zapytanie, moduł pamięci pobiera najistotniejszą zawartość w module pamięci za pośrednictwem operatora adresowania opartego na uwadze, a następnie przekazuje ją do dekodera w celu odtworzenia. Podczas uczenia koder i dekoder optymalizują parametry, aby zminimalizować błąd rekonstrukcji, a jednocześnie aktualizują moduł pamięci, aby rejestrować prototypowe elementy zakodowanych normalnych danych. Biorąc pod uwagę próbkę testową, model używa tylko ograniczonych wzorców normalnych zapisanych w module pamięci do przeprowadzenia rekonstrukcji. W ten sposób rekonstrukcja jest zbliżona do normalnej próbki. Stąd błąd rekonstrukcji normalnej próbki jest mały, a błąd nienormalny jest duży.
Rysunek 1: (e flschemat blokowy proponowanej pamięci AE.

2.1. Kodery i dekodery. (e koder i dekoder to dwie części AE. (e pierwszy odwzorowuje dane wejściowe na przestrzeń cech w celu uzyskania zakodowanej wartości, a drugi rekonstruuje zakodowaną wartość na dane wejściowe. (e AE składa się z koder fw1 (·) i dekoder gw2 (·), co można wyrazić jako

gdzie x i x′ to odpowiednio wejście AE i zrekonstruowane wejście, z to wyniki kodowania x, a W1 i W2 oznaczają parametry kodera i dekodera, które można uzyskać minimalizując błąd rekonstrukcji między x i x′:

Rekonstruując błąd normalnej próbki [19, 20] w celu określenia, czy jest ona nienormalna, AE z powodzeniem wykorzystano do rozwiązania zadania wykrywania nienormalności. Jednak rekonstrukcja nieprawidłowych próbek powinna być nieprzewidywalna, co może skutkować większymi błędami rekonstrukcji w przypadku nieprawidłowych próbek. Aby rozwiązać ten problem, moduł pamięci został wprowadzony do AE w sekcji 2.2 i zaproponowano AE pamięci.
2.2. Moduł pamięci. (Proponowany sposób obejmuje moduł pamięci do rejestrowania prototypowego trybu kodowania i operację adresowania w celu uzyskania dostępu do modułu pamięci.
2.2.1. Reprezentacja oparta na uwadze. (e moduł uwagi jest zaprojektowany jako macierz M ∈ RN×C zawierająca N wektor czasu rzeczywistego. Dla uproszczenia załóżmy, że C jest wymiarem z; następnie niech Ζ � RC. Mając wektor wierszowy mi, ∀i ∈ [ N], gdzie [N] jest liczbą całkowitą od 1 do N. Każdy reprezentuje mi element pamięci, biorąc pod uwagę zestaw zapytań z ∈ RC, sieć pamięci uzyskuje λ z i odpowiada miękkim wektorem adresowym w ∈ R1×N jako co następuje:

gdzie w jest wektorem wierszowym, a suma wszystkich elementów wynosi 1, co oznacza wi, element w z i. (e wektor wagi w można otrzymać przez obliczenie z. Jak pokazano w równaniu (4), waga adresu musi być zbliżona do modułu pamięci w. (e parametr mieszany jest zdefiniowany jako N, maksymalna pojemność modułu pamięci. Chociaż jest to N, nie jest łatwo znaleźć najlepsze dla różnych zestawów danych, na szczęście Memory AE nie jest wrażliwa na ustawienie N. Wystarczająco, duże N można dobrze zastosować do każdego zestawu danych.
2.2.2. Uwaga dotycząca adresowania pamięci. W Memory AE moduł pamięci jest przeznaczony do szczegółowego rejestrowania oryginalnego trybu normalnego M fazy treningu. (e moduł pamięci jest zdefiniowany jako adresowalna zawartość pamięci, z⌢ , a jego schemat adresowania oblicza w, wagę uwagi, na podstawie podobieństwa między zapytaniem a elementem pamięci. Jak pokazano na rysunku 1, każdą wagę można obliczyć za pomocą operacja softmax wi:

gdzie d(·, ·) reprezentuje miarę podobieństwa. (czy papier definiuje to jako podobieństwo cosinusowe:

Podobnie jak w przypadku równań (4)–(6), moduł pamięci pobiera najbardziej podobny element pamięci, aby uzyskać reprezentację z. Ze względu na ograniczenia rozmiaru pamięci i rzadkie technologie adresowania, jednocześnie można zaadresować tylko niewielką liczbę elementów pamięci wewnętrznej. (dlatego efektywne zachowanie modułu pamięci można wyjaśnić w następujący sposób. W fazie uczenia dekoder w Memory AE jest ograniczony do używania bardzo niewielu adresowalnych elementów pamięci do rekonstrukcji, co wymaga efektywnego wykorzystania elementów pamięci. (dlatego , podczas rekonstrukcji należy zmusić moduł pamięci do zapisania najbardziej reprezentatywnego trybu prototypowego w wejściowym trybie normalnym. W fazie testowej, mając wytrenowaną pamięć, można odzyskać tylko normalny tryb w pamięci do rekonstrukcji. (dlatego , normalne próbki mogą być lepiej zrekonstruowane.I odwrotnie, zakodowana wartość nieprawidłowego wejścia może zostać zastąpiona odzyskanym normalnym wzorcem, co skutkuje dużym błędem rekonstrukcji w nieprawidłowej próbce.
2.3. Szkolenie. Biorąc pod uwagę zestaw danych zawierający próbki xi? ?TI.1, niech xi' oznacza próbki rekonstrukcji xi w próbkach treningowych; minimalna refaktoryzacja jest wykonywana w następujący sposób:

(norma e l2 jest używana do pomiaru błędu rekonstrukcji; wi′ reprezentuje wagę adresowania pamięci każdej próbki xi. W celu dalszego promowania rzadkości w′, rzadka regularyzacja jest minimalizowana podczas uczenia. Biorąc pod uwagę, że wszystkie w′ są nieujemne i ‖w′‖1 � 1, problem optymalizacyjny tworzy się następująco:

Łącząc funkcję utraty z równania (7) i równania (8), funkcja celu pamięci AE jest następująca:

oto hiperparametr w procesie szkolenia. W praktyce jest ustawiony na 0.0002. W procesie uczenia pamięć jest aktualizowana poprzez wsteczną propagację i opadanie gradientu. W przypadku propagacji wstecznej tylko gradient elementu pamięci z niezerową wagą adresowania może być niezerowy.
2.4. Test. Po wytrenowaniu modelu błąd rekonstrukcji piksela w pozycji (x, y) ramy zębów t można obliczyć za pomocą następującego równania:

gdzie h(·) reprezentuje cały model. Biorąc pod uwagę błąd rekonstrukcji na poziomie pikseli dziesiątej klatki, błąd rekonstrukcji całej klatki obrazu można uzyskać, sumując e(t) � . (x,y)e(x,y,t). (en, wynik anomalii ramki można obliczyć w następujący sposób:

Na koniec można ustawić próg, aby określić, czy jest on nienormalny, ponieważ s ( t ) > θ.
3. Eksperymentuj
W tej części zweryfikowano skuteczność proponowanej metody i porównano ją z innymi istniejącymi metodami. Obecnie do eksperymentów wykorzystywane są dwa publiczne zestawy danych, tj. zestaw danych Avenue i zestaw danych ShanghaiTech. (pole powierzchni pod krzywą na poziomie ramki (AUC) i EER są stosowane jako ilościowe wskaźniki oceny.
3.1. Przygotowanie. (Zbiór danych Avenue wykorzystuje stałą kamerę o rozdzielczości 640 × 360 pikseli do przechwytywania i rejestrowania działań ulicznych Uniwersytetu Miejskiego w Hongkongu. (Zbiór danych Inteligencja obliczeniowa i neuronauka 3 obejmuje 16 klipów szkoleniowych zawierających normalne ludzkie zachowanie i 21 testowe klipy wideo zawierające nienormalne zdarzenia i zachowania ludzi. Ma łącznie 30652 klatki, a wszystkie filmy testowe mają adnotacje na poziomie docelowym, czyli prostokątny obszar służy do oznaczania anomalii w lokalizacjach przestrzennych. Normalne zachowanie to ludzie chodzący po chodniku, podczas gdy nienormalne zdarzenia to ludzie zaśmiecający/porzucający przedmioty, błąkający się, idący w kierunku kamery, chodzący po trawie i odrzucający przedmioty. (Zestaw danych ShanghaiTech jest bardzo wymagającym zbiorem do wykrywania nietypowych zdarzeń. W przeciwieństwie do innych zestawów danych zawiera 13 różnych sceny z różnymi warunkami oświetleniowymi i różnymi kątami kamery, w tym łącznie 330 filmów szkoleniowych i 107 filmów testowych (zestaw testowy zawiera łącznie 130 nietypowych zdarzeń z adnotacjami na poziomie pikseli. (e cały zbiór danych ma łącznie 316154 klatek, w tym 274515 klatek w zbiorze uczącym, 42883 klatek w zbiorze testowym i 17090 klatek w nieprawidłowej klatce. (e rozdzielczość każdej klatki wideo wynosi 480 × 856. (e model to przetestowane na platformie z platformą sprzętową NVIDIA GTX1080TI i 8 GB pamięci wideo, a środowiskiem oprogramowania jest PyTorch i Python 3.6. W celu zmierzenia skuteczności metody wykrywania anomalii wideo zaproponowanej w tym artykule, AUC na poziomie klatki Krzywa charakterystyki działania odbiornika (ROC) jest używana jako wskaźnik oceny. W przypadku wskaźników oceny na poziomie klatki, jeśli co najmniej jeden piksel klatki jest oznaczony jako nieprawidłowy, ramka jest uważana za nieprawidłową. A poziom AUC na poziomie klatki jest obliczany przez porównanie wynik wykrywania na poziomie ramki z poziomem ramki rzeczywistej etykiety.

Główne składniki chemiczne Cistanche deserticola
Kliknij tutaj, aby zobaczyć produkty Cistanche
【Zapytaj o więcej】 E-mail: cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
3.2. Zestaw doświadczalny. Wszystkie klatki wideo są dostosowywane do rozmiaru 227 × 227, a następnie konwertowane na obrazy w skali szarości. (e wejście modelu to 227 × 227 × 5, to znaczy 5 kolejnych ramek jest używanych jako wejście modelu. Po każdej warstwie splotowej znajduje się warstwa normalizacji wsadowej i warstwa wzbudzenia ReLU. (e dekoder zawiera 4 warstwy dekonwolucji. (moduł uwagi jest ustawiony tak, aby każdy segment pamięci zapisywał cechę na pikselu na mapie cech, odpowiadającą podregionowi segmentu wideo. (dlatego moduł pamięci to 10 Macierz 00 × 64. (e optymalizator Adam jest wybierany do optymalizacji parametrów całego modelu. (e początkowa szybkość uczenia wynosi 0,0001, a liczba iteracji wynosi 1000. (e parametr momentum to ρ1 � 0,9 i ρ2 � 0,999, a wielkość partii wynosi 128.
3.3. Wyniki eksperymentalne. Aby udowodnić skuteczność proponowanej metody w wykrywaniu anomalii wideo, w artykule porównano ją z 12 różnymi istniejącymi metodami. Wśród nich MPPCA (hybrydowy analizator probabilistycznych głównych składowych) plus SF (social power) [17] i MDT (hybrid of dynamic texture) [18] to metody oparte na cechach manualnych; Conv-AE [8], 3D Conv [19], Stacked RNN [2{25}}] i ConvLSTM-AE [21], MemNormality [10] i ClusterAE [22] to wszystkie metody oparte na autoenkoderach; AbnormalGAN [7] i Pred plus Recon [23] opierają się na metodzie generowania sieci kontradyktoryjnych. Tabela 1 przedstawia wyniki wykrywania anomalii wideo na poziomie klatki różnymi metodami. Można zauważyć, że w wynikach dwóch zestawów danych metoda oparta na AE jest zwykle lepsza niż metoda oparta na ręcznie robionych cechach i uzyskuje się wyższe wartości AUC na poziomie klatki. (ponieważ ręcznie wykonywane funkcje są zwykle wyodrębniane na podstawie innych zadań i dlatego mogą być nieoptymalne. W metodach opartych na AE ConvLSTM-AE jest lepszy niż Conv-AE, ponieważ ten pierwszy może lepiej przechwytywać informacje o czasie. Ponadto może również należy zauważyć, że metody oparte na GAN działają lepiej niż większość metod bazowych.Na koniec metoda Memory AE zaproponowana w tym artykule osiąga 85,7% AUC na poziomie klatki w zbiorze danych Avenue, co jest o 0,6% lepsze niż w przypadku najlepiej działającej metody Pred plus Recon [23], podczas gdy metoda zaproponowana w tym artykule osiągnęła 75,3% AUC na poziomie klatki w zbiorze danych ShanghaiTech, czyli o 2% więcej niż inne metody pod względem AUC na poziomie klatki, a efekt jest bardzo oczywisty (głównie dlatego, że proponowana metoda oparta na Memory AE wykorzystuje fragmenty pamięci, które mogą dobrze zrekonstruować anomalie i wprowadzić przypadkowe błędy. Ponadto, w porównaniu ze zbiorem danych Avenue, zestaw danych ShanghaiTech osiągnął wyższy AUC na poziomie klatki. (jest to głównie spowodowane tym, że zestaw danych ShanghaiTech zawiera wiele scen i nietypowych zdarzeń, które nie pojawiały się wcześniej w innych zbiorach danych, co jest bardziej skomplikowane. Aby zweryfikować wyniki wykrywania pojedynczej sceny w zbiorze danych ShanghaiTech, do uczenia i testowania używany jest segment wideo z pojedynczą sceną. 83 segmenty (25 procent ) są używane do uczenia, a 34 segmenty (32 procent ) są używane do testowania, osiągając 86,3 procent AUC na poziomie klatki, który osiągnął poziom podobny do tego w zbiorze danych Avenue. Podsumowując, zaproponowaną metodę Memory AE można elastycznie zastosować do różnych typów danych. Tylko przy wykorzystaniu błędów rekonstrukcji proponowana metoda może uzyskać lepsze wyniki przy najmniej szczegółowej wiedzy. Aby ocenić wydajność predefiniowanego modułu pamięci w wykrywaniu nietypowych zdarzeń wideo, następnym krokiem jest zmiana rozmiaru modułu pamięci i przeprowadzenie eksperymentów na zbiorze danych Avenue, a wartości AUC na poziomie klatki podano w tabeli 2. To można stwierdzić, że biorąc pod uwagę wystarczająco duży rozmiar modułu pamięci, metoda Memory AE może dawać najlepsze wyniki w sposób solidny. Gdy rozmiar modułu pamięci jest większy niż 1000, wpływ na wynik wykrywania jest niewielki, ale użycie modułu o większym rozmiarze spowoduje większą ilość obliczeń, dlatego rozmiar modułu pamięci jest wybrany jako 1000. 2 (a) i 2 (b), odpowiednio, pokazują niektóre wyniki wykrywania w zbiorze danych Avenue i zbiorze danych ShanghaiTech. (e Tabela 1: Porównanie z najnowocześniejszymi metodami pod względem AUC.

lepsze niż metoda oparta na ręcznie robionych funkcjach i uzyskiwane są wyższe wartości AUC na poziomie klatki. (ponieważ ręcznie wykonywane funkcje są zwykle wyodrębniane na podstawie innych zadań i dlatego mogą być nieoptymalne. W metodach opartych na AE ConvLSTM-AE jest lepszy niż Conv-AE, ponieważ ten pierwszy może lepiej przechwytywać informacje o czasie. Ponadto może również należy zauważyć, że metody oparte na GAN działają lepiej niż większość metod bazowych.Na koniec metoda Memory AE zaproponowana w tym artykule osiąga 85,7% AUC na poziomie klatki w zbiorze danych Avenue, czyli o 0,6% więcej niż najlepiej działająca metoda Pred plus Recon [23]; podczas gdy metoda zaproponowana w tym artykule osiągnęła 75,3 procent AUC na poziomie klatki w zbiorze danych ShanghaiTech, co daje 2 procent więcej niż inne metody pod względem AUC na poziomie klatki, a efekt jest bardzo oczywisty (to głównie dlatego, że proponowana metoda oparta na Memory AE wykorzystuje fragmenty pamięci, które mogą dobrze zrekonstruować anomalie i wprowadzić pewne przypadkowe błędy. Ponadto, w porównaniu ze zbiorem danych Avenue, zestaw danych ShanghaiTech osiągnął wyższy AUC na poziomie klatki. (jest głównie dlatego, że zbiór danych ShanghaiTech zawiera wiele scen i nietypowych zdarzeń, które nie pojawiały się wcześniej w innych zbiorach danych, co jest bardziej skomplikowane. Aby zweryfikować wyniki wykrywania pojedynczej sceny w zbiorze danych ShanghaiTech, do uczenia i testowania używany jest segment wideo z pojedynczą sceną. 83 segmenty (25 procent ) są używane do uczenia, a 34 segmenty (32 procent ) są używane do testowania, osiągając 86},3 procent AUC na poziomie klatki, który osiągnął poziom podobny do tego w zbiorze danych Avenue. Podsumowując, zaproponowaną metodę Memory AE można elastycznie zastosować do różnych typów danych. Tylko przy wykorzystaniu błędów rekonstrukcji proponowana metoda może uzyskać lepsze wyniki przy najmniej szczegółowej wiedzy. Aby ocenić wydajność predefiniowanego modułu pamięci w wykrywaniu nietypowych zdarzeń wideo, następnym krokiem jest zmiana rozmiaru modułu pamięci i przeprowadzenie eksperymentów na zbiorze danych Avenue, a wartości AUC na poziomie klatki podano w tabeli 2. To można stwierdzić, że biorąc pod uwagę wystarczająco duży rozmiar modułu pamięci, metoda Memory AE może dawać najlepsze wyniki w sposób solidny. Gdy rozmiar modułu pamięci jest większy niż 1000, wpływ na wynik wykrywania jest niewielki, ale użycie modułu o większym rozmiarze spowoduje większą ilość obliczeń, dlatego rozmiar modułu pamięci jest wybrany jako 1000. 2 (a) i 2 (b), odpowiednio, pokazują niektóre wyniki wykrywania w zbiorze danych Avenue i zbiorze danych ShanghaiTech. (klatki w zielonym polu to normalne klatki zwykłych klipów wideo, a klatki w czerwonym polu to nieprawidłowe klatki z nietypowych klipów wideo. Niektóre nietypowe zdarzenia, takie jak upuszczanie konfetti, jazda na rowerze po chodniku, pobicie itp., mogą zostać wykrytym.
Tabela 2: (e wpływ rozmiaru pamięci na wyniki eksperymentalne zbioru danych Avenue (AUC/procent na poziomie ramki).
![]()
Rysunek 2: Przykłady wyników wykrywania. (a) Przykład ze zbioru danych Avenue. (b) Przykład ze zbioru danych ShanghaiTech.

4. Wniosek
(czy artykuł proponuje AE pamięci w celu poprawy wydajności wykrywania anomalii dużych zbiorów danych w filmach. Biorąc pod uwagę dane wejściowe, proponowana metoda Memory AE najpierw wykorzystuje koder w celu uzyskania zakodowanej reprezentacji, a następnie wykorzystuje kod jako zapytanie w celu pobrania najbardziej odpowiednich wzorce w module pamięci do rekonstrukcji.Ponieważ moduł pamięci jest wyszkolony do zapisywania typowych wzorców normalnych, proponowana AE pamięci może dobrze zrekonstruować normalne próbki i zwiększyć błąd rekonstrukcji nieprawidłowości, co wzmacnia rolę błędu rekonstrukcji jako standardu wykrywania nieprawidłowości. Eksperymenty na dwóch zbiorach danych dowodzą wszechstronności i skuteczności proponowanej metody.W przyszłości będziemy badać wykorzystanie wag adresowych do wykrywania anomalii.Biorąc pod uwagę, że proponowany moduł pamięci jest uniwersalny i nie ma nic wspólnego ze strukturą kodera i dekodera, zostanie on zintegrowany z bardziej złożonym modelem podstawowym i wykorzystany w eksperymentach na bardziej wymagających zbiorach danych.

Suplement Cistanche w pobliżu-Poprawa pamięci
Bibliografia
[1] F. Dong, Y. Zhang i X. Nie, „Generatywna sieć przeciwstawna z podwójnym dyskryminatorem do wykrywania anomalii wideo”, IEEE Access, tom. 8, s. 88170–88176, 2020.
[2] K. Doshi i Y. Yilmaz, „Any-shot sekwencyjne wykrywanie anomalii w filmach z monitoringu”, w Proceedings of the CVPRW, s. 934-935, Seattle, WA, USA, czerwiec 2020 r.
[3] K. Doshi i Y. Yilmaz, „Ciągłe uczenie się w celu wykrywania anomalii w filmach z monitoringu”, w: Proceedings of the CVPRW, s. 254-255, Seattle, WA, USA, czerwiec 2020 r.
[4] K. Jayanta, „Dutta i bonny Banerjee. Wykrywanie nienormalnych zdarzeń online przy użyciu przyrostowej długości kodowania”, w Proceedings of the AAAI, s. 3755–3761, Austin, Teksas, USA, styczeń 2015 r.
[5] Y. Feng, Y. Yuan i X. Lu, „Nauka głębokich modeli zdarzeń do wykrywania anomalii tłumu”, Neurocomputing, tom. 219, s. 548–556, 2017.
[6] D. Gong, L. Liu, V. Le i in., „Zapamiętywanie normalności w celu wykrycia anomalii: głęboki autoenkoder wspomagany pamięcią do wykrywania anomalii bez nadzoru”, w Proceedings of the ICCV, s. 1705–1714, Seul, Korea, październik 2019.
[7] M. Ravanbakhsh, M. Nabi, E. Sangineto, L. Marcenaro, C. Regazzoni i N. Sebe, „Wykrywanie zdarzeń nienormalnych w filmach przy użyciu generatywnych sieci przeciwnika”, w Proceedings of the IEEE International Conference on Image Processing , s. 1577–1581, Pekin, Chiny, wrzesień 2017 r.
[8] M. Hasan, J. Choi, J. Neumann, AK Roy-Chowdhury i LS Davis, „Nauka regularności czasowej w sekwencjach wideo”, w Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, s. 733– 742, Las Vegas, NV, USA, czerwiec 2016 r.
[9] W. Liu, W. Luo, D. Lian i S. Gao, „Przewidywanie przyszłych ramek dla wykrywania anomalii – nowa linia bazowa”, w Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, s. 6536– 6545, Salt Lake City, UT, USA, czerwiec 2018 r.
[10] H. Park, J. Noh i B. Ham, „Nauka normalności kierowanej pamięcią do wykrywania anomalii”, w Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, s. 14 372–{{ 3}}, Seattle, Waszyngton, USA, czerwiec 2020 r.
[11] MZ Zaheer, J.-h. Lee, M. Astrid i SI. Lee, „Stare to złoto: przedefiniowanie paradygmatu szkoleniowego klasyfikatora jednoklasowego wyuczonego przez przeciwnika”, w Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, s. 14 183–214 193, Seattle, WA, USA, czerwiec 2020.
[12] X. Zhu, J. Liu, J. Wang, Y. Fang i H. Lu, „Wykrywanie anomalii w zatłoczonej scenie poprzez modelowanie połączeń wyglądu i dynamiki”, w Proceedings of the IEEE International Conference on Image Processing, s. 2705–2708, Melbourne, VIC, Australia, wrzesień 2013 r.
[13] RVHM Colque, CAC J´unior i WR Schwartz, „Histogramy optycznej orientacji kolegów i wielkości do wykrywania anomalii w filmach”, w Proceedings of the Sibgrapi Conference on Graphics, Patterns, and Images, s. 126–133 , Salvador, Bahia, Brazylia, sierpień 2015 r.
[14] Bo Zong, S. Qi, RM Martin i in., „Deep autoencoding Gaussian mixed model for unsupervised anomaly detection”, w Proceedings of the International Conference on Learning Representations, Vancouver, Kanada, kwiecień 2018 r.
[15] M. Sabokrou, M. Fayyaz, M. Fathy, Z. Moayed i R. Klette, „Głęboka anomalia: w pełni konwolucyjna sieć neuronowa do szybkiego wykrywania anomalii w zatłoczonych scenach”, Computer Vision and Image Understanding, tom. 172, s. 88–97, 2018.
[16] C. Li, Z. Han, Q. Ye i J. Jiao, „Wizualne wykrywanie nieprawidłowych zachowań w oparciu o analizę rzadkiej rekonstrukcji trajektorii”, Neurocomputing, tom. 119, nr. 7, s. 94–100, 2013.
[17] V. Mahadevan, W. Li, V. Bhalodia i N. Vasconcelos, „Wykrywanie anomalii w zatłoczonych scenach”, w Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), s. 1975–1981, IEEE, San Francisco, Kalifornia, USA, czerwiec 2010 r.
[18] W. Li, V. Mahadevan i N. Vasconcelos, „Wykrywanie anomalii i lokalizacja w zatłoczonych scenach”, IEEE Transactions on Pattern Analysis and Machine Intelligence, tom. 36, s. 18–32, 2014.
[19] Y. Zhao, B. Deng, C. Shen, Y. Liu, H. Lu i X.-S. Hua, „Autokoder przestrzenno-czasowy do wykrywania anomalii wideo”, w Proceedings of the ACM International Conference on Multimedia (ACM MM), s. 1933–1941, ACM, Mountain View, Kalifornia, USA, październik 2017 r.
[20] W. Luo, L. Wen i S. Gao, „A revisit of sparse coding based anomaly detection in stacked RNN framework”, w Proceedings of the IEEE International Conference on Computer Vision (ICCV), Wenecja, Włochy, październik 2017.
[21] W. Luo, L. Wen i S. Gao, „Pamiętanie historii ze splotowym LSTM do wykrywania anomalii”, w Proceedings of the IEEE International Conference on Multimedia and Expo (ICME), s. 439–444, IEEE, Hongkong, lipiec 2017 r.
[22] Y. Chang, Z. Tu, W. Xie i J. Yuan, „Głęboki autoenkoder oparty na klastrach do wykrywania anomalii wideo”, w Proceedings of the European Conference on Computer Vision (ECCV), s. 329–345, Springer, Glasgow, Wielka Brytania, sierpień 2020 r.
[23] L. Wen, W. Luo, D. Lian i S. Gao, „Przewidywanie przyszłych ramek dla wykrywania anomalii – nowa linia bazowa”, w Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), s. 6536–6545, IEEE, Salt Lake City, UT, USA, czerwiec 2018 r.
[24] M. Song, „Średni widok pola krajobrazu dwuwarstwowych sieci neuronowych”, Proceedings of the National Academy of Sciences, tom. 115, nr. 33, s. E7665–E7671, 2018.
[25] B. Ding i G. Wen, „Klasyfikator najbliższej podprzestrzeni z ograniczeniem rzadkości do rozpoznawania celów obrazów SAR”, Journal of Visual Communication and Image Representation, tom. 52, s. 170–176, 2018.
[26] T. Wang i H. Snoussi, „Wykrywanie nieprawidłowych zdarzeń wizualnych za pomocą globalnego histogramu orientacji optycznej kolegi”, IEEE Transactions on Information Forensics and Security, tom. 9, nie. 6, s. 988–998, 2014.






