Odkrywanie samonadzorowanych transformatorów wizyjnych do rozpoznawania chodu u dzikich zwierząt. Część 1

Nov 24, 2023

Abstrakcyjny:

Sposób chodzenia (chodu) to potężny wskaźnik biometryczny stosowany jako unikalna metoda pobierania odcisków palców, umożliwiająca przeprowadzanie dyskretnych analiz behawioralnych na odległość bez współpracy podmiotu.

Wszyscy wiemy, że aktywność fizyczna pomaga zachować zdrowie. Oprócz tego ćwiczenia pomagają również poprawić pamięć. Chodzenie to najprostsza i najłatwiejsza forma ćwiczeń, a wiele osób lubi relaksować się podczas spaceru lub joggingu. Teraz więcej badań pokazuje, że chodzenie ma ogromny wpływ na mózg.

Po pierwsze, chodzenie stymuluje układ nerwowy mózgu, co pomaga wzmocnić jego funkcjonowanie. Kiedy ciało się porusza, zwiększa się tętno i przepływ krwi, co również stymuluje mózg do produkcji większej liczby neuronów i synaps. Połączenia między tymi neuronami i synapsami mogą tworzyć nowe sieci neuronowe i szybsze procesy myślowe.

Po drugie, spacery mogą złagodzić stres i niepokój, co jest bardzo ważne dla poprawy pamięci. Kiedy umysł i ciało znajdują się w stanie napięcia, depresji lub lęku, mózg uwalnia hormon zwany kortyzolem. Kortyzol uszkadza neurony i synapsy w mózgu, co może prowadzić do utraty pamięci. Chodzenie łagodzi stres i niepokój, zmniejsza produkcję kortyzolu w organizmie i pomaga w utrzymaniu zdrowych neuronów i synaps.

Wreszcie, chodzenie zwiększa krążenie krwi w mózgu. Niektóre badania pokazują, że dobre krążenie krwi może pomóc poprawić pamięć. Wraz z wiekiem naczynia krwionośne w mózgu stopniowo się zatykają, co powoduje niedostateczny dopływ tlenu do mózgu. Chodzenie może poprawić zdrowie serca, umożliwiając mu skuteczniejsze dostarczanie tlenu i składników odżywczych do mózgu, poprawiając w ten sposób pamięć i funkcjonowanie mózgu.

Dlatego spacery są świetną formą ruchu zarówno dla młodych, jak i starszych. Oprócz poprawy zdrowia fizycznego chodzenie może również pomóc poprawić pamięć. Codziennie pokonujmy dystans, abyśmy byli zdrowsi i lepsi! Widać, że musimy poprawić pamięć, a Cistanche desericola może znacznie poprawić pamięć, ponieważ Cistanche desericola to tradycyjny chiński materiał leczniczy, który ma wiele unikalnych efektów, z których jednym jest poprawa pamięci. Skuteczność mięsa mielonego wynika z różnych zawartych w nim składników aktywnych, w tym kwasów, polisacharydów, flawonoidów itp. Składniki te mogą na różne sposoby promować zdrowie mózgu.

improve memory

Kliknij Poznaj 10 sposobów na poprawę pamięci

W przeciwieństwie do bardziej tradycyjnych metod uwierzytelniania biometrycznego, analiza chodu nie wymaga wyraźnej współpracy osoby badanej i można ją przeprowadzić w ustawieniach niskiej rozdzielczości, bez konieczności, aby twarz osoby była niezakłócona/widoczna. Większość obecnych podejść opracowywana jest w kontrolowanych warunkach, z czystymi, zgodnymi z najwyższymi standardami danymi z adnotacjami, co umożliwiło rozwój architektur neuronowych do rozpoznawania i klasyfikacji.

Dopiero niedawno w analizie chodu zaczęto wykorzystywać bardziej zróżnicowane, realistyczne zbiory danych na dużą skalę do wstępnie wytrenowanych sieci w sposób samonadzorowany. Samonadzorowany reżim treningowy umożliwia naukę różnorodnych i solidnych reprezentacji chodu bez kosztownych ręcznych adnotacji. Zainspirowani wszechobecnym wykorzystaniem modelu transformatora we wszystkich obszarach głębokiego uczenia się, w tym w widzeniu komputerowym, w tej pracy badamy zastosowanie różnych architektur transformatorów wizyjnych bezpośrednio stosowanych do samonadzorowanego rozpoznawania chodu.

Dostosowujemy i przekwalifikowujemy proste ViT, CaiT, CrossFormer, Token2Token i TwinsSVT na dwóch różnych, wielkoskalowych zbiorach danych dotyczących chodu: GREW i DenseGait. Dostarczamy obszerne wyniki dotyczące zerowego strzału i dostrajania w dwóch wzorcowych zestawach danych dotyczących rozpoznawania chodu, CASIA-B i FVG, a także badamy związek między ilością informacji przestrzennych i czasowych dotyczących chodu wykorzystywanych przez transformator wizualny.

Nasze wyniki pokazują, że przy projektowaniu modeli transformatorów do przetwarzania ruchu wykorzystuje się podejście hierarchiczne (tj. modele CrossFormer) w przypadku drobnoziarnistych mechanizmów, co jest stosunkowo lepsze niż poprzednie podejścia oparte na całym szkielecie.

Słowa kluczowe:

rozpoznawanie chodu; uwierzytelnianie biometryczne; transformator wizyjny; ocena pozycji; uczenie się samonadzorowane; uczenie się kontrastowe.

1. Wstęp

To, jak się poruszamy, zawiera istotne wskazówki na nasz temat. W szczególności nasz chód (sposób chodzenia) był szczegółowo badany w medycynie [1], psychologii [2] i naukach o sporcie [3]. Ostatnio analiza chodu cieszy się coraz większym zainteresowaniem [4,5] społeczności informatycznej, co zbiega się z wykładniczym postępem głębokiego uczenia się i powszechną dostępnością sprzętu komputerowego.

Systemy analizy chodu oparte na sztucznej inteligencji były w stanie skutecznie rozpoznawać osoby [6–10], szacować dane demograficzne, takie jak płeć i wiek [11] oraz oceniać cechy zewnętrzne, takie jak ubiór [12], bez korzystania z żadnych zewnętrznych wskazówek dotyczących wyglądu. Wyniki te nie są zaskakujące, biorąc pod uwagę dużą liczbę indywidualnych różnic w chodzie, które wynikają z różnic w budowie układu mięśniowo-szkieletowego, czynników genetycznych i środowiskowych, a także stanu emocjonalnego i osobowości piechura [13].

Obecne systemy są tak naprawdę szkolone i testowane jedynie w kontrolowanych pomieszczeniach. Większość metod wykorzystuje zbiór danych CASIA-B [6] jako standardowy punkt odniesienia dla modeli rozpoznawania chodu, obejmujący 124 osoby spacerujące po pomieszczeniach w ściśle kontrolowany sposób, uchwycone wieloma kamerami. Złożoności w świecie rzeczywistym nie można w pełni modelować za pomocą tak powściągliwych scenariuszy. Dopiero niedawno skupiono się na modelowaniu chodu „w naturze” za pomocą zbiorów danych takich jak DenseGait [12], GREW [7] i Gait3D [14].

short term memory how to improve

Zebranie zbioru danych na dużą skalę, czystego i pełnego adnotacji, wymaga ogromnego wysiłku, zarówno pod względem zasobów finansowych, jak i przydzielonego czasu. Zebranie i opatrzenie adnotacjami zbioru danych GREW [7] zajęło podobno 3 miesiące ciągłej pracy. Chociaż takie podejścia okazały się przydatne w opracowywaniu architektur neuronowych do przetwarzania chodu [8,9], nie są one wystarczająco zróżnicowane, aby można je było właściwie stosować w bardziej zrelaksowanych, rzeczywistych środowiskach.

Społeczność sztucznej inteligencji powoli odchodzi od tego podejścia w innych obszarach, a metody samonadzorowanego uczenia się zarówno wzroku [15], jak i języka [16] zyskują znaczną popularność i często przewyższają tradycyjne metody nadzorowane. Niedawny postęp w samonadzorowanym uczeniu się pokazał, że modele samonadzorowane są solidniejsze i wykazują wyłaniające się zachowania, które nie są wyraźnie zdefiniowane podczas szkolenia.

Na przykład DINO [17], transformator wizyjny przeszkolony w trybie samonadzoru, nauczył się cech specyficznych dla klasy, umożliwiających segmentację obiektów bez nadzoru bez używania takich etykiet podczas szkolenia. Cosma i Radoi [10] zaproponowali pierwszą kontrastową metodę samonadzorowanego uczenia się na potrzeby analizy gaitany, polegającą na treningu ST-GCN [18] na mniejszej wersji DenseGait [12]. Ich metoda pozwoliła uzyskać rozsądne wyniki w przypadku zadań związanych z rozpoznawaniem chodu w dalszej części badania i wykazała, że ​​istnieje silna korelacja między rozmiarem wstępnie wyszkolonego zbioru danych a wydajnością transferu zerowego.

Chociaż wiele podejść do analizy chodu wykorzystuje sylwetki wyodrębnione na podstawie odejmowania tła [6,8,9], wyodrębnianie sylwetek w rzeczywistych scenariuszach nadzoru implikuje zastosowanie bardziej zaawansowanych technik, takich jak segmentacja instancji [19], co wiąże się z wysokimi kosztami obliczeniowymi. Sekwencje sylwetek zajmują znaczną przestrzeń dyskową i nie są wystarczająco elastyczne, aby można je było wykorzystać w innych sąsiadujących zadaniach, takich jak rozpoznawanie aktywności. Co więcej, sylwetki kodują subtelne wskazówki dotyczące wyglądu, co sprawia, że ​​nie jest jasne, w jakim stopniu w identyfikacji wykorzystuje się ruch [20].

Z drugiej strony, modele szacowania pozycji 2D stają się coraz dokładniejsze i wydajniejsze obliczeniowo [21,22]. Wydobywanie szkieletów jest tanie, a obecnie jest bardziej niezawodne niż siatki 3D i pozy 3D, szczególnie na odległość. Co więcej, szkielety 2D są znacznie lżejsze niż sylwetki, jeśli chodzi o długotrwałe przechowywanie.

Obecne architektury przetwarzania sekwencji szkieletów wykorzystują naturalną strukturę grafów przestrzennych obecną w ludzkim szkielecie, wprowadzając indukcyjne obciążenie do projektu modelu. Modele takie jak popularny ST-GCN [18] i MS-G3D [23] przyniosły imponujące wyniki w zakresie rozpoznawania działań w oparciu o szkielet.

Jednocześnie nastąpił gwałtowny wzrost wykorzystania modeli transformatorów w prawie wszystkich obszarach głębokiego uczenia się, od czasu ich pierwszego zastosowania do przetwarzania języka naturalnego.

Transformatory są uważane za bardziej ogólną architekturę, z kilkoma odchyleniami indukcyjnymi. Początkowo transformatory miały trudności z dopasowaniem modeli CNN do klasyfikacji obrazów [24], ale obecnie przewyższają inne modele i wykazują obiecujące wyniki w scenariuszach samonadzorowanych, bardziej niż w przypadku innych typów architektur. Transformatory wykazały imponującą zdolność uczenia się i wyłaniające się zachowania w ramach samodzielnego nadzoru. -nadzór [17].

Cosma i Radoi [12] jako pierwsi zaproponowali GaitFormer, bezpośrednią adaptację modelu kodera transformatora wizyjnego do rozpoznawania chodu, wykorzystującą poszczególne szkielety jako „plamy wejściowe”, zasadniczo wykonując jedynie uwagę czasową, ignorując powiązania uwagi przestrzennej.

GaitFormer był szkolony w sposób samonadzorowany i przewyższał inne metody rozpoznawania chodu, nawet bez żadnego dostrajania. Takie wcześniejsze prace są zachęcające i torują drogę do bardziej dogłębnych badań nad potencjalnym zastosowaniem architektur transformatorów do analizy chodu. Czy modele transformatorów wizyjnych można zaadaptować do samodzielnego uczenia się reprezentacji chodu szkieletu?

Głównym problemem architektonicznym w transformatorach wizyjnych jest zdefiniowanie właściwych relacji pomiędzy obszarami obrazu, które definiują informacje lokalne i globalne. W przypadku chodu wybór wymiarów fragmentu odpowiada ilości zakodowanej informacji czasowej i przestrzennej sekwencji szkieletu.

W tej pracy przedstawiamy obszerne badanie pięciu różnych transformatorów wizyjnych, przystosowanych do rozpoznawania chodu. Badamy klasyczny model ViT [24], CaiT [25], CrossFormer [26], TwinsSVT [27] i ViT typu token-to-token [28].

ways to improve memory

Każda architektura jest trenowana oddzielnie w kontrastowy, samonadzorowany sposób na dwóch dużych, „w naturze” zbiorach danych sekwencji szkieletów chodu 2D: DenseGait — automatycznie zbieranym zbiorze danych z nieprzetworzonych strumieni nadzoru i GREW, mniejszym zbiorze danych zawierającym czyste ludzkie adnotacje.

Badamy możliwości przesyłania między dwoma kontrolowanymi zbiorami danych do rozpoznawania chodu, CASIA [6] i FVG [29]. Dla każdego zestawu danych analizujemy bezpośredni (zero-shot) transfer i wydajność danych podczas dostrajania poprzez szkolenie z coraz większymi podzbiorami zbiorów danych. Co więcej, przeprowadzamy badanie ablacyjne dotyczące związku między wymiarami przestrzennymi i czasowymi dla rozmiarów plastrów dla SimpleViT i CaiT , standardowy szkielet większości dotychczasowych transformatorów wizyjnych.

Pozostała część artykułu jest zorganizowana w następujący sposób. Prowadzimy ogólny przegląd powiązanych prac na temat modeli rozpoznawania chodu i transformatorów wizyjnych. Obserwujemy, że modele reprezentacji chodu w dużym stopniu korzystają z samonadzorowanego treningu, ponieważ mają bardziej solidne i ogólne osadzenie, a modele transformatorowe wykazały duże możliwości modelowania w reżimach treningu samonadzorowanego.

Ponadto opisujemy matematycznie pięć architektur, dla których przeprowadzamy testy porównawcze, oraz opisujemy wstępne przetwarzanie danych i transformacje szkieletu, które należy przeprowadzić, tak aby transformatory wizyjne musiały działać płynnie na sekwencjach szkieletu. Opisujemy także powiększanie danych, zbiory danych szkoleniowe i porównawcze oraz konfiguracje eksperymentalne.

Przedstawiamy wyniki CASIA-B i FVG dla każdej z pięciu architektur oraz dwóch zbiorów danych „wstępnych treningów w środowisku naturalnym”. Na koniec przeprowadzamy badanie ablacyjne dotyczące związku między rozmiarami plam przestrzennych i czasowych oraz przedstawiamy krótką dyskusję naszych wyników. Nasz kod źródłowy udostępniamy publicznie w serwisie GitHub (https://github.com/cosmaadrian/gait-vit, dostęp: 28 lutego 2023 r.) w celu zapewnienia przejrzystości i odtwarzalności.

2. Powiązane prace

W tej sekcji dokonamy krótkiego przeglądu istniejących metod rozpoznawania chodu w niekontrolowanych środowiskach i „na wolności”. Następnie opisujemy główny rozwój modeli transformatorów, a w szczególności ich zastosowanie w dziedzinie wizji.

2.1. Rozpoznawanie chodu

Podobnie jak identyfikacja na podstawie twarzy, rozpoznawanie chodu opiera się na uczeniu się metrycznym. W przeciwieństwie do tradycyjnych metod uwierzytelniania biometrycznego, które opierają się na pojedynczym obrazie (np. rozpoznawanie twarzy) i wymagają szerokiej współpracy (np. uwierzytelnianie biometryczne na podstawie tęczówki), cechy chodu są przetwarzane w postaci sekwencji migawek ruchu. Taka dynamika gestów wymaga większej złożoności w określeniu najbardziej informacyjnej podsekwencji, ale umożliwia zastosowanie dyskretnego uwierzytelniania na odległość.

W tym kontekście zadanie polega na uczeniu sieci koderów, aby mapowała sekwencje chodu na przestrzeń osadzania, w której podobieństwo osadzania odpowiada podobieństwu chodu. Osadzenie spacerów należących do tej samej osoby powinno znajdować się blisko przestrzeni osadzania, a osoby o różnych tożsamościach muszą być bardziej odległe. W tej przestrzeni osadzania można wyciągnąć wnioski, uzyskując osadzenie sekwencji chodu i wykorzystując najbliższego sąsiada podejście na bazie danych znanych spacerów.

Obecne podejścia do rozpoznawania na podstawie chodu dzielą się na dwie kategorie: oparte na wyglądzie [8,9] i oparte na modelu [10,12,30]. Metody oparte na wyglądzie najpierw uzyskują sylwetki spacerujących obiektów za pomocą algorytmów odejmowania tła lub segmentacji z każdej klatki wideo.

Następnie sekwencja sylwetek jest wprowadzana do architektur opartych na CNN, które wyodrębniają cechy przestrzenne i czasowe, które są agregowane w ostateczne osadzenie w celu rozpoznania. Podejścia oparte na modelach wyodrębniają szkielety z filmów RGB za pomocą modeli oszacowania pozycji [21,22]. Sekwencje szkieletów są zwykle przetwarzane przez modele, które opierają się na splotach grafów [10,30] w celu uzyskania osadzania chodu.

GaitSet, praca Chao i in. [8] traktuje chód jako nieuporządkowany zbiór sylwetek. Autorzy twierdzą, że reprezentacja ta jest bardziej elastyczna niż sekwencja sylwetek, ponieważ jest odporna na różne układy ram lub kombinację wielu kierunków i odmian chodzenia. Wykorzystują warstwy splotu dla każdej sylwetki, aby uzyskać funkcje na poziomie obrazu i połączyć je w funkcję na poziomie zestawu za pomocą Set Pooling. Ostateczny wynik uzyskują, stosując swoją wersję HorizontalPyramid Matching [31].

Fan i in. [9] zauważyli, że określone części sylwetki człowieka powinny mieć swój wyraz czasoprzestrzenny, gdyż każda z nich ma swój niepowtarzalny wzór. Ich architektura, GaitPart, wykorzystuje ogniskowe warstwy splotu (FConv), które są wyspecjalizowanym rodzajem splotu z bardziej ograniczonym polem recepcyjnym. Autorzy argumentują, że FConv pomagają ich architekturze w uczeniu się bardziej szczegółowych cech różnych części poruszającego się ciała. Wprowadzają także moduły przechwytywania mikroruchu, które są wykorzystywane do wydobywania cech małych sekwencji czasowych.

Teepe i in. [30] proponują GaitGraph, który wykorzystuje zaadaptowaną sieć splotową grafów zwaną ResGCN [32] do kodowania cech czasoprzestrzennych uzyskanych z sekwencji szkieletów. Li i in. [33] proponują PTP, czyli strukturę, która agreguje wiele cech czasowych z jednego cyklu chodu w oparciu o analizę najważniejszych etapów chodu.

Wykorzystują również grafową sieć splotową do ekstrakcji cech przestrzennych, która współpracuje z PTP. Autorzy przedstawiają nowatorską metodę powiększania danych, która modyfikuje chód tak, aby miał wiele kroków w bardziej realistycznym cyklu.

Jednak w odróżnieniu od poprzednich prac naszym celem jest zbadanie wydajności architektur rozpoznawania chodu w scenariuszach samonadzorowanych. Zainspirowani ogromnym postępem w dziedzinie widzenia komputerowego, proponujemy dostosowanie istniejących architektur transformatorów wizyjnych do działania na sekwencjach szkieletowych zamiast na obrazach i przetestowanie ich zdolności modelowania w scenariuszach samonadzorowanych. Większość innych prac [8,9,30] koncentruje swoje wysiłki na opracowywaniu architektur neuronowych, które osiągają imponujące wyniki w zakresie rozpoznawania chodu na kontrolowanych zbiorach danych.

Zamierzamy jednak wyeliminować potrzebę bardzo kosztownych ręcznych adnotacji w zbiorach danych dotyczących chodu i zbadać, w jaki sposób samonadzorowane uczenie się jest odpowiednie do analizy chodu.

memory enhancement

Poprzednie prace w tej dziedzinie [10,12] wykazały potencjał uczenia się dobrych reprezentacji chodu na podstawie słabo opisanych zbiorów danych. Cosma i Radoi [12] zaproponowali GaitFormer, pierwszą architekturę opartą na transformatorach do przetwarzania sekwencji szkieletowych, inspirowaną modelem ViT [24]. Podobnie jak w [12], próbujemy zbadać wydajność innych modeli transformatorów wizyjnych, z różną dynamiką przestrzenną i czasową w mechanizmie przetwarzania łatek. W przeszłości zaproponowano wielkoskalowe zbiory danych do rozpoznawania chodu [7,12], co pozwala na rozwój ogólnych architektur uczenia się poprzez reprezentację.


For more information:1950477648nn@gmail.com


Może ci się spodobać również