Utforsker selvstyrte syntransformere for ganggjenkjenning i The Wild, del 1
Nov 24, 2023
Abstrakt:
Måten å gå (gang) er en kraftig biometrisk som brukes som en unik fingeravtrykksmetode, som gjør det mulig å utføre diskrete atferdsanalyser på avstand uten samarbeid.
Vi vet alle at trening hjelper på god helse. I tillegg til dette bidrar trening også til å forbedre hukommelsen. Å gå er den enkleste og letteste treningsformen å trene, og mange liker å slappe av mens de går eller jogger. Nå viser mer forskning at gange gjør kraftige ting for hjernen.
For det første stimulerer gange hjernens nervesystem, noe som bidrar til å styrke hjernens funksjon. Når kroppen beveger seg, øker hjertefrekvensen og blodstrømmen vår, noe som også stimulerer hjernen til å produsere flere nevroner og synapser. Forbindelsene mellom disse nevronene og synapsene kan skape nye nevrale nettverk og raskere tankeprosesser.
For det andre kan gåing lindre stress og angst, noe som er veldig viktig for å forbedre hukommelsen. Når sinnet og kroppen er i en tilstand av spenning, depresjon eller angst, frigjør hjernen et hormon som kalles kortisol. Kortisol skader nevroner og synapser i hjernen, noe som kan føre til hukommelsestap. Å gå lindrer stress og angst, reduserer kortisolproduksjonen i kroppen og bidrar til å opprettholde sunne nevroner og synapser.
Til slutt øker gange blodsirkulasjonen til hjernen. Noen studier viser at god blodsirkulasjon kan bidra til å forbedre hukommelsen. Etter hvert som vi blir eldre, tettes blodårene i hjernen gradvis, noe som resulterer i utilstrekkelig oksygentilførsel til hjernen. Å gå kan forbedre hjertets helse, slik at hjertet kan levere oksygen og næringsstoffer til hjernen mer effektivt, og dermed fremme hukommelse og hjernefunksjon.
Derfor er turgåing en fin treningsform for både store og små. I tillegg til å forbedre den fysiske helsen, kan turgåing også bidra til å forbedre hukommelsen. La oss gå et stykke hver dag for å gjøre oss sunnere og bedre! Det kan sees at vi trenger å forbedre hukommelsen, og Cistanche deserticola kan forbedre hukommelsen betydelig fordi Cistanche deserticola er et tradisjonelt kinesisk medisinsk materiale som har mange unike effekter, hvorav en er å forbedre hukommelsen. Effekten av kjøttdeig kommer fra de ulike aktive ingrediensene den inneholder, inkludert syre, polysakkarider, flavonoider osv. Disse ingrediensene kan fremme hjernens helse på ulike måter.

Klikk vet 10 måter å forbedre hukommelsen
I motsetning til mer tradisjonelle biometriske autentiseringsmetoder, krever ganganalyse ikke eksplisitt samarbeid med motivet og kan utføres i lavoppløsningsinnstillinger, uten at det kreves at motivets ansikt er uhindret/synlig. De fleste nåværende tilnærminger er utviklet i en kontrollert setting, med rene, gullstandard kommenterte data, som drev utviklingen av nevrale arkitekturer for gjenkjennelse og klassifisering.
Først nylig har ganganalyse satset på å bruke mer varierte, storskala og realistiske datasett til forhåndstrente nettverk på en selvovervåket måte. Selvovervåket treningsregime gjør det mulig å lære mangfoldige og robuste gangrepresentasjoner uten dyre manuelle menneskelige merknader. Tilskyndet av den allestedsnærværende bruken av transformatormodellen i alle områder av dyp læring, inkludert datasyn, utforsker vi i dette arbeidet bruken av forskjellige synstransformatorarkitekturer direkte brukt på selvovervåket ganggjenkjenning.
Vi tilpasser og omskoler de enkle ViT, CaiT, CrossFormer, Token2Token og TwinsSVT på to forskjellige storskala gangdatasett: GREW og DenseGait. Vi gir omfattende resultater for nullskudd og finjustering på to referansedatasett for ganggjenkjenning, CASIA-B og FVG, og utforsker forholdet mellom mengden romlig og tidsmessig ganginformasjon som brukes av den visuelle transformatoren.
Resultatene våre viser at utforming av transformatormodeller for prosessering av bevegelse bruker en hierarkisk tilnærming (dvs. CrossFormer-modeller) på finkornede bevegelsesmesser relativt bedre enn tidligere helskjeletttilnærminger.
Nøkkelord:
gangart anerkjennelse; biometrisk autentisering; visjon transformator; positur estimering; selvstyrt læring; kontrastiv læring.
1. Introduksjon
Hvordan vi beveger oss inneholder viktige ledetråder om oss selv. Spesielt vår gangart (måte å gå) har blitt nøye studert innen medisin [1], psykologi [2] og idrettsvitenskap [3]. Nylig har ganganalyse fått økt oppmerksomhet [4,5] fra informatikkmiljøet, sammenfallende med den eksponentielle fremgangen innen dyp læring og utbredt tilgjengelighet av datamaskinvare.
AI-drevne ganganalysesystemer har vært i stand til å lykkes med å gjenkjenne emner [6–10], estimere demografi som kjønn og alder [11], og estimere eksterne attributter som klær [12], uten å bruke noen ytre pekepinner. Disse resultatene er ikke overraskende, gitt den store mengden individuelle forskjeller i gangart, som skyldes forskjeller i muskel-skjelettstruktur, genetiske og miljømessige faktorer, samt vandrerens følelsesmessige tilstand og personlighet [13].
Nåværende systemer er kun virkelig trent og testet i kontrollerte innendørsmiljøer. De fleste metodene bruker CASIA-B-datasettet [6] som standard benchmark for ganggjenkjenningsmodeller, som inneholder 124 personer som går innendørs på en strengt kontrollert måte tatt med flere kameraer. Kompleksiteten i den virkelige verden kan ikke fullt ut modelleres av slike tilbakeholdne scenarier. Først nylig har fokuset vært på modellering av gangart "i naturen", med datasett som DenseGait [12], GREW [7] og Gait3D [14].

Å samle et stort datasett som er rent og fullstendig kommentert representerer en enorm innsats både når det gjelder økonomiske ressurser og allokert tid. GREW-datasettet [7] tok rapportert 3 måneder med kontinuerlig arbeid å samle og kommentere. Selv om slike tilnærminger har vært nyttige for å utvikle nevrale arkitekturer for prosessering av gangart [8,9], er de ikke tilstrekkelig mangfoldige til å kunne brukes riktig i mer avslappede miljøer i den virkelige verden.
AI-fellesskapet har sakte beveget seg bort fra denne tilnærmingen på andre områder, med metoder for selvovervåket læring for både syn [15] og språk [16] som har fått betydelig gjennomslag og ofte overgår tradisjonelle veiledede metoder. Nylig fremgang i selvovervåket læring viste at selvstyrte modeller er mer robuste og viser fremadstormende atferd, ikke eksplisitt definert under trening.
For eksempel, DINO [17], en synstransformator trent i et selvovervåket regime, lærte klassespesifikke funksjoner som muliggjorde uovervåket objektsegmentering uten å bruke slike etiketter under trening. Cosmaand Radoi [10] foreslo den første kontrastive metoden for selvovervåket læring for ganganalyse, ved å trene en ST-GCN [18] på en mindre versjon av DenseGait [12]. Metoden deres oppnådde rimelige resultater på nedstrøms ganggjenkjenningsoppgaver og viste at det er en sterk korrelasjon mellom den forhåndstrente datasettstørrelsen og nullskuddsoverføringsytelsen.
Mens mange tilnærminger for ganganalyse har brukt silhuetter hentet fra bakgrunnssubtraksjon [6,8,9], innebærer å trekke ut silhuetter i virkelige overvåkingsscenarier bruk av mer avanserte teknikker, som forekomstsegmentering [19], som har en høy beregningskostnad. Sekvenser av silhuetter opptar betydelig lagringsplass og er ikke tilstrekkelig fleksible til å brukes i andre tilstøtende oppgaver, for eksempel aktivitetsgjenkjenning. Dessuten koder silhuetter subtile pekepinner på utseendet, noe som gjør det uklart i hvilken grad bevegelse brukes i identifiseringen [20].
På den annen side har 2D-poseestimeringsmodeller blitt stadig mer nøyaktige og beregningseffektive [21,22]. Skjeletter er billige å trekke ut, og for tiden mer pålitelige enn 3D-masker og 3D-positurer, spesielt på avstand. Dessuten er 2D-skjeletter betydelig lettere enn silhuetter når det gjelder langtidslagring.
Nåværende arkitekturer for å behandle sekvenser av skjeletter bruker den naturlige romlige grafstrukturen som er tilstede i det menneskelige skjelettet, og introduserer en induktiv skjevhet i modelldesignet. Modeller som den populære ST-GCN [18] og MS-G3D [23] har sett imponerende resultater for skjelettbasert handlingsgjenkjenning.
Samtidig har det vært en eksplosjon i bruken av transformatormodeller i nesten alle områder av dyp læring siden deres første søknad om naturlig språkbehandling.
Transformatorer regnes som en mer generell arkitektur, med få induktive skjevheter. I utgangspunktet har transformatorer slitt med å matche CNN-modeller for bildeklassifisering [24], men overgår for tiden andre modeller og viser lovende resultater i selvovervåkede scenarier, mer enn andre typer arkitekturer, transformatorer har vist imponerende læringskapasitet og fremvoksende atferd under selvtillit. -tilsyn [17].
Cosma og Radoi [12] var de første som foreslo GaitFormer, en direkte tilpasning av vision-transformator-kodermodellen for ganggjenkjenning, ved å bruke individuelle skjeletter som "lapper", som i hovedsak bare utfører tidsmessig oppmerksomhet, og ignorerer romlige oppmerksomhetsforhold.
GaitFormer ble trent på en selvovervåket måte og overgikk andre gangartgjenkjenningsmetoder selv uten noen finjustering. Slike tidligere arbeid er oppmuntrende og baner vei for en mer dyptgående studie av den potensielle anvendelsen av transformatorarkitekturer for ganganalyse. Kan synstransformatormodeller tilpasses for selvovervåket læring av skjelettgangrepresentasjoner?
Det viktigste arkitektoniske problemet i synstransformatorer er å definere de riktige forholdene mellom bildelapper, som definerer lokal og global informasjon. Når det brukes på gangart, tilsvarer valget av lappdimensjoner mengden kodet tidsmessig og romlig informasjon i skjelettsekvensen.
I dette arbeidet presenterer vi en omfattende studie av fem forskjellige synstransformatorer, tilpasset for ganggjenkjenning. Vi utforsker den klassiske ViT-modellen [24], CaiT [25], CrossFormer [26], TwinsSVT [27] og token-to-token ViT [28].

Hver arkitektur trenes separat på en kontrastiv selvovervåket måte på to storskala "i naturen" datasett med 2D-gangskjelettsekvenser: DenseGait – et automatisk samlet datasett fra råovervåkingsstrømmer, og GREW, et mindre datasett som inneholder rene menneskelige merknader.
Vi utforsker overføringsmuligheter på tvers av to kontrollerte datasett for ganggjenkjenning, CASIA [6] og FVG [29]. For hvert datasett analyserer vi direkte (nullskudd) overføring og dataeffektivitet under finjustering ved å trene med progressivt større delsett av datasettene. Dessuten gjennomfører vi en ablasjonsstudie på forholdet mellom romlige og tidsmessige dimensjoner for lappstørrelser for SimpleViT og CaiT , standard ryggrader for de fleste vision-transformatorene til dags dato.
Resten av oppgaven er organisert som følger. Vi gjennomfører en oversikt på høyt nivå over relaterte arbeider om ganggjenkjenningsmodeller og synstransformatorer. Vi observerer at gangrepresentasjonsmodeller har stor nytte av selvovervåket trening for å ha mer robust og generell innebygging, og transformatormodeller har vist stor modelleringskapasitet i selvovervåket treningsregime.
Videre beskriver vi matematisk de fem arkitekturene som vi benchmarker og beskriver dataforbehandlingen og skjeletttransformasjonene som må utføres, slik at synstransformatorer må fungere sømløst på skjelettsekvenser. Vi beskriver også dataforsterkninger, opplærings- og benchmarking-datasett og eksperimentelle oppsett.
Vi viser frem resultater på CASIA-B og FVG for hver av de fem arkitekturene og de to 'pretraining in-the-wild' datasettene. Til slutt lager vi en ablasjonsstudie om forholdet mellom romlig og tidsmessig lappstørrelse og gir en kort diskusjon av resultatene våre. Vi gjør kildekoden vår offentlig tilgjengelig på GitHub (https://github.com/cosmaadrian/gait-vit, tilgjengelig 28. februar 2023) for åpenhet og reproduserbarhet.
2. Relatert arbeid
I denne delen lager vi en kort oversikt over eksisterende metoder for ganggjenkjenning ukontrollerte miljøer og «i naturen». Videre beskriver vi hovedutviklingen av transformatormodeller og spesielt deres anvendelse i synsdomenet.
2.1. Ganggjenkjenning
I likhet med ansiktsbasert identifikasjon er ganggjenkjenning avhengig av metrisk læring. I motsetning til tradisjonelle biometriske autentiseringsmetoder, som er avhengige av et enkelt bilde (f.eks. ansiktsgjenkjenning) og krever omfattende samarbeid (f.eks. irisbasert biometrisk autentisering), behandles gangfunksjoner som en sekvens av bevegelsesbilder. Slik gestdynamikk krever mer kompleksitet når det gjelder å bestemme den mest informative undersekvensen, men muliggjør bruk av diskret autentisering på avstand.
I denne sammenhengen innebærer oppgaven å trene et kodernettverk for å kartlegge gangsekvenser til et innbyggingsrom hvor innbyggingslikheten tilsvarer likheten til gangarten. Innebygginger av turer som tilhører samme person bør være nært innbyggingsrommet, og de som kommer fra ulike identiteter må være fjernere. I dette innbyggingsrommet kan man trekke slutninger ved å skaffe innleiring av gangrekkefølgen og bruke nærmeste nabo. tilnærming til en database over kjente turer.
Nåværende tilnærminger innen gangbasert gjenkjenning er delt inn i to kategorier: utseendebasert [8,9] og modellbasert [10,12,30]. Utseendebaserte metoder henter først silhuettene til de gående motivene med bakgrunnssubtraksjon eller segmenteringsalgoritmer fra hver videoramme.
Deretter mates sekvensen av silhuetter inn i CNN-baserte arkitekturer som trekker ut romlige og tidsmessige trekk som samles til en endelig innebygging for gjenkjennelse. Modellbaserte tilnærminger trekker ut skjelettene fra RGB-videoer med poseestimeringsmodeller [21,22]. Sekvenser av skjeletter blir vanligvis behandlet av modeller som er avhengige av grafviklinger [10,30] for å oppnå innbygging av gangarten.
GaitSet, arbeidet til Chao et al. [8], betrakter gangarten som et uordnet sett med silhuetter. Forfatterne hevder at denne representasjonen er mer fleksibel enn en silhuettsekvens fordi den er robust for forskjellige arrangementer av rammer eller kombinasjonen av flere gangretninger og variasjoner. De bruker konvolusjonslag for hver silhuett for å oppnå funksjoner på bildenivå og kombinere dem til en funksjon på et sett nivå med Set Pooling. De får det endelige resultatet ved å bruke deres versjon av HorizontalPyramid Matching [31].
Fan et al. [9] la merke til det faktum at spesifikke deler av den menneskelige silhuetten burde ha sitt romlige uttrykk, da hver enkelt har et unikt mønster. Arkitekturen deres, GaitPart, bruker fokale konvolusjonslag (FConvs), som er en spesialisert type konvolusjon med et mer begrenset mottakelig felt. Forfatterne hevder at FConvs hjelper deres arkitektur med å lære mer finkornede funksjoner for forskjellige deler av den bevegelige kroppen. De introduserer også mikrobevegelsesfangstmodulene, som brukes til å trekke ut funksjonene i små tidssekvenser.
Teepe et al. [30] foreslår GaitGraph, som utnytter et tilpasset grafkonvolusjonsnettverk kalt ResGCN [32] for koding av spatiotemporale funksjoner oppnådd fra sekvensen av skjeletter. Li et al. [33] foreslår PTP, som er en struktur som samler flere temporale trekk fra en gangsyklus basert på deres analyse av de viktigste stadiene av gange.
De bruker også et grafkonvolusjonsnettverk for romlig funksjonsutvinning, som fungerer sammen med PTP. Forfatterne introduserer en ny metode for dataforsterkning som modifiserer gangarten til å ha flere skritt i en mer realistisk syklus.
Imidlertid, forskjellig fra tidligere arbeider, tar vi sikte på å utforske ytelsen til arkitekturer for ganggjenkjenning i selvovervåkede scenarier. Inspirert av enorm fremgang i datasynsdomenet, foreslår vi å tilpasse eksisterende synstransformatorarkitekturer til å operere på skjelettsekvenser i stedet for bilder og å teste deres modelleringskapasitet i selvovervåkede scenarier. De fleste andre arbeider [8,9,30] fokuserer sin innsats på å utvikle nevrale arkitekturer som oppnår imponerende resultater på ganggjenkjenning på kontrollerte datasett.
Vi har imidlertid til hensikt å fjerne behovet for svært kostbare manuelle merknader for gangdatasett og utforske måter selvovervåket læring er passende for ganganalyse.

Tidligere arbeider i dette domenet [10,12] viste potensial for å lære gode gangrepresentasjoner fra svakt kommenterte datasett. Cosmaand Radoi [12] foreslo GaitFormer, den første transformatorbaserte arkitekturen for prosessering av skjelettsekvenser, inspirert av ViT [24]-modellen. I likhet med [12], forsøker vi å utforske ytelsen til andre synstransformatormodeller, med forskjellig romlig og tidsmessig dynamikk i lappeprosesseringsmekanismen. Storskala datasett for gangartgjenkjenning har blitt foreslått tidligere [7,12], som muliggjør utvikling av generelle arkitekturer for representasjonslæring.
For more information:1950477648nn@gmail.com






