Ny romlig-temporal kontinuerlig tegnspråkgjenkjenning ved bruk av et oppmerksomt nettverk med flere funksjoner(1)

Jun 01, 2023

Abstrakt: Gitt videostrømmer, tar vi sikte på å oppdage usegmenterte tegn relatert til kontinuerlig tegnspråkgjenkjenning (CSLR). Til tross for økningen i foreslåtte dyplæringsmetoder på dette området, fokuserer de fleste av dem i hovedsak på å bruke bare en RGB-funksjon, enten fullskjermbildet eller detaljer i hender og ansikt. Knappheten på informasjon for CSLR-treningsprosessen begrenser i stor grad muligheten til å lære flere funksjoner ved å bruke videoinndatarammer. Dessuten kan utnyttelse av alle bilder i en video for CSLR-oppgaven føre til suboptimal ytelse siden hver ramme inneholder et annet informasjonsnivå, inkludert hovedtrekkene i slutningen av støy. Derfor foreslår vi ny romlig, kontinuerlig tegnspråkgjenkjenning ved å bruke det oppmerksomme multifunksjonsnettverket for å forbedre CSLR ved å tilby ekstra nøkkelpunktfunksjoner. I tillegg utnytter vi oppmerksomhetslaget i de romlige og tidsmessige modulene for samtidig å understreke flere viktige funksjoner. Eksperimentelle resultater fra begge CSLR-datasettene viser at den foreslåtte metoden oppnår overlegen ytelse sammenlignet med dagens toppmoderne metoder med 0.76 og 20.56 for WER-poengsummen på henholdsvis CSL- og PHOENIX-datasett.

Desert living cistanche

Superman urter cistanche

Nøkkelord: kontinuerlig tegnspråk; romlig; tidsmessig; multi-funksjon; viktige punkter; selvoppmerksomhet

1. Introduksjon

Tegnspråk prioriterer manuell kommunikasjon ved hjelp av håndbevegelser, kroppsspråk og leppebevegelser i stedet for lyd for å kommunisere [1,2]. Vanligvis brukes tegnspråk av personer som er døve eller tunghørte, men det kan også brukes i situasjoner der det er umulig eller vanskelig å høre lyder. Derfor er det nødvendig med et tegnspråkgjenkjenningssystem (SLR), siden det bidrar til å koble sammen mennesker som er tunghørte og de som ikke er det.

De siste årene har forskere fokusert mye på speilreflekskamera på grunn av den rike visuelle informasjonen den gir. Nyere SLR-studier er vanligvis gruppert i isolert tegnspråkgjenkjenning (ISLR) eller kontinuerlig tegnspråkgjenkjenning (CSLR). Flere arbeider adresserer kun ISLR [3,4], mens andre kun analyserer enklere oppgaver, for eksempel statiske bevegelser for alfabetgjenkjenning [5]. I mellomtiden er de nyeste metodene vanligvis mer kompliserte ettersom de løser CSLR-oppgaver [6–8]. Sammenlignet med ISLR er CSLR et mer utfordrende problem da det involverer rekonstruksjon av setninger.

Cistanche tea2

Cistanche te

Klikk her for å se Cistanche deserticola te-produkter

【Be om mer】 E-post:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

CSLR-forskning er fortsatt etterspurt fordi implementeringen er nært knyttet til hverdagslige forhold i den virkelige verden. Denne tilnærmingen tar sikte på å gjenkjenne serien med gloser som forekommer i en videoserie uten tydelig segmentering eller til og med ingen i det hele tatt. Videre inkluderer den mye maskinlæringsforskning og en grundig forståelse av menneskelig atferd. For eksempel involverer det menneskelig bevegelsessporing [9], gestgjenkjenning [10] og ansiktsgjenkjenning [11]. Likevel er det flere utfordringer med å utføre CSLR-oppgaver.

For det første er datainnsamling og merknader dyrt for CSLR [12]. Dette er kanskje en av utfordringene i utviklingen siden CSLR er involvert i et stort nettverk og datamengden påvirker ytelsen sterkt [13]. Dessuten er flere tilgjengelige datasett for tegnspråk svakt kommentert [12,14,15]. For å løse dette problemet har en rekke studier brukt en svakt overvåket tilnærming, sammen med bruken av en justering og en funksjonsuttrekksmodul til nettverksarkitekturen [12].

For det andre, sammenlignet med ISLR, er CSLR mer komplisert. Tilstrekkelig informasjon innhentes ved å bruke flere funksjoner; dette har vist seg å oppnå bedre ytelse enn å bruke en enkelt funksjon som rapportert i tidligere arbeider [16–18]. Disse flere funksjonene består av hovedfunksjonen som er et kroppsbilde som oppnår den høyeste nøyaktigheten og tilleggsfunksjoner, som positur, hode, venstre hånd og høyre hånd, som har lavere nøyaktighet for individuell ytelse [17,18]. Å trene et stort nettverk med store mengder data er tidkrevende [13]. Å legge til inngangsstrømmen øker også treningstiden, mens bruk av ekstra bildebaserte funksjoner øker kostnadene [19]. Derfor må vi velge viktige funksjoner slik at vi kan trene effektivt.

Cistanche deserticola slice (1)

Kinesisk urt cistanche

For det tredje har videoinngang et stort antall bilder i sekvensen. Noen bilder har en uklar håndform på grunn av den raske bevegelsen, noe som kan føre til feil informasjon. Derfor bruker vår foreslåtte modell selvoppmerksomhet basert på [20] for å hjelpe til med å velge viktig informasjon. Dessuten har selvoppmerksomhet bevist av [21,22] en innvirkning på å forbedre ytelsen.

Derfor foreslår vi en ny modell kalt roman spatiotemporal attentive multi-feature (STAMF) for å håndtere alle problemer. Vi fulgte tidligere arbeider [17,23], som har vist seg å fungere for CSLR med svake merknadsproblemer. De konstruerer modellen ved å bruke tre hovedkomponenter: den første er den romlige modulen, den andre er den tidsmessige modulen, og den tredje er sekvenslæringsmodulen. Vi foreslår effektiv og effektiv input med flere funksjoner ved å bruke full-frame-funksjonen sammen med nøkkelpunktfunksjoner for å utføre CSLR-oppgaver. Full-frame-funksjonen representerer kroppsbildet som hovedfunksjonen, og keypoint-funksjonene som tilleggsfunksjonen. Nøkkelfunksjonen er kroppsstillingen, inkludert detaljene i håndstillingen. Denne kroppsstillingen er den mest effektive tilleggsfunksjonen siden den i noen arbeider har vist seg å oppnå den høyeste nøyaktigheten etter fullframe-funksjonen [17,18]. Vi bruker også en oppmerksomhetsmodul som bruker selvoppmerksomhet basert på [20] for å fange opp den viktige funksjonen og hjelpe sekvenslæringen med å forbedre ytelsen.

Bidraget til dette manuskriptet er oppsummert som følger: • Vi introduserer ny tidsmessig oppmerksomhet i sekvensmodulen for å fange opp de viktige tidspunktene som bidrar til den endelige produksjonen; • Vi introduserer multifunksjonen som består av full-frame-funksjonen fra RGB-verdien til rammen som hovedfunksjon og keypoint-funksjoner som inkluderer kroppsposituren med håndformdetaljene som en tilleggsfunksjon for å forbedre modellgjenkjenningsytelsen; • Vi bruker WER-metrikken for å vise at vår foreslåtte STAMF-modell overgår de nyeste modellene på begge CSLR-referansedatasettene gjennom eksperimentene.

cistanche—Improve memory4

Cistanche-tilskudd nær meg - Forbedre hukommelsen

2. Relaterte verk

Det har vært flere fremskritt innen teknologi, og mye forskning har blitt gjort på speilreflekskamera. Tidligere studier [24–27] undersøkte muligheten for å bruke ISLR som har en segmentering for hvert ord. De siste årene har dyplæringsbaserte metoder blitt brukt for å trekke ut funksjoner ved å bruke konvolusjonelle nettverk, enten 2D [28,29] eller 3D [30,31], for deres sterke visuelle representasjon. Flertallet av tidlig forskning på tegnspråkgjenkjenning sentrerte seg om ISLR med multimodale egenskaper [30–32], som RGB, dybdekart og skjeletter, som gir bedre ytelse.

I dag har CSLR blitt mer populært, selv om det ikke har blitt segmentert tydelig mellom hvert ord. Tidlige arbeider bruker en CNN-funksjonsuttrekker [6,33] og HMM [34] for å bygge sekvensmålet. Noen nyere forskning for CSLR-systemer [17,23] har inkludert tre hovedtrinn i å utføre oppgaven med problemgjenkjenning. Først utførte de den romlige funksjonsekstraksjonen, deretter temporal segmentering og til slutt setningssyntese med en språkmodell [35], eller de brukte sekvenslæring [17,23]. Denne sekvenslæringen brukte Bi-LSTM og CTC for å utvinne forholdet mellom tegnglans i videosekvensene. Selv om den bruker en svak annotering som har usegmenterte videosekvenser for å definere tegnglansene, har disse tilnærmingene vist lovende resultater.

Imidlertid brukte den siste relaterte CLSR-studien som implementerte en multifunksjonstilnærming [17] fem funksjoner samtidig. Tilnærmingen med flere funksjoner er tyngre sammenlignet med å bruke færre funksjoner [19]. Denne tilnærmingen kan heller ikke håndtere de støyende rammene fra videosekvensen som har uklar informasjon, for eksempel en uskarp håndform på grunn av rask bevegelse. Dessuten kan det å stole på RNN-basert sekvenslæring støte på problemer med lange sekvenser og kan miste den globale konteksten [20].

cistanche—Improve memory3

Cistanche-tilskudd nær meg - Forbedre hukommelsen

Den nåværende forskningen tar sikte på å forbedre ytelsen ved å legge til en selvoppmerksomhetsmekanisme [21,22] som kan håndtere lengre sekvenser for å lære den globale konteksten. Selvoppmerksomhet er basert på tidlig forskning [20] som viste at selvoppmerksomhet har fordelen av å kunne håndtere lange avhengigheter. Denne selvoppmerksomheten er imidlertid lettere å lære en kortere vei sammenlignet med en lengre vei med lange avhengigheter. I de forrige CLSR-verkene [21,22] kunne selvoppmerksomhet hjelpe nettverket til å lære funksjonen mer effektivt.

Derfor introduserer vi i denne artikkelen en ny spatiotemporal oppmerksom multifunksjonsmodell. Denne foreslåtte modellen trekker effektivt ut de viktige funksjonene og lærer sekvensen bedre ved å gi viktig informasjon ved å bruke en selvoppmerksomhetsmekanisme fra multifunksjon. Alle prosessene utføres i en ende-til-ende tilnærming.

3. Foreslått metode

Denne delen beskriver kjerneteknikkene til vår foreslåtte modell for CSLR. Derfor begynner vi denne delen med å forklare vår foreslåtte modells oversikt. I tillegg gir vi flere detaljer om hver nøkkelkomponent, inkludert den romlige modulen, den tidsmessige modulen og sekvenslæringsmodulen. I tillegg forklarer vi også vår foreslåtte oppmerksomhetsmodul for å hjelpe modellen å lære bedre. Til slutt kan vi integrere rammeverket for opplæring og konklusjon i vår foreslåtte modell.

3.1. Oversikt over rammeverk

Gitt en videoinngang, tar vår foreslåtte modell sikte på å forutsi det tilsvarende tegnet til en korrekt glanssetning. Den første modulen genererer flere romlige funksjoner, for eksempel full-frame og keypoint-funksjoner for hver T-frame av videoen. Deretter lar den tidsmessige modulen oss trekke ut tidsmessige korrelasjoner av de romlige egenskapene mellom rammer for begge strømmer. Som et siste trinn har de romlige og tidsmessige nettverkene blitt knyttet til toveis korttidsminne (Bi-LSTM) og CTC for sekvenslæring og inferensering. Deretter forklarer vi hovedkomponentene våre mer detaljert og fortløpende. Oversikten over vår foreslåtte arkitektur er vist i figur 1.

Figure 1


Figur 1. Den overordnede arkitekturen til den foreslåtte metoden består av tre komponenter: en romlig modul, en tidsmodul og en sekvenslæringsmodul. Den romlige modulen tar først bildesekvensen for å trekke ut rammemessige funksjoner og bruker deretter den tidsmessige modulen for å trekke ut de tidsmessige funksjonene. Deretter sendes de tidsmessige funksjonene til sekvenslæringsmodulen for å utføre ordprediksjon og konstruere den til en setning

3.2. Romslig modul

Den romlige modulen utnytter en full-frame-funksjon og nøkkelpunktfunksjoner, som vist i figur 2. Denne modulen bruker 2D-CNN-nettverksarkitektur som ryggrad, og ResNet50 er valgt for å fange opp multifunksjonene. ResNet50 er mer effektiv å brukes sammenlignet med nyere ResNet-arkitektur når det gjelder tid, samtidig som den har et sammenlignbart resultat [36,37]. RGB bruker ResNet50 direkte, mens nøkkelpunktet hentes av HRNet [38] fra videorammen og trekkes ut ved hjelp av ResNet50 for å få nøkkelpunktfunksjonene.

Figure 2


Figur 2. Den romlige modularkitekturen bruker multi-stream input. RGB-strøm som en full-frame-funksjon og keypoint-strøm som en nøkkelpunkt-funksjon.

3.2.1. Full-frame funksjon

Vi brukte forbehandlingstrinnene våre på RGB-dataene og matet deretter dataene våre inn i modellen. Vi legger dem så inn som en full-frame-inngang i arkitekturen vår. Figur 3 viser illustrasjonen av det originale RGB-bildet på venstre side og det beskårne bildet på høyre side. Det beskårede bildet brukes som input av modellen. Dette illustrerer forbehandlingstrinnet som reduserer de mindre viktige delene av bildet og setter mer fokus på underskriveren. Denne beskjæringen bruker en tilfeldig beskjæringsmetode fra [12] for å utvide datasettet. Fullframe-funksjonen trekkes ut fra det beskårede bildet for hver ramme i sekvensen ved å bruke ResNet50.

Figure 3


Figur 3. Full-frame-funksjon ved bruk av RGB-bilde, (venstre bilde) er originalbildet, og (høyre bilde) er det beskårne bildet som skal justeres med den foreslåtte modellen

3.2.2. Keypoint-funksjoner

Vi hentet ut nøkkelpunktfunksjonene i den romlige modulen fra data RGB for hver ramme i videoinngangen. Kvaliteten på nøkkelpunktfunksjoner har en viktig rolle i vår foreslåtte modell, så vi må bruke en robust tilnærming, slik som HRNet [38]. Vi brukte forhåndstrent HRNet [38] for å estimere alle de 133 hovedpunktene, og vi brukte 27 av de 133 nøkkelpunktene fra resultatet. Som vist i figur 4, er venstre side det opprinnelige nøkkelpunktet for overkroppen, og høyre side er de valgte 27 nøkkelpunktene for overkroppen. Disse 27 nøkkelpunktene inkluderer håndledd, albuer, skuldre, nakke, hender og fingre.

Figure 4


Figur 4. Nøkkelpunktfunksjoner i PHOENIX-RWTH-datasettet [33,39], (venstre bilde) utvinning fra RGB-bilde, og (høyre bilde) er det valgte nøkkelpunktet som brukes av den foreslåtte modellen.

3.3. Temporal modul

Den tidsmessige modulen tar sikte på å lære spatiotemporal informasjon fra den romlige modulen. Temporal-moduler er konstruert av stablet Temporal Pooling for hver strøm. Som vist i figur 5, består Temporal pooling-modulen av et temporal convolution-lag og et pooling-lag for å trekke ut funksjoner fra sekvensielle innganger.

Figure 5.


Figur 5. Temporal modularkitektur består av en stablet 1D-CNN og et pooling-lag innebygd med en oppmerksomhetsmodul. Arbeid parallelt for begge funksjonsstrømmene sammenkoblet i enden av de stablede lagene, og produsere en enkelt tidsfunksjon med en sekvenslengde som er fire ganger mindre.

Inngangen er en liste over romlige multifunksjoner fra forrige trinn. Den tidsmessige funksjonen oppnås ved å bruke det tidsmessige konvolusjonslaget som er et enkelt 1D konvolusjonslag med samme inngangs- og utdatalengder, etterfulgt av et enkelt sammenslåingslag som reduserer størrelsen til det halve. Å bruke disse to stablede temporale pooling-lagene er den beste konfigurasjonen, ifølge de tidligere arbeidene [12]. Etter hver tidsmessig sammenslåing legger vi inn en oppmerksomhetsmodul som vil bli forklart i detalj i avsnitt 3.4. Til slutt setter vi sammen produksjonen av tidsmessig sammenslåing fra begge strømmer.

3.4. Oppmerksomhetsmodul

Videoen har flere rammer der noen deler av bildet noen ganger er uskarpe. RTWH-PHOENIX-datasettet [33,39] har flere defekte rammer enn CSL-datasettet [8,40,41]. Dette skjer når bevegelsen er for rask, og skaper et uskarpt bilde og resulterer i feil nøkkelpunktplassering. Denne rammen anses som defekt og kan potensielt føre til feiltolkning av både RGB- og nøkkelpunktfunksjonene. Figur 6 viser en illustrasjon av defekte rammer i RTWH-PHOENIX-datasettet [33]. For å håndtere dette problemet, la vi til et oppmerksomhetslag.

Figure 6


Figur 6. Illustrasjon av defekte rammer på RWTH-PHOENIX datasett [33,39]. Noen av nøkkelpunktene i håndområdet er i feil posisjon på grunn av uskarpe bilder.

Ved å bruke CTC-algoritmen utføres justering av banen sammen med merkingen ved å bruke en tom etikett og fjerne repetisjonsetikettene. CTC foretrekker å forutsi blanke etiketter i stedet for glansgrenser når den ikke kan skille glansgrensen, men ingen av resultatene er overbevisende. Dette fører til at nettverket bruker CTC for å produsere topper i resultater når de analyserer, lærer og forutsier [42,43]. Generelt søker CTC-tapet nøkkelbildene, og det siste resultatet er prediksjonen av en bestemt nøkkelramme som har høy sannsynlighet for å være en tom etikett eller en ikke-blank etikett. Hvis glansen forutsier samme etikett eller blank etikett fortløpende, resulterer det i samme utgang. Men hvis det er en innsettingsetikett mellom den samme etiketten, selv om det bare er én feil, resulterer det i et mye større tap. Her hjelper tillegget med et oppmerksomhetslag til å velge den viktige tidssekvensen før den brukes til sekvensiell læring.

Oppmerksomhetsmodulen bruker en selvoppmerksomhetsmekanisme med flere hoder [20]. Multihodemodulen brukes til å kjøre flere parallelle oppmerksomhetsmekanismer samtidig. Multi-head oppmerksomhet kjører uavhengig for å fokusere på de kortsiktige avhengighetene eller de langsiktige avhengighetene i et eget hode. Hver utgang blir deretter sammenkoblet lineært og transformert til ønsket form.

Samtidig tar flerhodes selvoppmerksomhet mekanismen seg av informasjon fra flere representasjonsunderrom, avhengig av observasjonshistorien. For enkelhets skyld betegner vi inngangssekvensene som X. Matematisk, for enkelthodeoppmerksomhetsmodellen, gitt input X t − T pluss 1:t=[X t − T pluss 1, · · ·, X t ] ∈ RT × N × P, tre underrom oppnås, nemlig spørringsunderrommet Q ∈ RN ×dq, nøkkelunderrommet K ∈ RN × dk, og verdien underrommet V ∈ RN × dv. Den latente underromslæringsprosessen kan formuleres som [20]:

Q=XWQ, K=XWK , V=XWV ,

Deretter brukes den skalerte punktproduktoppmerksomheten til å beregne oppmerksomhetsutgangen som [20]:

Oppmerksomhet(Q, K, V)=så f tmaxQKT/ p dkV,

Videre, hvis vi har flere hoder som samtidig følger de flere representasjonene av input, kan vi oppnå mer relevante resultater samtidig. Det siste trinnet er å sette sammen alle hodene og projisere dem på nytt for å beregne den endelige poengsummen [20]:

MultiHead(Q,K,V)=Concat(head1,..., heads )WO,

hode=Oppmerksomhet(Qi,Ki,Vi),

hvor Qi=XWQ i, Ki=XWVi og WO ∈ R hd × dmodell. Til slutt kan den velge den viktige delen fra sekvensen av funksjoner fordi ikke all informasjon i sekvensen er viktig.

Som vist i figur 7 bruker vi oppmerksomhetsmodulen i flere konfigurasjoner. Den første oppmerksomhetsmodulen er plassert i enden av den romlige modulen, mens den andre og tredje oppmerksomhetsmodulen er plassert i den tidsmessige modulen. Den andre oppmerksomhetsmodulen kalt den tidlige tidsmessige oppmerksomhetsmodulen, plasseres etter den første blokken med temporal pooling som input, mens den tredje tidsmessige oppmerksomhetsmodulen, kalt den sene tidsmessige oppmerksomhetsmodulen, plasseres etter den andre blokken med tidsmessig pooling.

Figure 7

Figur 7. Oppmerksomhetsmoduler er innebygd i romlige og tidsmessige moduler i forskjellige konfigurasjoner.

Du kommer kanskje også til å like