Unormal deteksjon i Big Data-video med en forbedret autokoder

Jul 12, 2023

1. Introduksjon

Som en datasynsoppgave på høyt nivå refererer videoavviksdeteksjon til automatisk deteksjon av unormale hendelser i en gitt videosekvens, som effektivt kan skille unormale og normale aktiviteter og unormale kategorier i videoen. I løpet av de siste årene har forskere utført mye forskning knyttet til oppdagelse av anomalier [1–9]. Sammenlignet med normale hendelser, anses hendelser som sjelden inntreffer eller har lav sannsynlighet for å inntreffe vanligvis som unormale. I praksis er det imidlertid vanskelig å etablere en effektiv avviksdeteksjonsmodell på grunn av ukjente hendelsestyper og uklare definisjoner av anomalier. De fleste eksisterende anomalideteksjonsmetoder er utformet basert på antakelsen om at ethvert mønster som er forskjellig fra det innlærte normale mønsteret, betraktes som anomalier. Basert på slike forutsetninger kan den samme aktiviteten i ulike scenarier representeres som normale eller unormale hendelser. For eksempel kan en kampscene der to personer slåss på gaten anses som unormal, mens de to personene er normale når de bokser. I tillegg er det en stor mengde redundant visuell informasjon i høydimensjonale videodata, noe som øker vanskeligheten med å representere hendelser i videosekvensen.

Cistanche deserticola slice (12)

Kinesisk urt cistanche

I henhold til tidligere arbeider kan metoder for avviksdeteksjon generelt deles inn i to typer. Noen anomalideteksjonsmetoder er designet gjennom rekonstruksjonsfeil, som fokuserer på modellering av normale mønstre i videosekvenser [3–5, 7, 8, 10, 11]. (disse metodene lærer funksjonsrepresentasjonsmodellen for det normale mønsteret i treningsfasen og bruker forskjellene mellom de unormale og normale prøvene for å bestemme den endelige unormale poengsummen til testdataene under testfasen, for eksempel rekonstruksjonsfeil eller spesifikke terskler [7 –14]. Selv om de rekonstruksjonsbaserte anomalideteksjonsmetodene er gode til å rekonstruere normale mønstre i videosekvenser, er hovedproblemet med disse metodene at de i stor grad er avhengige av treningsdataene. En annen type metode anser anomalideteksjon som et klassifikasjonsproblem [ 15, 16]. For disse metodene blir anomalipoengsummen til en videosekvens forutsagt ved å bruke en trent klassifikator for å trekke ut funksjoner som et histogram av optisk stipendiat (HOF) eller dynamisk tekstur (DT). (ytelsen til disse metodene er svært avhengig av treningsprøvene. For å oppnå tilfredsstillende ytelse er det avgjørende å trekke ut effektive og diskriminerende egenskaper for slike anomalideteksjonsmetoder [17–20]. Imidlertid modellerer de to typene metoder vanligvis sammenhengene mellom hendelser på en relativt enkel måte [7, 10, 21–23]. For eksempel vurderes bare det lineære forholdet, noe som ikke er nok for komplekse, svært ikke-lineære forhold i mange tilfeller i den virkelige verden.

what does cistanche do

Ørken levende cistanche

De siste årene har metoder basert på dyp læring blitt brukt på videodeteksjonsfeltet og gjort store fremskritt [24–26]. For eksempel bruker autoenkodere (AE) rekonstruksjonsfeil for å oppdage anomalier, og en rekke metoder har blitt forbedret på dette grunnlaget. I tillegg har generative adversarial networks (GAN) og langtidskorttidsminne (LSTM) også blitt brukt for å løse anomalideteksjonsproblemet. Imidlertid kan AE ha en sterk generaliseringsevne, noe som resulterer i evnen til å rekonstruere unormale hendelser. I [14] påpekte forskerne at fordi det ikke er unormale treningsprøver, bør rekonstruksjonen av unormale prøver være uforutsigbar, noe som kan føre til større rekonstruksjonsfeil for unormale prøver. Hvis noen anomalier deler et felles komposisjonsmønster med normale treningsdata eller dekoderen er "for sterk" og ikke kan dekode noen anomalikoder godt, så kan AE rekonstruere anomalibrønnen. For å overvinne manglene ved AE, bruker denne artikkelen en minnemodul for å forbedre den dype AE og utvikler en minneforsterket AE-metode (Memory AE). Når en ny testprøve legges inn, vil Memory AE ikke kode den direkte og legge den inn i dekoderen, men bruke den som en spørring for å hente det relevante innholdet i minnemodulen. (no, innholdet samles og sendes inn i dekoderen. (prosessen realiseres ved oppmerksomhetsadressering. Videre bruker denne artikkelen differensierbare krympingsoperatorer for å indusere sparsomheten av minneadresseringsvekter, noe som kan oppmuntre minneinnhold til å nærme seg spørringer i funksjonen plass. Under treningsfasen oppdaterer koderen og dekoderen minnemodulen samtidig for å oppnå en lavere gjennomsnittlig rekonstruksjonsfeil. I testfasen er det lærte minneinnholdet fikset, og en liten mengde normale minneelementer vil bli brukt for rekonstruksjon. Hvis disse velges som nabolaget til inngangskoden, vil rekonstruksjonsfeilen være veldig åpenbar. Eksperimenter på flere offentlige benchmark-datasett viser at deteksjonsytelsen til Memory AE har nådd den nyeste teknologien.

Main Chemical Constituents of Cistanche deserticola

De viktigste kjemiske bestanddelene i Cistanche deserticola

2. Prinsippet for Algoritmen

Figur 1 viser den overordnede nettverksstrukturen til Memory AE, som er delt inn i tre understrukturer: koder (brukes til å kode input og generere spørringer), dekoder (brukes til rekonstruksjon) og minnemodul (med minne og relaterte adresseringsoperasjoner). Som vist i figur 1, gitt hendelsen som skal testes, får koderen først sin kodede verdi. Ved å bruke den kodede verdien som en spørring, henter minnemodulen det mest relevante innholdet i minnemodulen gjennom en oppmerksomhetsbasert adresseringsoperatør og sender det deretter til dekoderen for rekonstruksjon. Under treningen optimaliserer koderen og dekoderen parametrene for å minimere rekonstruksjonsfeilen og oppdaterer samtidig minnemodulen for å registrere prototypeelementene til de kodede normale dataene. Gitt en testprøve, bruker modellen bare de begrensede normale mønstrene som er registrert i minnemodulen for å utføre rekonstruksjonen. På denne måten har rekonstruksjonen en tendens til å være nær normalprøven. Derfor er rekonstruksjonsfeilen til den normale prøven liten, og den unormale feilen er stor.

Figur 1: (e flflytskjemaet for den foreslåtte minne-AE.

Figure 1: (e flflowchart of the proposed memory AE.  image

2.1. Kodere og dekodere. (e-koderen og dekoderen er to deler av AE. (e førstnevnte kartlegger inngangsdataene til funksjonsrommet for å oppnå dens kodede verdi, og sistnevnte rekonstruerer den kodede verdien til inngangsdataene. (e AE består av en koder fw1 (·) og en dekoder gw2 (·), som kan uttrykkes som

image

hvor x og x′ er inngangen til henholdsvis AE og den rekonstruerte inngangen, z er kodingsresultatene til x, og W1 og W2 angir parametrene til koderen og dekoderen, som kan oppnås ved å minimere rekonstruksjonsfeilen mellom x og x′:

image


Ved å rekonstruere feilen til den normale prøven [19, 20] for å avgjøre om den er unormal, har AE blitt brukt til å løse den unormale deteksjonsoppgaven. Rekonstruksjonen av unormale prøver bør imidlertid være uforutsigbar, noe som kan resultere i større rekonstruksjonsfeil for unormale prøver. For å løse dette problemet introduseres en minnemodul til AE i seksjon 2.2, og en Memory AE er foreslått.

2.2. Minnemodul. (den foreslåtte metoden inkluderer en minnemodul for å registrere prototype-kodingsmodusen og en adresseringsoperasjon for å få tilgang til minnemodulen.

2.2.1. Oppmerksomhetsbasert representasjon. (oppmerksomhetsmodulen er utformet som en matrise M ∈ RN×C som inneholder N sanntidsvektor. Anta for enkelhets skyld at C er dimensjonen til z; la deretter Ζ � RC. Gitt en radvektor mi, ∀i ∈ [ N], hvor [N] er et heltall fra 1 til N. Hver representerer mi et minneelement; gitt et sett med spørringer z ∈ RC, får minnenettverket?z og svarer med en myk adressevektor w ∈ R1×N as følger:

image


hvor w er en radvektor, og summen av alle elementer er 1, som representerer wi, elementet w av i. (e vektvektor kan oppnås ved z-beregning. Som vist i ligning (4), må adressevekten være i nærheten av minnemodulen. (e blandet parameter er definert som N, den maksimale kapasiteten til minnemodulen. Selv om det er N, er det ikke lett å finne det beste for forskjellige datasett, heldigvis er Memory AE ikke følsomt for innstillingen til N. Tilstrekkelig nok kan stor N brukes på hvert datasett.

2.2.2. Oppmerksomhet for minneadressering. I Memory AE er minnemodulen designet for å registrere i detalj den opprinnelige normalmodusen M i treningsfasen. (e minnemodulen er definert som innholdsadresserbart minne, z⌢, og dens adresseringsskjema beregner w, oppmerksomhetsvekten, basert på likheten mellom spørringen og minneelementet. Som vist i figur 1, kan hver vekt beregnes gjennom softmax drift wi:

image

hvor d(·, ·) representerer likhetsmålet. (er papir definerer det som en kosinuslikhet:

image


Akkurat som ligningene (4)–(6), henter minnemodulen det mest like minneelementet for å få en representasjon av z. På grunn av begrensningen av minnestørrelse og sparsom adresseringsteknologi, kan bare et lite antall interne minneelementer adresseres om gangen. (derfor kan den effektive oppførselen til minnemodulen forklares som følger. I treningsfasen er dekoderen i Memory AE begrenset til å bruke svært få adresserbare minneelementer for rekonstruksjon, noe som krever effektiv bruk av minneelementer. (derfor , under rekonstruksjonen, må minnemodulen tvinges til å registrere den mest representative prototypemodusen i normal inngangsmodus. I testfasen, gitt det trente minnet, kan bare normalmodusen i minnet hentes for rekonstruksjon. (derfor. Normale prøver kan rekonstrueres bedre. Omvendt kan den kodede verdien av den unormale inngangen erstattes av det hentede normale mønsteret, noe som resulterer i en stor rekonstruksjonsfeil i den unormale prøven.

2.3. Opplæring. Gitt et datasett som inneholder prøver xi? ?TI�1, la xi′ betegne rekonstruksjonsprøvene av xi i treningsprøvene; den minimale refaktoreringen utføres som følger:

image

(e l2-normen brukes til å måle rekonstruksjonsfeilen; wi′ representerer minneadresseringsvekten til hver prøve xi. For ytterligere å fremme sparsiteten til w′, minimeres den sparsomme regulariseringen under trening. Tatt i betraktning at alle w′ er ikke-negative og ‖w′‖1 � 1, et optimaliseringsproblem dannes som følger:

image

Ved å kombinere tapsfunksjonen til ligning (7) og ligning (8), er objektivfunksjonen til Memory AE som følger:

image


her er hyperparameteren i treningsprosessen. I praksis er satt til 0.0002. I treningsprosessen oppdateres minnet gjennom backpropagation og gradient descent. Ved tilbakepropagering kan bare gradienten til minneelementet med adressevekt som ikke er null være fra null.

2.4. Test. Etter at modellen er trent, kan rekonstruksjonsfeilen til pikselen ved posisjonen (x, y) til tennerammen t beregnes ved hjelp av følgende ligning:

image

hvor h(·) representerer hele modellen. Gitt rekonstruksjonsfeilen på pikselnivå for den tiende rammen, kan rekonstruksjonsfeilen for hele rammen av bildet oppnås ved å summere e(t) � . (x,y)e(x,y,t). (no, anomalipoengsummen til rammen kan beregnes som følger:

image


Til slutt kan en terskel settes for å bestemme om den er unormal som s(t) > θ.

3. Eksperiment

I denne delen blir effektiviteten til den foreslåtte metoden verifisert og sammenlignet med andre eksisterende metoder. For tiden brukes to offentlige datasett for eksperimenter, dvs. Avenue-datasettet og ShanghaiTech-datasettet. (E rammenivåområde under kurven (AUC) og EER brukes som kvantitative evalueringsindikatorer.

3.1. Forberedelse. (e Avenue-datasettet bruker et fast kamera med en oppløsning på 640 × 360 piksler for å fange og registrere gateaktivitetene til City University of Hong Kong. (e-datasettet Computational Intelligence and Neuroscience 3 inkluderer 16 treningsvideoklipp som inneholder normal menneskelig oppførsel og 21 testvideoklipp som inneholder unormale hendelser og menneskelig atferd. Den har totalt 30652 bilder, og alle testvideoer har merknader på målnivå, det vil si at et rektangulært område brukes til å markere anomalier i romlige steder. Normal atferd er folk som går på fortau, mens unormale hendelser er mennesker som forsøpler/kaster gjenstander, vandrer, går mot kameraet, går på gresset og kaster gjenstander. (ShanghaiTech-datasettet er en svært utfordrende samling for oppdagelse av unormale hendelser. I motsetning til andre datasett inneholder den 13 forskjellige scener med forskjellige lysforhold og kameravinkler, inkludert totalt 330 treningsvideoer og 107 testvideoer. (e testsettet inneholder totalt 130 unormale hendelser med merknader på pikselnivå. (hele datasettet har totalt 316154 bilder, inkludert 274515 bilder i treningssettet, 42883 bilder i testsettet og 17090 bilder i det unormale bildet. (e-oppløsningen for hver videoramme er 480 × 856. (e modellen er testet på en plattform med NVIDIA GTX1080TI maskinvareplattform og 8 GB videominne, og programvaremiljøet er PyTorch og Python 3.6. For å måle effektiviteten til metoden for videoavvikdeteksjon foreslått i denne artikkelen, er AUC for rammenivået mottakeroperasjonskarakteristikkurve (ROC) brukes som evalueringsindeks. For evalueringsindikatorer på rammenivå, hvis minst én piksel av en ramme er merket som unormal, anses rammen som unormal. Og AUC for rammenivå beregnes ved å sammenligne deteksjonsresultat på rammenivå med rammenivået til den virkelige etiketten.

Main Chemical Constituents of Cistanche deserticola2

De viktigste kjemiske bestanddelene i Cistanche deserticola

Klikk her for å se Cistanche-produkter

【Be om mer】 E-post:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

3.2. Eksperimentell oppsett. Alle videorammer justeres til 227 × 227 og konverteres deretter til bilder i gråtoner. (e-inngangen til modellen er 227 × 227 × 5, det vil si at 5 påfølgende rammer brukes som inngangen til modellen. Etter hvert konvolusjonslag er det et batch-normaliseringslag og et ReLU-eksitasjonslag. (e dekoder inkluderer 4 dekonvolusjonslag. (e oppmerksomhetsmodulen er satt til å la hvert minnesegment registrere en funksjon på en piksel i funksjonskartet, tilsvarende en underregion av videosegmentet. (derfor er minnemodulen en 10 00 × 64 matrise. (e Adam optimizer er valgt for optimalisering av hele modellens parametere. (e initial learning rate er 0,0001, og antall iterasjoner er 1000. (e momentum parameter er ρ1 � 0,9 og ρ2 � 0,999, og batchstørrelsen er 128.

3.3. Eksperimentelle resultater. For å bevise effektiviteten til den foreslåtte metoden i videoavviksdeteksjon, sammenligner denne artikkelen den med 12 forskjellige eksisterende metoder. Blant dem er MPPCA (hybrid of probabilistic principal component analyzer) pluss SF (sosial kraft) [17] og MDT (hybrid of dynamic texture) [18] metoder basert på manuelle funksjoner; Conv-AE [8], 3D Conv [19], Stacked RNN [20] og ConvLSTM-AE [21], MemNormality [10] og ClusterAE [22] er alle metoder basert på autoenkodere; AbnormalGAN [7] og Pred pluss Recon [23] er basert på å generere de kontradiktoriske nettverkenes metode. Tabell 1 viser videoavvikdeteksjonsresultater på rammenivå for ulike metoder. Det kan observeres at, i resultatene av de to datasettene, er metoden basert på AE vanligvis bedre enn metoden basert på håndlagde funksjoner, og høyere rammenivå AUC-er oppnås. (er fordi håndlagde funksjoner vanligvis trekkes ut basert på andre oppgaver, og derfor kan være suboptimale. I de AE-baserte metodene er ConvLSTM-AE bedre enn Conv-AE fordi førstnevnte bedre kan fange opp tidsinformasjon. I tillegg kan den også bemerkes at metoder basert på GAN gir bedre resultater enn de fleste grunnlinjemetoder. Til slutt oppnår Memory AE-metoden som er foreslått i denne artikkelen 85,7 prosent AUC på rammenivå på Avenue-datasettet, som er 0,6 prosent foran Pred plus Recon med best ytelse. [23] metoden; mens metoden foreslått i denne artikkelen oppnådde 75,3 prosent AUC på rammenivå på ShanghaiTech-datasettet, som er 2 prosent foran andre metoder i AUC på rammenivå, og effekten er veldig åpenbar. (er hovedsakelig fordi foreslått metode basert på Memory AE bruker minnefragmenter, som kan rekonstruere anomalier godt og introdusere noen tilfeldige feil. I tillegg, sammenlignet med Avenue-datasettet, har ShanghaiTech-datasettet oppnådd en høyere rammenivå AUC. (er hovedsakelig fordi ShanghaiTech-datasettet inneholder flere scener og unormale hendelser som ikke har dukket opp i andre datasett før, noe som er mer komplisert. For å verifisere deteksjonsresultatene for en enkelt scene på ShanghaiTech-datasettet, brukes et videosegment med én scene til trening og testing. 83 segmenter (25 prosent ) brukes til trening og 34 segmenter (32 prosent ) brukes til testing, og oppnår 86.3 prosent AUC på rammenivå, som har nådd et nivå som ligner det i Avenue-datasettet. Oppsummert kan den foreslåtte Memory AE-metoden brukes fleksibelt på forskjellige typer data. Bare ved å bruke rekonstruksjonsfeil kan den foreslåtte metoden oppnå bedre resultater med minst spesifikk kunnskap. For å evaluere ytelsen til den forhåndsdefinerte minnemodulen for å oppdage unormale videohendelser, er neste trinn å endre størrelsen på minnemodulen og utføre eksperimenter på Avenue-datasettet, og AUC-verdiene på rammenivå er gitt i tabell 2. Det kan bli funnet at gitt en tilstrekkelig stor minnemodulstørrelse, kan Memory AE-metoden gi de beste resultatene robust. Når størrelsen på minnemodulen er større enn 1000, er innvirkningen på deteksjonsresultatet liten, men bruk av en større minnemodulstørrelse vil resultere i en større mengde beregninger, så minnemodulstørrelsen velges som 1000. Figurer 2(a) og 2(b), henholdsvis viser noen deteksjonsresultater i Avenue-datasettet og ShanghaiTech-datasettet. (e Tabell 1: Sammenligning med de nyeste metodene når det gjelder AUC.

image


bedre enn metoden basert på håndlagde funksjoner, og AUC-er på høyere rammenivå oppnås. (er fordi håndlagde funksjoner vanligvis trekkes ut basert på andre oppgaver, og derfor kan være suboptimale. I de AE-baserte metodene er ConvLSTM-AE bedre enn Conv-AE fordi førstnevnte bedre kan fange opp tidsinformasjon. I tillegg kan den også bemerkes at metoder basert på GAN gir bedre resultater enn de fleste grunnlinjemetoder. Til slutt oppnår Memory AE-metoden foreslått i denne artikkelen 85,7 prosent AUC på rammenivå på Avenue-datasettet, som er 0,6 prosent foran best-ytende Pred plus Recon [23]-metoden; mens metoden foreslått i denne artikkelen oppnådde 75,3 prosent AUC på rammenivå på ShanghaiTech-datasettet, som er 2 prosent foran andre metoder i AUC på rammenivå, og effekten er veldig åpenbar . (er hovedsakelig fordi den foreslåtte metoden basert på Memory AE bruker minnefragmenter, som kan rekonstruere anomalier godt og introdusere noen tilfeldige feil. I tillegg, sammenlignet med Avenue-datasettet, har ShanghaiTech-datasettet oppnådd en høyere rammenivå AUC. (er hovedsakelig fordi ShanghaiTech-datasettet inneholder flere scener og unormale hendelser som ikke har dukket opp i andre datasett før, noe som er mer komplisert. For å verifisere deteksjonsresultatene for en enkelt scene på ShanghaiTech-datasettet, brukes et videosegment med én scene til trening og testing. 83 segmenter (25 prosent ) brukes til trening og 34 segmenter (32 prosent ) brukes til testing, og oppnår 86,3 prosent AUC på rammenivå, som har nådd et nivå som ligner det i Avenue-datasettet. Oppsummert kan den foreslåtte Memory AE-metoden brukes fleksibelt på forskjellige typer data. Bare ved å bruke rekonstruksjonsfeil kan den foreslåtte metoden oppnå bedre resultater med minst spesifikk kunnskap. For å evaluere ytelsen til den forhåndsdefinerte minnemodulen for å oppdage unormale videohendelser, er neste trinn å endre størrelsen på minnemodulen og utføre eksperimenter på Avenue-datasettet, og AUC-verdiene på rammenivå er gitt i tabell 2. Det kan bli funnet at gitt en tilstrekkelig stor minnemodulstørrelse, kan Memory AE-metoden gi de beste resultatene robust. Når størrelsen på minnemodulen er større enn 1000, er innvirkningen på deteksjonsresultatet liten, men bruk av en større minnemodulstørrelse vil resultere i en større mengde beregninger, så minnemodulstørrelsen velges som 1000. Figurer 2(a) og 2(b), henholdsvis viser noen deteksjonsresultater i Avenue-datasettet og ShanghaiTech-datasettet. (rammer i den grønne boksen er normale rammer fra vanlige videoklipp, og rammene i den røde boksen er unormale rammer fra unormale videoklipp. Noen unormale hendelser som å slippe konfetti, sykle på fortauet, juling osv. kan bli oppdaget.

Tabell 2: (e påvirkning av antall minnestørrelser på de eksperimentelle resultatene av Avenue-datasettet (rammenivå AUC/prosent).

Table 2: (e influence of the number of memory size on the experimental results of the Avenue dataset (frame-level AUC/%).  image

Figur 2: Eksempler på deteksjonsresultatene. (a) Eksempel fra Avenue-datasettet. (b) Eksempel fra ShanghaiTech-datasettet.

Figure 2: Examples of the detection results. (a) Example from the Avenue dataset. (b) Example from the ShanghaiTech dataset.  image


4. Konklusjon

(is paper foreslår en Memory AE for å forbedre ytelsen til big data-avviksdeteksjon i videoer. Gitt en input, bruker den foreslåtte Memory AE-metoden først en koder for å få en kodet representasjon og bruker deretter koden som en spørring for å hente den mest relevante mønstre i minnemodulen for rekonstruksjon Siden minnemodulen er opplært til å registrere typiske normale mønstre, kan den foreslåtte Memory AE rekonstruere normale prøver godt og forstørre rekonstruksjonsfeilen av abnormiteter, noe som styrker rollen til rekonstruksjonsfeil som en abnormalitetsdeteksjonsstandard. Eksperimenter på to datasett beviser allsidigheten og effektiviteten til den foreslåtte metoden. I fremtiden vil vi studere bruken av adressevekter for avviksdeteksjon. Tatt i betraktning at den foreslåtte minnemodulen er universell og ikke har noe å gjøre med strukturen til koderen og dekoder, vil den integreres i en mer kompleks grunnmodell og brukes i eksperimenter på mer utfordrende datasett.

cistanche—Improve memory4

Cistanche-tilskudd i nærheten av meg - Forbedre hukommelsen

Referanser

[1] F. Dong, Y. Zhang og X. Nie, "Dual discriminator generative adversarial network for video anomaly detection," IEEE Access, vol. 8, s. 88170–88176, 2020.

[2] K. Doshi og Y. Yilmaz, "Any-shot sequential anomaly detection in surveillance videos," i Proceedings of the CVPRW, s. 934-935, Seattle, WA, USA, juni 2020.

[3] K. Doshi og Y. Yilmaz, "Kontinuerlig læring for anomalideteksjon i overvåkingsvideoer," i Proceedings of the CVPRW, s. 254-255, Seattle, WA, USA, juni 2020.

[4] K. Jayanta, "Dutta and bonny Banerjee. Online detection of abnormal events using incremental coding length," i Proceedings of the AAAI, s. 3755–3761, Austin, Texas, USA, januar 2015.

[5] Y. Feng, Y. Yuan og X. Lu, "Learning deep event models for crowd anomaly detection," Neurocomputing, vol. 219, s. 548–556, 2017.

[6] D. Gong, L. Liu, V. Le et al., "Memorizing normality to detect anomaly: memory-augmented deep autoencoder for unsupervised anomaly detection," i Proceedings of the ICCV, s. 1705–1714, Seoul, Korea, oktober 2019.

[7] M. Ravanbakhsh, M. Nabi, E. Sangineto, L. Marcenaro, C. Regazzoni og N. Sebe, "Abnormal event detection in videos using generative adversarial nets," i Proceedings of the IEEE International Conference on Image Processing , s. 1577–1581, Beijing, Kina, september 2017.

[8] M. Hasan, J. Choi, J. Neumann, AK Roy-Chowdhury og LS Davis, "Learning temporal regularity in videosekvenser," i Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, s. 733– 742, Las Vegas, NV, USA, juni 2016.

[9] W. Liu, W. Luo, D. Lian og S. Gao, "Future frame prediction for anomaly detection–a new baseline," i Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, s. 6536– 6545, Salt Lake City, UT, USA, juni 2018.

[10] H. Park, J. Noh og B. Ham, "Learning memory-guided normality for anomaly detection," i Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, s. 14 372–{{ 3}}, Seattle, WA, USA, juni 2020.

[11] MZ Zaheer, J.-h. Lee, M. Astrid og S.-I. Lee, "Old is gold: redefinering the adversarially learned one-class classifier training paradigm," i Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, s. 14 183–214 193, Seattle, WA, USA, juni 2020.

[12] X. Zhu, J. Liu, J. Wang, Y. Fang og H. Lu, "Anomalideteksjon i den overfylte scenen via felles modellering av utseende og dynamikk," i Proceedings of the IEEE International Conference on Image Processing, s. 2705–2708, Melbourne, VIC, Australia, september 2013.

[13] RVHM Colque, CAC J´unior og WR Schwartz, "Histograms of optical fellow orientation and magnitude to detect anomalous events in videos," i Proceedings of the Sibgrapi Conference on Graphics, Patterns, and Images, s. 126–133 , Salvador, Bahia, Brasil, august 2015.

[14] Bo Zong, S. Qi, RM Martin, et al., "Deep autoencoding Gaussian mix model for unsupervised anomaly detection," i Proceedings of the International Conference on Learning Representations, Vancouver, Canada, april 2018.

[15] M. Sabokrou, M. Fayyaz, M. Fathy, Z. Moayed og R. Klette, "Deep-anomaly: fullt konvolusjonelt nevralt nettverk for rask avviksdeteksjon i overfylte scener," Computer Vision and Image Understanding, vol. 172, s. 88–97, 2018.

[16] C. Li, Z. Han, Q. Ye og J. Jiao, "Deteksjon av visuell unormal atferd basert på bane sparsom rekonstruksjonsanalyse," Neurocomputing, vol. 119, nr. 7, s. 94–100, 2013.

[17] V. Mahadevan, W. Li, V. Bhalodia og N. Vasconcelos, "Anomaly detection in crowded scenes," i Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), s. 1975–1981, IEEE, San Francisco, CA, USA, juni 2010.

[18] W. Li, V. Mahadevan og N. Vasconcelos, "Anomalideteksjon og lokalisering i overfylte scener," IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 36, s. 18–32, 2014.

[19] Y. Zhao, B. Deng, C. Shen, Y. Liu, H. Lu og X.-S. Hua, "Spatio-Temporal AutoEncoder for video anomaly detection," i Proceedings of the ACM International Conference on Multimedia (ACM MM), s. 1933–1941, ACM, Mountain View California USA, oktober 2017.

[20] W. Luo, L. Wen og S. Gao, "A revisit of sparse coding based anomaly detection in stacked RNN framework," i Proceedings of the IEEE International Conference on Computer Vision (ICCV), Venezia, Italia, oktober 2017.

[21] W. Luo, L. Wen og S. Gao, "Remembering history with convolutional LSTM for anomaly detection," i Proceedings of the IEEE International Conference on Multimedia and Expo (ICME), s. 439–444, IEEE, Hong Kong, juli 2017.

[22] Y. Chang, Z. Tu, W. Xie og J. Yuan, "Clustering driven deep autoencoder for video anomaly detection," i Proceedings of the European Conference on Computer Vision (ECCV), s. 329–345, Springer, Glasgow, Storbritannia, august 2020.

[23] L. Wen, W. Luo, D. Lian og S. Gao, "Future frame prediction for anomaly detection – a new baseline," i Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. . 6536–6545, IEEE, Salt Lake City, UT, USA, juni 2018.

[24] M. Song, "A mean field view of the landscape of two-layer neural networks," Proceedings of the National Academy of Sciences, vol. 115, nr. 33, s. E7665–E7671, 2018.

[25] B. Ding og G. Wen, "Sparsity constraint nearest subspace classifier for target recognition of SAR images," Journal of Visual Communication and Image Representation, vol. 52, s. 170–176, 2018.

[26] T. Wang og H. Snoussi, "Deteksjon av unormale visuelle hendelser via globalt optisk stipendiatorienteringshistogram," IEEE Transactions on Information Forensics and Security, vol. 9, nei. 6, s. 988–998, 2014.

Du kommer kanskje også til å like