Trafikkskiltgjenkjenning basert på YOLOv3-algoritmen del 2

Jan 19, 2024

2. Grunnleggende algoritmer

2.1. YOLOv3-algoritmen

YOLOv3 [14] er Redmons forbedrede ett-trinns måldeteksjonsalgoritme basert på YOLOv2, som har forbedret deteksjonsnøyaktighet og sanntidsytelse og utkonkurrerer andre algoritmer når det gjelder hastighet og nøyaktighet.

De siste årene har den raske utviklingen av kunstig intelligens-teknologi gjort det mulig å bruke ulike intelligente deteksjonssystemer på ulike felt. Deteksjonsnøyaktighet er en viktig indikator for å evaluere kvaliteten på et intelligent system, og minne er en av kjernefunksjonene som støtter driften av et intelligent system. Så, hva er forholdet mellom de to?

Først av alt må vi gjøre det klart at deteksjonsnøyaktighet og minne ikke er en enkel "positiv korrelasjon" eller "negativ korrelasjon". Det er høy grad av samhandling og koordinering mellom dem. I mange tilfeller avhenger deteksjonsnøyaktigheten til et intelligent system av minnet, det vil si evnen til å forstå og lære eksempeldata.

For eksempel, innen ansiktsgjenkjenning, må et godt ansiktsgjenkjenningssystem være i stand til nøyaktig å identifisere forskjellige ansikter og matche dem med personens informasjon i den kjente ansiktsdatabasen. Dette krever at det intelligente systemet har et sterkt minne, kan lagre informasjonen til kjente ansikter i databasen og bruke den fleksibelt i påfølgende gjenkjenningsoppgaver.

Tilsvarende, i det medisinske feltet, trenger intelligente systemer å forstå og huske en stor mengde medisinsk kunnskap for å hjelpe leger med sykdomsdiagnostikk og behandlingsplandesign. Dette krever også at det intelligente systemet har sterk hukommelse og læringsevner, kontinuerlig absorberer ny medisinsk kunnskap, og kryssverifiserer og oppgraderer med den eksisterende kunnskapsbasen.

Forholdet mellom deteksjonsnøyaktighet og minne er selvfølgelig ikke enveis. Tvert imot kan god deteksjonsnøyaktighet også fremme minneforbedringen til intelligente systemer. For eksempel, i noen klassifiserings- og gjenkjenningsoppgaver, må intelligente systemer kontinuerlig gi tilbakemelding og optimalisering for å kontinuerlig forbedre nøyaktigheten og presisjonen, og dermed styrke evnen til å forstå og huske eksempeldata ytterligere.

Generelt er deteksjonsnøyaktighet og minne to uunnværlige elementer for driften av intelligente systemer. De har komplekse interaksjoner og relasjoner som må vurderes fullt ut og koordineres. Bare ved å kontinuerlig forbedre deteksjonsnøyaktigheten og kontinuerlig styrke minnet og læringsevnen til det intelligente systemet kan den omfattende utviklingen og anvendelsen av det intelligente systemet virkelig realiseres. Det kan sees at vi trenger å forbedre hukommelsen, og Cistanche deserticola kan forbedre hukommelsen betydelig, fordi Cistanche deserticola også kan regulere balansen av nevrotransmittere, som å øke nivåene av acetylkolin og vekstfaktorer. Disse stoffene er svært viktige for hukommelse og læring. I tillegg kan Kjøtt også forbedre blodstrømmen og fremme oksygentilførsel, noe som kan sikre at hjernen får tilstrekkelig med næringsstoffer og energi, og dermed forbedre hjernens vitalitet og utholdenhet.

improving brain function

Klikk vet kosttilskudd for å øke hukommelsen

YOLOv3 er for tiden den mest populære algoritmen i YOLO-familien og er mye brukt i virkelige deteksjonsscenarier [15]; YOLOv3-nettverksstrukturen er vist i figur 1.

increase brain power

Den komplette konvolusjonsstrukturen som brukes av YOLOv3 er ikke begrenset av størrelsen på bildeinndata.

Pooling- og fullt tilkoblede lag fjernes fra hele nettverksstrukturen, og et konvolusjonslag med en trinnstørrelse på 2 brukes i stedet for pooling-laget for nedsamplingsoperasjonen, noe som forhindrer tap av målinformasjon under sammenslåing og letter oppdagelsen av små mål [ 16].

I tillegg erstatter YOLOv3 DarkNet-19 nettverksstrukturen til YOLOv2 med DarkNet-53funksjonsutvinningslaget.

DarkNet-53-nettverket, som lykkes med å løse gradientproblemet med det dype nettverket og tapet av original informasjon under flerlagskonvolusjonsoperasjonen for bedre å trekke ut funksjoner og forbedre gjenkjenning og klassifisering [17], låner den gjenværende nettverksstrukturen til ResNet [ 18] og bruker den opprinnelige utgangen fra forrige lag som en del av inngangen i det siste laget av nettverket.

Som vist i figur 2, består den resterende modulen i YOLOv3 av to konvolusjonslag og et snarveislag.

increase memory power

Videre bruker YOLOv3 forestillingen om et funksjonspyramidenettverk (FPN) (19] og introduserer funksjonspyramidenettverket for å forutsi funksjonskart i tre skalaer, med deteksjonsskalaer på 13 x 13, 26 x 26 og 52 x 52.

Metoden for funksjonsutvinning av det konvolusjonelle nevrale nettverket er nedenfra og opp i FPN-nettverket, og prosessen med oppsampling av konvolusjonslagskartene er ovenfra og ned, som vist i figur 3.

2.2. Romlig pyramideformet samlingsstruktur

Den romlige pyramidpooling-strukturen (SPP) (20) løser problemet med gjentatt utvinning av bildefunksjoner av konvolusjonelle nevrale nettverk og forbedrer deteksjonseffektiviteten betydelig; SPPNet-nettverksstrukturen er vist i figur 4.

improve cognitive function

For å sikre at oppløsningen til inngangsbildet samsvarer med funksjonsdimensjonen til det fullt tilkoblede laget i et nevralt nettverk med et fullt tilkoblet lag, kreves regionbeskjærings- og skaleringsoperasjoner på inngangsbildet.

Skalerings- og beskjæringsprosesser vil resultere i tap av bildefunksjonsinformasjon, redusere deteksjonsnøyaktigheten og påvirke deteksjonsresultater: skalerings- og beskjæringsprosesser vil imidlertid resultere i tap av bildefunksjonsinformasjonsdeteksjonsnøyaktighet og påvirke gjenkjenningsresultatene, mens SPPNet kan overvinne begrensninger som fast størrelse på inndatabildet, sparer beregningskostnadene 21.

improve short term memory

3. Forbedret YOLOv3

3.1. Forbedret YOLOv3-nettverksstruktur

Det grunnleggende funksjonsekstraksjonsnettverket nedsamples vanligvis fem ganger, med en nedsamplingshastighet på 2, og multiplisiteten på fem ganger nedsampling er 32 til femtepotensen av to, ifølge COCO-datasettets beskrivelse.

Hvis nedsamplingen fortsetter, vil det oppnådde funksjonskartet være ett, og målinformasjonen vil gå tapt. Små mål er færre enn 32 × 32 piksler, middels mål er 32 × 32–96 × 96 piksler, og gigantiske mål er større enn 96 × 96 piksler [22].

Som illustrert i figur 5, var TT100K-trafikkskiltdatasettet som ble brukt i dette arbeidet, hovedsakelig sammensatt av små og mellomstore mål, med store mål som utgjør bare 7,4 % av det totale datasettet og små mål står for 42,5 % [23].

increase memory

TT100K-datasettet har høy oppløsning, der hvert bilde har en oppløsning på 2048 × 2048 piksler og de største trafikkskiltene blant de små målene utgjør mindre enn 0,1 % av hele bildet, noe som utgjør en betydelig utfordring for målet deteksjonsalgoritme.

Små mål har begrensede funksjoner og krever stor lokaliseringspresisjon.

Til tross for introduksjonen av FPN-strukturen i YOLOv3 for å utnytte multi-skala funksjonsfusjon for å produsere spådommer ved å smelte sammen funnene av distinkte funksjonslag, som er kritisk for identifikasjon av små mål, var resultatene fortsatt utilfredsstillende.

I YOLOv3-nettverket inneholder det grunne laget mindre semantisk informasjon, men en presis målplassering, mens det dype laget har mer enn en grov målplassering.

Som et resultat brukes grunne konvolusjonslag til å forutsi små mål og dype konvolusjonslag brukes til å forutsi store mål. En fjerde funksjonsprediksjonsskala på størrelse 152 × 152 ble lagt til de tre funksjonsprediksjonsskalaene til YOLOv3-nettverksstrukturen for å fullt ut utnytte de grunne funksjonene i nettverket for å forutse små mål.

Med en inngangsbildestørrelse på 608 × 608, var utgangsbildefunksjonsstørrelsen 152 × 152 etter konvolusjon og en to ganger oppsampling av inngangsbildet, og funksjonslaget ble indusert gjennom rutelaget; denne funksjonsekstraksjonen ble smeltet sammen med 11. lag-funksjonen for å øke den fjerde funksjonsprediksjonsskalaen.

I tillegg ble SPP-modulen lagt til for å realisere sammenslåingen av lokale og globale funksjoner ved å låne begrepet SPPNet og kombinere det med YOLOv3.

Før YOLO-deteksjonslaget ble SPP-modulen integrert mellom det femte og sjette konvolusjonslaget, og SPP-modulens funksjonskart og funksjonskart ble koblet til igjen og sendt til neste deteksjonsnettverkslag.

improve working memory

For å oppnå funksjonskartnivåsammenslåingen av lokale og globale funksjoner, bør SPP-modulens maksimale poolingkjerner være så nær størrelsen på funksjonskartet som skal samles som mulig.

For å minimere beregningsinnsatsen forårsaket av SPP-modulen, berike funksjonskart-uttrykksevnen og øke deteksjonseffekten, var SPP-modulen i denne forskningen sammensatt av to parallelle grener, som hver var sammensatt av et 19 × 19 maks poolingslag og et hopp forbindelse. Figur 6 viser den forbedrede YOLOv3-nettverksstrukturen.

ways to improve brain function

3.2. Forbedret tapsfunksjon

Tapsfunksjonen til YOLOv3 er sammensatt av senterkoordinattapet (tap), bredde-høydekoordinattap (tap), konfidensstap (lossconf) og klassifiseringstap (tap). Det sentrale koordinattapet er representert ved:

improve your memory

hvor λcoord betegner koordinattapets vekt; λnoobj betegner selvtillitstapet uten et objekt; Iobjij angir om den jth ankerboksen til den ite cellen er ansvarlig for objektet (1 eller 0); Inobbyij betegner den jth ankerboksen i det ith-gitteret som ikke er ansvarlig for objektet; (xi,yi,wji,hjI, CjI, Pji) angir de forutsagte målboksens koordinater, konfidens og kategori; og (xˆji,yˆji,wˆji,ˆhjI, CˆjI, Pˆji) angir de reelle målbokskoordinatene, konfidensen og kategorien

YOLOv3 tapsfunksjonen er representert av ligning (5), der tapsfunksjonen for gjennomsnittlig kvadratfeil (MSE) brukes for grenseboksregresjonen og kryssentropi brukes som tapsfunksjonen i lossconf og locals.

tap=lossxy + losswh − losscon f − losscls (5)

Imidlertid er bruk av MSE som grenseboksregresjonens tapsfunksjon ugunstig for deteksjon av små mål, følsom for objektskala, og fokuserer på mål i stor skala samtidig som den er uvennlig mot objekter i liten skala.

For å balansere tapet av store og små mål og maksimere deteksjonsresultatene ved å svekke innflytelsen av grenseboksstørrelsen på bredde- og høydetapsfunksjonen, ble IoU-type tapsfunksjonen brukt i denne artikkelen, og det metriske tapet generert av IoU ble brukt som en ytelseslikning (6).

IoU =|A ∩ B||A ∪ B|(6)

Når avgrensningsboksen og målboksen ikke overlapper hverandre, gjenspeiler ikke IoU=0 avstandsgapet mellom de to boksene; når prediksjonsboksen og den merkede boksen overlapper fullstendig, IoU=1, kan ikke grenseboksens midtpunkt bestemmes, og størrelsesgapet med målboksen kan ikke optimaliseres ytterligere.

DIoU tap [24] er uavhengig av størrelse; derfor vil store størrelser ikke resultere i store tap. Fordi en liten størrelse gir et lite tap, som kan løse problemet, brukte dette arbeidet DIoU-tapet, hvis beregningsformel er presentert i ligning (7).

D IoU-tap=1 − IoU +ρ2 b, bgt c2(7)

der b og bgt angir de sentrale punktene, ρ er den euklidiske avstanden, og c er diagonallengden til den minste omsluttende boksen som dekker de to boksene.

DIoU-tap minimerer avstanden mellom to målrammer direkte, konvergerer raskt, og er mer i tråd med målrammeregresjonsmekanismen, som tar hensyn til avstanden mellom målet og ankeret, overlappingshastigheten og skalaen, noe som gjør målrammeregresjonen mer stabil, mens den fortsatt gir gradientretningen for den avgrensende boksen når den ikke overlapper med målrammen.

help with memory


For more information:1950477648nn@gmail.com


Du kommer kanskje også til å like