Trafikkskiltgjenkjenning basert på YOLOv3-algoritmen del 3
Jan 19, 2024
3.3. Generering av Priori-rammer basert på K-Means-klyngealgoritme
Ankermekanismen ble implementert i YOLOv2, og antallet ankere ble økt til ni i YOLOv3 for å gjøre de genererte kandidatområdene mer like de ekte merkede rammene og øke gjenkallingen av deteksjonsnettverket.
Det er en sterk sammenheng mellom markerte rammer og minne. Markeringsrammer kan hjelpe oss med å etablere et fast, regelmessig og ryddig minneramme, noe som gjør det lettere å huske store mengder informasjon. For eksempel, når vi lærer et språk, kan vi bruke merkede rammer for å huske nye ord og grammatikkregler. Når vi gjennomgår historien, kan vi bruke markerte rammer for å huske historiske hendelser og tidslinjer. På denne måten kan vi gjøre abstrakt kunnskap mer konkret og forståelig.
Samtidig kan markeringsrammer også stimulere hjernens assosiasjonsevne, og dermed forbedre hukommelsen vår. Fordi hukommelsen vår er basert på assosiasjon og sammenheng, kan vi ved å etablere markerte rammer mer naturlig koble ny kunnskap med eksisterende kunnskap, fordype hukommelsen og forståelsen.
Menneskets hukommelsesevne kan trenes og forbedres. Gjennom konstant øving og bruk av hukommelsesteknikker som å markere rammer, kan vi forbedre hukommelsen og bedre takle kompleks informasjon og oppgaver i liv og arbeid.
Kort sagt er merking av rammer en svært effektiv minneteknikk. Det kan hjelpe oss å huske viktig informasjon raskere og mer nøyaktig. Det kan også stimulere vår assosiative evne og forbedre hukommelsen vår. La oss aktivt bruke markerte rammer for å kontinuerlig forbedre hukommelsesferdighetene våre! Det kan sees at vi trenger å forbedre hukommelsen, og Cistanche deserticola kan forbedre hukommelsen betydelig fordi Cistanche deserticola er et tradisjonelt kinesisk medisinsk materiale som har mange unike effekter, hvorav en er å forbedre hukommelsen. Effekten av kjøttdeig kommer fra de ulike aktive ingrediensene den inneholder, inkludert syre, polysakkarider, flavonoider osv. Disse ingrediensene kan fremme hjernens helse på ulike måter.

Klikk på Know for å forbedre korttidshukommelsen
Det var ikke hensiktsmessig å bruke det opprinnelige ankeret, siden trafikkskilt primært er små og mellomstore mål, med færre store mål i TT100K-datasettet. For et spesifikt datasett kan valg av et passende innledende anker forbedre deteksjonseffekten, gjøre nettverket lettere å lære og øke deteksjonshastigheten til grenseboksen.
Flyten til K-betyr klyngealgoritmen for å oppnå kandidatbokser er vist i figur 7.
I TT100K-datasettet inkluderte den forbedrede YOLOv3-nettverksstrukturen en funksjonsprediksjonsskala, noe som resulterte i fire skalaer og tolv ankere: (4, 5), (5, 6), (7, 7), (7, 13), (8, 8), (9, 10), (11, 12), (13, 14), (16, 17), (20, 22), (27, 29) og (41, 44).

4. Eksperimenter og analyse av resultater
4.1. Datasett og evalueringsindikatorer
Det er noen få store, offentlig tilgjengelige trafikkskiltdatasett, hvorav de fleste bruker GTSDB, men GTSDB er ikke det samme som kinesiske trafikkskilt. CTSDB, CCTSDB og TT100K, blant andre, er kinesiske trafikkskiltdatasett.
CCTSDB ble utvidet basert på CTSDB, og kategoriene ble delt inn i varselskilt, retningsskilt og forbudsskilt, uten detaljert klassifisering av trafikkskilt.
TT100K trafikkskiltsamlingen ble laget i samarbeid mellom Tencent og Tsinghua University. Den tilbød grundig kategorisering og identifikasjon av trafikkskilt, dekket ulike klimatiske og lysforhold, og var mer nøyaktig for faktiske kjøresituasjoner.
Derfor ble TT100K trafikkskiltdatasettet brukt i denne artikkelen, og noen av trafikkskiltene og kategoriinformasjonen er vist i figur 8.

TT100K-datasettet har 100,000 bilder med en oppløsning på 2048 x 2048 piksler, selv om det er umerkede trafikkskiltbilder, og noen kategorier har bare noen få bilder eller dupliserte bilder, noe som reduserer gjenkjenningseffekten.
Derfor fjernet denne artikkelen de umerkede og dupliserte trafikkskiltbildene fra datasettet og valgte 45 kategorier med et høyt antall trafikkskilt, der de 45 trafikkskiltkategoriene var: pn, pne, i5, pll, pl40, po,pl50, pl80 , io, pl60, p26, i4, pll00, pl30, il60, l5, i2, w57, p5, p10, ip, pl120, il80, p23, pr40.ph4. 5, w59, p12, p3, w55. pm20, pl20, pg, pl70, pm55, il100, p27, w13, p19, ph4, ph5, wo, p6.pm30 og w32, og nummeret til hver trafikkskiltkategori er vist i figur 9.

Figur 9 viser at selv om 45 kategorier med et stort antall trafikkskilt ble valgt, var det fortsatt en betydelig ubalanse i datamengden mellom hver kategori, noe som resulterte i dårlig modellprediksjonsnøyaktighet. Som et resultat, som illustrert i figur 10, balanserte og utvidet dette arbeidet datasettet ved å bruke taktikker som fargedithering, gaussisk støy og bilderotasjon for å sikre at mengden av hver kategori var så lik som mulig.

Mosaikk-tilnærmingen leser fire bilder om gangen, skalerer og endrer fargespekteret til hvert bilde, arrangerer dem i fire retninger og syr deretter bildene sammen for å skape målets sanne ramme.
Forbedringsmetoden syr sammen fire bilder, tilsvarende å beregne parameterne for fire bilder med én inngang. Dette kan redusere antall bilder for batch-inndata, redusere treningsvansker og treningskostnader, forbedre treningshastigheten og i stor grad berike antall prøver i datasettet, noe som bidrar til læring.
i denne artikkelen ble evalueringsberegningene til COCO-datasettet, inkludert mAPou - 050AP-er, APM, AP og flere andre beregninger, brukt til å evaluere ytelsen til modellen. Spesielt tilhørte de fleste trafikkskiltene i TT100K trafikkskiltdatasettet små mål, så spesiell oppmerksomhet måtte vies til deteksjonsnøyaktigheten til små mål. De spesifikke betydningene av evalueringsberegningene er som følger:
AP: Området under PR-kurven, der PR er henholdsvis presisjon og tilbakekalling:
API {{0}}.50: Når IoU-terskelen er satt til 0.50, er det gjennomsnittet av alle kategorier av AP i datasettet, som er evalueringsindeksen til PASCAL VOC-datasettet og tilsvarer til APIoU=0.50 i COCO-evalueringsindeksmAPloU= 0.50: Når loU-terskelen er satt til 0.50, er det gjennomsnittet av alle kategorier av AP i datasettet, som er evalueringsindeksen for PASCAL VOC-datasettet og tilsvarer APloU=0.5 i COCO-evalueringsindeksen.
AP-er: gjennomsnittsverdi av mAP for små objekter: område < 322, og loU =-område (0.5, 1.00, 0.05) for totalt sett på 10 oUs.

APm: middels objekter: 322 < område < 962, og loU=område (0.5, 1.00, 0.05) middelverdi av mAP for en totalt 10 IoUs.
AP: gjennomsnittsverdi av mAP for store objekter: område > 962, og loU =-område (0.5, 1.00, 0.05for totalt 10 IoUs.
4.2. Eksperimentelle resultater og analyse
4.2.1. Forbedret YOLOv3 sammenligningseksperiment
Tre YOLOv3-nettverk med forbedrede metoder ble sammenlignet og testet i denne studien, ved å bruke TT100K trafikkskiltdatasettet og inndatabilder som var 608 × 608 piksler i størrelse. Figur 11 viser kartet og AR for M-YOLOv3 trent på TT100-datasettet.
Deteksjonsresultatene for ulike størrelser av mål er vist i figur 12 og tabell 1. Blant dem tok YOLOv3-DK i bruk strategien for å forbedre tapsfunksjonen DIoU tap og re-clustering anker; YOLOv3-SPP tok i bruk fusjonsromstrategien til pyramidpooling-strukturen; YOLOv3-4jeg tok i bruk strategien med å legge til det fjerde prediksjonslaget med 152 × 152 skalaer; og M-YOLOv3 var YOLOv3-nettverksstrukturen ved å bruke alle de forbedrede strategiene.


Tabell 1 og figur 12 viser at gjennomsnittlig gjennomsnittlig nøyaktighet for den opprinnelige YOLOv3 uten å bruke noen strategier var 68,9 %. Derimot var kartet over den oppgraderte YOLOv3 med alle metoder 77,3 %, en forbedring på 8,4 % i deteksjon.
DIoU tapsfunksjonen og re-clustering ankerteknikk forbedret deteksjonsnøyaktigheten med 1,3 %; Imidlertid skyldtes forbedringen raskere tapsfunksjonskonvergens under trening, noe som gjorde målboksregresjonen mer stabil og forbedret tilbakekallingsfrekvensen. Mer uttalte forbedringer i mAP ble sett i YOLOv3, som inkluderte en SPP-struktur og oppnådde 73,2 %.
SPP-strukturen kombinerte lokale og globale egenskaper, forbedret funksjonskartets evne til å uttrykke seg og økte deteksjonsnøyaktigheten betydelig. Ved å bruke metoden for å legge til et fjerde prediksjonslag med 152 × 152 skalaer, ble themAP også betydelig forbedret.
Nøyaktigheten til deteksjon av små mål ble forbedret med 10,5 % sammenlignet med YOLOv3, som gjorde full bruk av de grunne funksjonene i nettverket for prediksjon av små mål, noe som resulterte i en betydelig forbedret deteksjonseffekt, men på bekostning av økt nettverkskompleksitet og prosessering . Den beste forbedringen var M-YOLOv3, som kombinerte de tre forbedringsprosedyrene og oppnådde en mAP på 77,3 %, som er 8,4 % høyere enn den opprinnelige YOLOv30s gjennomsnittlige gjennomsnittlige nøyaktighet. Figur 13 viser testresultatene til M-YOLOv3 på TT100K.

4.2.2. Sammenligning av den forbedrede YOLOv3-algoritmen med andre algoritmer
M-YOLOv3 ble sammenlignet med flere andre klassiske måldeteksjonsalgoritmer for ytterligere å validere deteksjonsgjenkjenningen av det forbedrede nettverket, og resultatene er vist i tabell 2.

Tabell 2 viser at M-YOLOv3 hadde den høyeste mAP på 77,3 %, og SSD hadde den beste sanntidsytelsen, med en FPS på 42. Sammenlignet med den originale YOLOv3-algoritmen, var gjennomsnittlig presisjonsgjennomsnitt betydelig forbedret, selv om sanntid ytelsen ble redusert. Sammenlignet med ett-trinns algoritmen SSD, ble mAP forbedret med 12 %, men det var fortsatt et gap i sanntidsytelse. Sammenlignet med to-trinns måldeteksjonsalgoritmen Faster-RCNN, ble FPS forbedret til 22, og mAP ble også forbedret med 1,7 %, noe som forbedret deteksjonshastigheten, så vel som deteksjonsnøyaktigheten. Forsøkene viste at M-YOLOv3 presterte bedre når det gjelder deteksjonsnøyaktighet og hastighet.
4.2.3. Forbedret gjenkjennelseseffekt av YOLOv3 på trafikkskilt i et spesielt miljø
På grunn av ulike faktorer, som sterk lysbestråling, nattetid og spesielle miljøer for trafikkskiltokkklusjon, som vil påvirke trafikkskiltdeteksjon og gjenkjenning i virkelige kjørescenarier, var det også nødvendig å vurdere modellens gjenkjennelseseffekt på trafikkskilt i spesielle miljøer. Under spesielle omstendigheter ble den oppgraderte YOLOv3-modellen brukt for å gjenkjenne trafikkskilt, som vist i figur 13.
I figur 14 sammenlignes deteksjonseffekten av YOLOv3 med den til M-YOLOv3 i et spesielt miljø. Som vist i figur 14(b1,c1), klarte ikke YOLOv3-algoritmen å oppdage det skjulte trafikkskiltet i tilfellet med et skjult trafikkskilt, mens den forbedrede YOLOv3-algoritmen nøyaktig identifiserte det skjulte trafikkskiltet; som vist i figur 14(b2,c2), hadde YOLOv3-algoritmen problemer med falsk deteksjon og tapt deteksjon for trafikkskiltgjenkjenning under miljø med sterk lysbestråling, mens den forbedrede YOLOv3-algoritmen gjenkjente alle trafikkskiltene nøyaktig.

Den forbedrede YOLOv3-algoritmen økte den fjerde funksjonsprediksjonsskalaen for små mål, og forbedret deteksjonseffekten av små mål, mens YOLOv3-algoritmen hadde problemer med savnet deteksjon og lav konfidens for små mål, som vist i figur 14(b3,c3); i svakt opplyste omgivelser, som om natten, gjenkjente den oppgraderte YOLOv3-algoritmen trafikkskilt, som illustrert i figur 14(b4,c4); YOLOv3-metoden oppdaget imidlertid ikke mål. Som et resultat, under spesielle situasjoner, ga den oppdaterte YOLOv3-algoritmen fortsatt bedre deteksjonsresultater.

5. Konklusjoner
Et trafikkskiltdeteksjons- og gjenkjenningsnettverk basert på den modifiserte YOLOv3 ble foreslått i denne forskningen, for å møte vanskelighetene med små mål som er vanskelige å oppdage og lav deteksjonsnøyaktighet i trafikkskiltdeteksjon og identifiseringsoppgaver.
Den nye romlige pyramidale sammenslåingsstrukturen muliggjorde fusjonen av lokale og globale funksjoner i denne studien, samt økte den fjerde funksjonsprediksjonsskalaen for små mål for å forbedre deteksjonseffekten av små mål. For å gjøre målrammeregresjonen mer stabil, ble DIoU-tapet utnyttet, som hadde en raskere konvergens og var mer konsistent med målrammeregresjonen.
Deteksjonsnettverkets nøyaktighet ble betydelig forbedret ved å skade sanntidsnettverket så lite som mulig. MAP økte med 8,4 poeng. Den oppgraderte YOLOv3-algoritmen forbedret nettverkets kompleksitet og senket deteksjonshastigheten. Sanntidsdeteksjon er imidlertid fortsatt langt unna; derfor vil det neste forskningsområdet være å øke deteksjonshastigheten for å oppnå effekten av sanntidsdeteksjon.
Forfatterbidrag: Metodikk og skriving av originalutkast, AL og CG; formell analyse og etterforskning, YS; datakurering, NX; ressurser, AL; validering, WH Alle forfattere har lest og godtatt den publiserte versjonen av manuskriptet.
Finansiering: Dette prosjektet ble støttet av Shandong Provincial Higher Education Youth Innovation Science and Technology Program (Grant No.2019KJB019), Shandong Provincial NaturalScience Foundation of China (Grant No. ZR2021MF131, ZR2015EL019, and ZR2020MENational Natural), og Foundation of the Natural Science. Kina (tilskudd nr. 61601265 og 51505258). Dette prosjektet ble finansiert av China Postdoctoral Science Foundation (Grant No. 2021M701405), Open Project of State Key Laboratory of Mechanical Behavior and System Safety of Traffic Engineering Structures, China (Grant No. 1903), the Open Project of Hebei Traffic Safety and Control Key Laboratory, Kina (tilskudd nr. JTKY2019002), og det store forsknings- og teknologiinnovasjonsprosjektet i Shandong-provinsen (tilskudd nr. 2022CXGC020706).
Uttalelse fra institusjonell vurderingskomité: Ikke aktuelt.
Informert samtykkeerklæring: Ikke relevant.
Datatilgjengelighetserklæring: Ikke relevant.
Takk: Vi takker alle forfatterne for deres bidrag til skrivingen av denne artikkelen.
Interessekonflikter: Forfatterne erklærer ingen interessekonflikter.

Referanser
1. De la Escalera, A.; Armingol, JM; Mata, M. Trafikkskiltgjenkjenning og analyse for intelligente kjøretøy. Bilde Vis. Comput. 2003,21, 247–258. [CrossRef]
2. Saadna, Y.; Behloul, A. En oversikt over trafikkskiltdeteksjon og klassifiseringsmetoder. Int. J. Multimed. Informasjon. Retr. 2017, 6 193–210. [CrossRef]
3. Boumediene, M.; Cudel, C.; Basset, M.; Ouamri, A. Trekantet trafikkskiltdeteksjon basert på RSLD-algoritme. Mach. Vis. Appl.2013, 24, 1721–1732. [CrossRef]
4. Maldonado-Bascón, S.; Lafuente-Arroyo, S.; Gil-Jimenez, P.; Gomez-Moreno, H.; Lopez-Ferreras, F. Veiskiltdeteksjon og gjenkjenning basert på støttevektormaskiner. IEEE Trans. Intell. Transp. Syst. 2007, 8, 264–278. [CrossRef]
5. Bahlmann, C.; Zhu, Y.; Ramesh, V.; Pellkofer, M.; Koehler, T. Et system for trafikkskiltdeteksjon, sporing og gjenkjenning ved bruk av farge-, form- og bevegelsesinformasjon. I Proceedings of the IEEE Proceedings. Intelligent Vehicles Symposium, 2005, Las Vegas, NV, USA, 6.–8. juni 2005; s. 255–260.
6. Ren, S.; Han, K.; Girshick, R.; Sun, J. Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks.Adv. Nevral informasjon. Prosess. Syst. 2015, 28, 91–99. [CrossRef] [PubMed]
7. Liu, W.; Anguelov, D.; Erhan, D.; Szegedy, C.; Reed, S.; Fu, C.-Y.; Berg, AC SSD: Single Shot MultiBox-detektor. I European Conference on Computer Vision; Springer: Cham, Sveits, 2016; s. 21–37.
8. Redmon, J.; Divvala, S.; Girshick, R.; Farhadi, A. Du ser bare én gang: Samlet gjenstandsdeteksjon i sanntid. I Proceedings of theIEEE Conference on Computer Vision and Pattern Recognition, Las Vegas, NV, USA, 27.–30. juni 2016; IEEE: Piscataway, NJ, USA, 2016; s. 779–788.
9. Wang, Z.; Guo, H. Forskning på trafikkskiltdeteksjon basert på konvolusjonelt nevralt nettverk. I Proceedings of the 12th InternationalSymposium on Visual Information Communication and Interaction, Shanghai, Kina, 20.–22. september 2019; s. 1–5.
10. Han, C.; Gao, G.; Zhang, Y. Oppdaging av små trafikkskilt i sanntid med revidert raskere RCNN. Multimedia. Verktøy Appl. 2019, 78,13263–13278. [CrossRef]
11. Zhang, J.; Huang, M.; Jin, X.; Li, X. En sanntids-algoritme for kinesisk trafikkskiltdeteksjon basert på modifisert YOLOv2. Algoritmer 2017, 10, 127. [CrossRef]
12. Zhu, Z.; Liang, D.; Zhang, S.; Huang, X.; Li, B.; Hu, S. Trafikkskiltdeteksjon og klassifisering i naturen. I Proceedings of theIEEE Conference on Computer Vision and Pattern Recognition 2016, Las Vegas, NV, USA, 27.–30. juni 2016; s. 2110–2118.
For more information:1950477648nn@gmail.com






