Forbedret funksjonsparameterutvinning fra talesignaler ved hjelp av maskinlæringsalgoritme(2)
May 30, 2023
3.7. Datasett Datasettinnsamling og genereringsprosesser ble utført som følger. I denne studien ble datasettet med 120 timer lyd brukt til modelltreningen. Datasettet inkluderer talelydopptak som består av setninger med maksimalt 15 ord med en total lengde på ca. 120 timer.

Desert ginseng
I tillegg inneholder datasettet en stor mengde forskjellig tekst til bruk i utviklingen av språkmodellen. Over 90 650 ytringer, 415 780 ord og 65 810 unike ord som var inkludert i tekstkorpuset ble samlet inn, noe som resulterte i rundt 120 timer med transkriberte taledata. Vi deler opp datasettet i trenings-, validerings- og testsett. Datasettstatistikken
er rapportert i tabell 3.
Tabell 3. Datasettspesifikasjonene.

Vi deler datasettet i tre mapper som tilsvarer trenings-, validerings- og testsettene. Hver mappe inneholder lydopptak og transkripsjoner. Lyd- og korresponderende transkripsjonsfilnavn er de samme, bortsett fra at lydopptakene lagres som WAV-filer, mens transkripsjonene lagres som TXT-filer ved å bruke UTF-8-kodingen. Alle transkripsjonene er representert ved hjelp av det latinske alfabetet bestående av 29 bokstaver og apostrofsymbolet. For å forhindre overtilpasning brukte vi dataforsterkningsteknikker basert på hastighetsforstyrrelser og spektralforsterkning.

Cistanche deserticola
4. Foreslått metode
En viktig oppgave for programmerere når de utvikler talegjenkjenningssystemer er å lage en optimal metode for parametrisk uttrykk for talesignaler [45]. Denne metoden muliggjør utmerket separasjon av lyder og talte ord samtidig som den sikrer at høyttalerne er ufølsomme for uttalemønstre og endringer i det akustiske miljøet. De fleste feil i ordgjenkjenningen er forårsaket av en endring i tonehøyden til signalet på grunn av et skifte i mikrofonen eller en forskjell i tonehøyden til uttalen [46]. En annen vanlig årsak til feil er tilfeldige ikke-lineære deformasjoner av spektrumformen, som alltid er tilstede i talesignalet til en høyttaler [47,48]. Derfor er en av de viktigste oppgavene i å skape effektive talegjenkjenningssystemer valg av en representasjon som er tilstrekkelig for innholdet i det analyserte signalet, samt ufølsom for stemmene til høyttalere og ulike akustiske miljøer.

Cistanche-tilskudd i nærheten av meg - Forbedre hukommelsen
Systemet som brukes til å trekke ut funksjonsparametere har vanligvis følgende krav. Informasjonsinnholdet, det vil si settet med funksjonsparametere, må sikre pålitelig identifikasjon av gjenkjennelige taleelementer. Videre må lydstyrken, det vil si den maksimale komprimeringen av lydsignalet, og den ikke-statistiske korrelasjonen av parameterne minimeres. Uavhengighet fra taleren må også oppnås, det vil si maksimal fjerning av informasjon knyttet til talerens egenskaper fra vektoren av tegn. Til slutt må homogenitet, som refererer til parametrene som har samme gjennomsnittlige varians og muligheten til å bruke enkle beregninger for å bestemme affiniteten mellom tegnsett, gis [49]. Det er imidlertid ikke alltid mulig å tilfredsstille alle krav samtidig fordi slike krav er motstridende. Den parametriske beskrivelsen av taleelementene bør være tilstrekkelig detaljert til å skille dem pålitelig og bør være så lakonisk som mulig.

Superman urter cistanche
I praksis blir talesignalet som mottas fra en mikrofon digitalisert med en samplingshastighet på 8 til 22 kHz. Serielle numeriske verdier er delt inn i talefragmenter (rammer) med en varighet på 10 til 30 ms, som tilsvarer kvasi-stasjonære taledeler. En vektor av funksjoner beregnes fra hver ramme, som deretter brukes på det akustiske nivået for talegjenkjenning. For tiden er et bredt spekter av metoder tilgjengelig for parametrisk representasjon av signaler basert på autokorrelasjonsanalyse, lineær maskinvarefiltrering, spektralanalyse og LPC. Den vanligste tilnærmingen for taleparameterisering er spektralanalyse av signalfragmenter og beregning av deres cepstrale koeffisienter.
MFCC-er har blitt brukt som informative funksjoner for talesignalet [41]. Disse egenskapene brukes mye i talegjenkjenning og er basert på to hovedkonsepter: ceptral- og Mel-skalaen. De viktigste fordelene med algoritmen er dens høye nivå av fortrolighet og enkle tale. MFCC-funksjonene er atskilt fra de registrerte talesignalene. MFCC-algoritmen bruker resultatene av fonogrammet og spektrumsvitsjealgoritmene. Den klassiske algoritmen som brukes til å beregne MFCC-ene er avbildet i figur 5.

Figur 5. Klassisk skjema for beregning av MFCC.
Denne studien presenterer en rask metode for å trekke ut funksjonsparametrene fra et talesignal. Den foreslåtte algoritmen for rask beregning av MFCC-ene er vist i figur 6.

Figur 6. Forslag til rammeverk for beregning av MFCC.
Vi vurderer utførelsessekvensen til den foreslåtte algoritmen for rask uttrekking av funksjonsparametrene fra et talesignal
4.1. Inndeling i rammer
Etter foreløpig filtrering deles talesignalet inn i 16 ms rammer. Hver frame (bortsett fra den første) inneholder de siste 10 ms av forrige frame. Denne prosessen fortsetter til slutten av signalet. I denne studien, fordi samplingshastigheten til talesignalet er 16 kHz, er rammelengden N=256, og offsetlengden er M=160. Overlappingen er 62,5 prosent av rammelengden. En dekning på 50 prosent til 75 prosent av rammelengden anbefales generelt.
4.2. Hanning-vindu og synkende verdier
En Hanning-vindusstørrelse på 1D ble brukt. Hanning-vinduet kalles også det forhøyede cosinusvinduet. Hanning-vinduet kan betraktes som summen av frekvensspekteret til tre rektangulære tidsvinduer. Den kan bruke sidelobene til å oppheve hverandre, og eliminere høyfrekvent interferens og energilekkasje. Hanning-vinduer er svært nyttige vindusfunksjoner.

Cistanche-tilskudd i nærheten av meg - Forbedre hukommelsen
Klikk her for å se produkter fra Cistanche som forbedrer hukommelsen og forebygger Alzheimers sykdom
【Be om mer】 E-post:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
En vektboks brukes for å redusere forvrengning og jevne ut de enkelte rammene. Det flytende signalet som undersøkes i denne studien består av en tett tone. Størrelsen på den flate tonen bestemmes av størrelsen på den rene tonen ved frekvensen f, som filtreres gjennom Hanning-vinduet.
Et kritisk aspekt ved dette vinduet er at det setter rammene til null. I dette tilfellet kan de korte energiene beregnes mens de passerer gjennom vinduet, og de kan overføres fra sekvensen som brukes til å beregne de laveste amplitudeenergiene. Målet er å fjerne lavenergisignaler fra signalet ved å beregne signalenergien mens signalet fra dette vinduet jevnes ut. Denne prosessen krever følgende signalenergiligning:

der En er energien til inngangssignalfragmentet, og xi er signalverdien.
I tillegg til vindusprosessen som bruker (11), behandles signalet i neste trinn, noe som betydelig reduserer antallet verdier som kommer inn i prosessoren. Figur 7 viser den parallelle prosesseringsalgoritmen.
Vindusstørrelsen representerer et antall prøver og en varighet. Det er hovedparameteren i analysen. Vindusstørrelsen avhenger av grunnfrekvensen, intensiteten og endringer i signalet.

Figur 7. Hanning-vindusalgoritme for fjerning av stille deler. 4.3. Short-Time Fourier Transform (STFT)-brytere En intuitiv forståelse eksisterer av betydningen av høy eller lav høyde. STFT er en Fourierrelatert transformasjon som brukes til å bestemme den sinusformede frekvensen og faseinnholdet til lokale deler av et signal når det endres over tid. I praksis involverer STFT-beregningen delingen av et lengre tidssignal i kortere segmenter av lik lengde, etterfulgt av en separat beregning av Fourier-transformasjonen på hvert kortere segment. Dette avslører Fourier-spekteret til hvert kortere segment. Diskrete-tidssignaler er brukt i praksis. Den korresponderende tid-frekvens-konverteringen er en diskret Fourier-konvertering, som beskriver lengden på signalet Xn som representativ for det komplekse verdi frekvensdomenet til de N koeffisientene. STFT, som beskriver utviklingen av frekvenskomponentene over tid, er et av de mest brukte verktøyene for taleanalyse og prosessering [50]. I likhet med selve spekteret, er en fordel med STFT at parameterne har fysiske og intuitive tolkninger. STFT blir typisk visualisert ved å bruke log-spektra 20log10 (X(h, k)). Slike 2D-loggspektre kan deretter sees ved hjelp av et termisk kart kjent som et spektrogram. I det tredje trinnet av algoritmen blir STFT-spektralsvitsjeprosedyren brukt på rammene som sendes gjennom vektvinduet. Signalets STFT oppnås ved å åpne vinduene og bestemme DFT for hvert vindu. Spesielt blir transformasjonen for Xn- og Wn-vinduene til inngangssignalet bestemt som følger:

hvor k-indeksen tilsvarer frekvensverdiene, og wn er vindusfunksjonen, som vanligvis er et Hanning-vindu eller Gauss-vindu som er sentrert rundt null.
4.4. Mel Transform
I det fjerde trinnet deles signalet som overføres til frekvensbåndet inn i områder ved hjelp av trekantede fifiltre. Fifiltergrensene beregnes ved hjelp av krittfrekvensen. Overgangen til krittfrekvens-fifeltet er basert på følgende ligning:

hvor f er frekvensområdet.
Reversbryteren bestemmes som følger:

Betrakt NN som antall fifiltre (26 fifiltre brukes vanligvis) og flflows, like høyt som frekvensområdet som studeres. Dette området overføres til Mel-skalaen og deles inn i NN jevnt fordelte kryssende områder. De lineære frekvenstilpassede grensene bestemmes innenfor fifeltet, mens vektingskoeffisientene som oppnås basert på fifiltrering er betegnet med H. Deretter påføres fifiltrene til kvadratmodulen til koeffisientene oppnådd fra Fourier-transformasjonen. Verdiene som oppnås er logaritmiske på grunn av følgende uttrykk:

Algoritmen for singularverdidekomponering implementeres i det siste stadiet av beregningen av MFCC-ene.
5. Eksperimentelle resultater
Vi implementerte og testet den foreslåtte metoden i Visual Studio 2019 C plus plus på en PC med en 4,90 GHz CPU, 32 GB RAM og to Nvidia GeForce 2080Ti GPUer, som vist i Tabell 4. Systemet ble testet i forskjellige enhetsmiljøer for å evaluere ytelsen til utvinningsmetoden for signalfunksjonen. I eksperimentene, under driften av algoritmen (Figur 8), da sekvensen av overflater til signalet var n=15, ble antallet verdier redusert med 40–50 prosent, og behandlingstiden økte med 1. 2-fold. Følgelig viste denne algoritmen betydelig høyere effektivitet. Dessuten muliggjorde denne algoritmen separasjon og eliminering av stillhetsområder mens de passerte gjennom Hanning-vinduet.
Flere mulige midler er tilgjengelige for å unngå sløsing med minnebåndbredde. Vi foreslår en ny løsning som øker dataytelsen ved å matche størrelsen på signalrammene til en blokkstørrelse på cache-minne. Denne typen optimalisering kan påvirke den generelle parallellbehandlingsytelsen betydelig. Imidlertid kan den brukes i digital signalbehandling ved å dele signalet inn i rammer gjennom implementeringer på flerkjerneprosessorer. Men i praksis utføres utvalget vanligvis i liten skala, tilsvarende bredden på databussen som kobler cache-minnet til hovedminnet og størrelsen på blokken. Metoden vår implementerer optimal bruk av disse minnene i parallell databehandling. Organiseringen av hurtigbufferminnet spiller en viktig rolle i parallellbehandlingsalgoritmer når data deles inn i strømmer. Spesielt bør tilstedeværelsen av vektormatriseeffekter i digital signalbehandling og størrelsen på deres strømmer justeres i henhold til størrelsen på hurtigbufferblokkene. Dette kan oppnås ved å bruke den foreslåtte metoden, som illustrert i figur 9.
Tabell 4. De detaljerte spesifikasjonene for forsøksoppsettet.


figur 8. (a) Innledende innkommende signal og (b) utseende av signal etter bruk av foreslått algoritme.

Figur 9. Parallell databehandlingsstruktur ved bruk av RK3288-prosessorer.
I denne delen diskuterer vi en kvantitativ analyse for å sammenligne ytelsen til forskjellige systemer. Vi sammenlignet metoden vår med velkjente talegjenkjenningsalgoritmer basert på dyplæringsmetoder. Evalueringsberegninger er avgjørende for å beregne ulike strategier for talegjenkjenning og vurdere ytelsen til ulike tilnærminger. Selv om vi brukte resultatene fra andre studier for sammenligning, er vi ikke sikre på om de er sanne fordi kildekodene og datasettene til disse metodene ikke er offentlig tilgjengelige for å bekrefte den faktiske ytelsen. Figur 10 viser resultatet av å flytte de stille delene under passasjen av et talesignalfragment gjennom Hanning-vinduet basert på den foreslåtte hurtigalgoritmen. Hastighetsresultatene oppnådd fra analysen er presentert i tabell 5.

Figur 10. k-verdi av KNN-algoritme (med funksjonsvalg).
Tabell 5. Eksperimentelle resultater av foreslått metode.

Et område er bestemt for å finne graden av nabolaget som gir den beste nøyaktighetsverdien i KNN-algoritmen. Det spesifiserte området dekker 1–25. I figur 10 ble grafen til KNN-algoritmen med funksjonsvalg brukt. Da grafen ble undersøkt, da naboverdien var 1 i begynnelsen, var treningsnøyaktigheten mye høyere enn testnøyaktigheten. I KNN-algoritmen opprettet ved bruk av funksjonene valgt ved korrelasjon, ble nøyaktigheten til modellen bestemt til å være 99,15 prosent i treningsdatasettet og 97,35 prosent i testdatasettet.
Ordfeilfrekvensen (WER) eller tegnfeilfrekvensen brukes vanligvis til å evaluere nøyaktigheten av funksjonsekstraksjon fra et talesignal. Dette er objektive matriser som er nyttige for en rettferdig sammenligning av gjenkjenningsteknikker. I våre tidligere studier [51–56] beregnet vi beregninger som F-målet (FM), presisjon og gjenkalling. FM er det vektede gjennomsnittet som balanserer målingene mellom presisjons- og tilbakekallingsfrekvensen. Presisjonen er forholdet mellom antall korrekt predikerte positive observasjoner og det totale antallet predikerte positive observasjoner. Tilbakekallingen er forholdet mellom antall korrekt predikerte positive observasjoner og det totale antallet observasjoner i den faktiske klassen, som angitt i (9). Følgende ligninger kan brukes til å beregne gjennomsnittlig presisjon og gjenkallingshastigheter for funksjonsutvinningsmetoder:

der TP angir antall sanne positive, FP angir antall falske positive, og FN angir antall falske negative.
FM beregnes ved å bruke (10), med tanke på både presisjon og tilbakekalling.

Gjennomsnittlig FM, tilbakekalling og presisjon for den foreslåtte metoden var 98,4 prosent. Falsk deteksjon skjedde i 1,6 prosent av tilfellene på grunn av uønsket støy fra signaler ved mikrofonen. Rekkevidden for modellens nøyaktighet var mellom 0 og 1, og de metriske estimeringsskårene nådde sine beste verdier ved 1. En evaluering av metoden vår og andre nylig publiserte metoder for utvinning av talefunksjoner er presentert i tabell 6. Det samme antallet funksjoner ble brukt for en rettferdig sammenligning. Totalt 325 taleprøver fra hver gruppe ble analysert fra personer med lignende funksjonsbakgrunn. Effektene av forskjellige rammelengder i henhold til antall fifilterbanker i MFCC og forskjellige rammelengder i rekkefølgen til LPC ble også undersøkt for forbedret nøyaktighet.
Tabell 6. Kvantitative nøyaktighetsresultater for utvinning av talefunksjoner.

Som nevnt tidligere, er WER det vanligste målet for ytelse av talegjenkjenning. Den beregnes ved å sammenligne en referansetranskripsjon med utgangen fra talegjenkjenneren. Basert på denne sammenligningen er det mulig å beregne antall feil, som typisk tilhører tre kategorier: (1) innsettinger når et ord ikke er tilstede i referansen i utgangen til den automatiske talegjenkjenningen (ASR), (2) slettinger når et ord mangler i ASR-utgangen, og (3) erstatninger når et ord forveksles med et annet ord. WER kan beregnes som følger.

der S er antall erstatninger av ord som gjenkjennes feil, D er antall slettinger, I er antall innsettinger og N er antall ord i referansetranskripsjonen. Hovedproblemet ved å beregne denne poengsummen er justeringen mellom to-ord-sekvensene. Dette kan bestemmes gjennom dynamisk programmering ved bruk av Levenshtein-avstanden [67].
Basert på tabell 6 utførte vi en statistisk analyse for å indikere den gjennomsnittlige nøyaktigheten til de sammenlignede metodene ved bruk av WER-evalueringsmetrikken, som illustrert i figur 11. Den forbedrede funksjonsuttrekkeren ga en nøyaktighet på omtrent 98,4 prosent, mens de andre tilnærmingene ga nøyaktigheter mellom 78 prosent og 96 prosent. Vi brukte resultatene gitt i de relevante papirene for sammenligning; Nøyaktigheten til disse verdiene er imidlertid ikke lett å verifisere fordi kildekodene og datasettene til disse metodene ikke er offentlig tilgjengelige for å bekrefte deres reelle ytelse. Ikke desto mindre, når det gjelder standardscener, ble den foreslåtte metoden eksperimentelt demonstrert for å gi utmerket talefunksjonsekstraksjonsnøyaktighet ved å redusere beregningstiden, selv når taledataene er støyende eller av lav kvalitet.

Figur 11. Kvantitative resultater av talesignal funksjoner utvinning tilnærminger ved hjelp av vertikale grafer.
Dessuten evaluerte vi de falske positive resultatene av de valgte metodene. Som det kan observeres fra figur 12, hadde den foreslåtte tilnærmingen færrest feil. Videre reduserte den svært effektive parallellberegningsmetoden betydelig valg av lydsignalfunksjoner og utvinningsfeil. Overfifitting var et av hovedproblemene under opplæringen, og nesten alle maskinlæringsmodeller lider av det. Vi prøvde å redusere risikoen for overfifitting ved å bruke en funksjonsvalgsteknikk som i stedet tar sikte på å rangere viktigheten av de eksisterende funksjonene i datasettet og forkaste mindre viktige (ingen nye funksjoner opprettes).

Figur 12. Synlige resultater av falske positive talesignalfunksjoner ekstraksjonseksperimenter.
Tabell 7 viser ytelsesresultatene til metodene som ble brukt i talegjenkjenningsmiljøer basert på forskjellige egenskaper. Vår foreslåtte tilnærming lider ikke av uønsket og unødvendig bakgrunnsstøy og påvirkes ikke av lavkvalitets menneskestemmer som hese stemmer, stemmer produsert med sår hals, eller til og med lyder fra mennesker med fullstendig stemmetap. Vår metode tar sikte på å overvinne problemene med utilstrekkelig opptaksutstyr, bakgrunnsstøy, vanskelige aksenter og dialekter, og ulike tonehøyder i en stemme. I et normalt miljø ble de beste resultatene for nøyaktig oppdagelse og uttrekking av talefunksjonsutfordringer oppnådd ved bruk av den foreslåtte metoden med redusert behandlingstid.
Tabell 7. Gjennomgang av talefunksjonsdeteksjon og utvinningsytelse ved bruk av ulike funksjoner.

Resultatene av talegjenkjenningsmetodene ble klassifisert som kraftige, normale eller svake for de syv kategoriene. Det kraftige kriteriet viser at algoritmen kan overvinne alle typer utfordringer. I motsetning til dette indikerer det normale kriteriet at algoritmen kan mislykkes i visse tilfeller fordi ordgrensene ikke er definert på forhånd. Til slutt antyder det svake kriteriet at algoritmen er upålitelig under bakgrunnsstøy eller vibrasjoner.
6. Begrensninger
Det er vanskelig å konkludere med at metodene som er foreslått til dags dato ikke viser noen mangler. Vår foreslåtte metode kan også resultere i feil på grunn av ulike støymiljøer. For å overvinne dette problemet hadde vi som mål å redusere antall funksjoner i datasettet ved å lage nye funksjoner fra eksisterende funksjoner [69]. Siden overfifitting var et av hovedproblemene for å trene forskjellige modeller under konkurransen, kan det å berike treningsdataene ved å legge til dataprøver fra forskjellige ressurser være en mulig løsning for å forbedre resultatene. Uavhengig av de nevnte problemene, avslørte de eksperimentelle resultatene at metoden vår var veldig robust og effektiv for utvinning av talefunksjoner, med en gjennomsnittlig nøyaktighet på 98,4 prosent og FM på 99,5 prosent.
7. Konklusjoner
En ny parallell databehandlingsmetode med høy ytelse ved bruk av en maskinlæringsmetode har blitt foreslått for talegjenkjenningssystemer. Akselerasjonsproblemer i maskiner med begrensede dataressurser kan løses ved hjelp av distribuerte systemer. Beregningshastigheten i signalgjenkjenningssystemer kan økes, og ytelsen til flerkjerneplattformer kan forbedres ved å lage og bruke effektive og raske algoritmer. Resultatene viser at den foreslåtte modellen reduserer behandlingstiden og forbedrer funksjonsekstraksjonsnøyaktigheten med 98,4 prosent ved å bruke MFCC-er effektivt. Det har blitt observert at funksjonene med lave korrelasjonsverdier hentet ut av funksjonsvalg også er effektive i modellens suksess. Den statistiske analysen ble utført på de forhåndsbehandlede dataene, og meningsfull informasjon ble produsert fra dataene ved bruk av K-nearest neighbors (KNN) maskinlæringsalgoritme.
Fremtidige studier vil fokusere på å forbedre nøyaktigheten til metoden vår ved å bruke dyplæringstilnærminger og optimalisere hurtigbufferminnet til flerkjerneprosessorer for å oppdage og trekke ut talesignaler uten et betydelig kvalitetstap. Videre planlegger vi å konstruere en spektralanalysemodell basert på parallell prosessering med robust analyseytelse som vil muliggjøre etablering av innebygde enheter med lave beregningsressurser ved å bruke Taris taledatasett [70] i 3D CNN og 3D U-Net Environment [71– 75]
Referanser
1. Meng, YJ; Liu, WJ; Zhang, RZ; Du, HS talefunksjonsparameterekstraksjon og gjenkjenning basert på interpolering. Appl. Mech. Mater. 2014, 602–605, 2118–2123. [CrossRef] 2. Musaev, M.; Rakhimov, M. Akselerert trening for konvolusjonelle nevrale nettverk. I Proceedings of the 2020 International Conference on Information Science and Communications Technologies (ICISCT), Tasjkent, Usbekistan, 4.–6. november 2020; s. 1–5. [CrossRef] 3. Yee, F.; Yang, J. En Deep Neural Network Model for Speaker Identification. Appl. Sci. 2021, 11, 3603. [CrossRef] 4. Musaev, M.; Rakhimov, M. En metode for å kartlegge en blokk med hovedminne til hurtigbuffer i parallell behandling av talesignalet. I Proceedings of the 2019 International Conference on Information Science and Communications Technologies (ICISCT), Karachi, Pakistan, 9.–10. mars 2019; s. 1–4. [CrossRef] 5. Jiang, N.; Liu, T. En forbedret talesegmentering og clustering-algoritme basert på SOM og k-midler. Matte. Probl. Eng. 2020, 2020, 3608286. [CrossRef] 6. Hu, W.; Yang, Z.; Chen, C.; Sun, B.; Xie, Q. En vibrasjonssegmenteringstilnærming for fleraksjonssystemet til numerisk kontrolltårn. Signal bildevideoprosess. 2021, 16, 489–496. [CrossRef]
7. Popescu, TD; Aiordachioaie, D. Feildeteksjon av rulleelementlager ved bruk av optimal segmentering av vibrerende signaler. Mech. Syst. Signalprosess. 2019, 116, 370–391. [CrossRef] 8. Shihab, MSH; Aditya, S.; Setu, JH; Imtiaz-Ud-Din, KM; Efat, MIA En hybrid GRU-CNN-funksjonsekstraksjonsteknikk for høyttaleridentifikasjon. I Proceedings of the 2020 23rd International Conference on Computer and Information Technology (ICCIT), Dhaka, Bangladesh, 19.–21. desember 2020; s. 1–6. [CrossRef] 9. Korkmaz, O.; Atasoy, A. Følelsesgjenkjenning fra talesignal ved bruk av mel-frekvens cepstrale koeffisienter. I Proceedings of the 9th International Conference on Electrical and Electronics Engineering (ELECO), Bursa, Tyrkia, 26.–28. november 2015; s. 1254–1257. 10. Ayvaz, U.; Gürüler, H.; Khan, F.; Ahmed, N.; Whangbo, T.; Abdusalomov, A. Automatisk høyttalergjenkjenning ved bruk av Mel-frekvens Cepstral-koeffifisienter gjennom maskinlæring. CMC-Comput. Mater. Forts. 2022, 71, 5511–5521. 11. Al-Qaderi, M.; Lahamer, E.; Rad, A. Et to-nivå høyttaleridentifikasjonssystem via fusjon av heterogene klassifiseringer og komplementært funksjonssamarbeid. Sensorer 2021, 21, 5097. [CrossRef] 12. Batur Dinler, Ö.; Aydin, N. Et optimalt funksjonsparametersett basert på gjentatte gjentakende enhets tilbakevendende nevrale nettverk for talesegmentdeteksjon. Appl. Sci. 2020, 10, 1273. [CrossRef] 13. Kim, H.; Shin, JW Dual-Mic taleforbedring basert på TF-GSC med lekkasjeundertrykkelse og signalgjenoppretting. Appl. Sci. 2021, 11, 2816. [CrossRef] 14. Lee, S.-J.; Kwon, H.-Y. En forbehandlingsstrategi for denoising av taledata basert på talesegmentdeteksjon. Appl. Sci. 2020, 10, 7385. [CrossRef] 15. Rusnac, A.-L.; Grigore, O. CNN-arkitekturer og funksjonsekstraksjonsmetoder for EEG-imaginær talegjenkjenning. Sensorer 2022, 22, 4679. [CrossRef] [PubMed] 16. Wafa, R.; Khan, MQ; Malik, F.; Abdusalomov, AB; Cho, YI; Odarchenko, R. Effekten av smidig metodikk på prosjektsuksess, med en modererende rolle som personens jobbtilpasning i IT-industrien i Pakistan. Appl. Sci. 2022, 12, 10698. [CrossRef] 17. Aggarwal, A.; Srivastava, A.; Agarwal, A.; Chahal, N.; Singh, D.; Alnuaim, AA; Alhadlaq, A.; Lee, H.-N. Toveis funksjonsekstraksjon for talefølelsesgjenkjenning ved bruk av dyp læring. Sensorer 2022, 22, 2378. [CrossRef] [PubMed] 18. Marini, M.; Vanello, N.; Fanucci, L. Optimalisering av høyttaleravhengige funksjonsekstraksjonsparametre for å forbedre ytelsen til automatisk talegjenkjenning for personer med dysartri. Sensorer 2021, 21, 6460. [CrossRef] 19. Tiwari, S.; Jain, A.; Sharma, AK; Almustafa, KM Fonokardiogram Signalbasert Multi-Class Cardiac Diagnostic Decision Support System. IEEE Access 2021, 9, 110710–110722. [CrossRef] 20. Mohtaj, S.; Schmitt, V.; Möller, S. En funksjonsekstraksjonsbasert modell for hatpratidentifikasjon. arXiv 2022, arXiv: 2201.04227. 21. Kuldoshbay, A.; Abdusalomov, A.; Mukhiddinov, M.; Baratov, N.; Makhmudov, F.; Cho, YI En forbedring for den automatiske klassifiseringsmetoden for ultralydbilder brukt på CNN. Int. J. Wavelets Multiresolution Inf. Prosess. 2022, 20, 2150054. 22. Passricha, V.; Aggarwal, RK En hybrid av dyp CNN og toveis LSTM for automatisk talegjenkjenning. J. Intell. Syst. 2020, 29, 1261–1274. [CrossRef] 23. Mukhamadiyev, A.; Khujayarov, I.; Djuraev, O.; Cho, J. Automatisk talegjenkjenningsmetode basert på dype læringsmetoder for usbekisk språk. Sensorer 2022, 22, 3683. [CrossRef] [PubMed] 24. Li, F.; Liu, M.; Zhao, Y.; Kong, L.; Dong, L.; Liu, X.; Hui, M. Funksjonsekstraksjon og klassifisering av hjertelyd ved bruk av 1D konvolusjonelle nevrale nettverk. EURASIP J. Adv. Signalprosess. 2019, 2019, 59. [CrossRef] 25. Chang, L.-C.; Hung, J.-W. En foreløpig studie av robust talefunksjonsekstraksjon basert på maksimering av sannsynligheten for tilstander i dypakustiske modeller. Appl. Syst. Innov. 2022, 5, 71. [CrossRef] 26. Ramírez, J.; Górriz, JM; Segura, JC Stemmeaktivitetsdeteksjon. Grunnleggende og talegjenkjenningssystemets robusthet. I robust talegjenkjenning og forståelse; Grimm, M., Kroschel, K., red.; I-TECH utdanning og publisering: London, Storbritannia, 2007; s. 1–22. 27. Oh, S. DNN-basert robust talefunksjonsekstraksjon og metode for fjerning av signalstøy ved bruk av forbedret LMS-filter for gjennomsnittlig prediksjon for talegjenkjenning. J. Converg. Inf. Teknol. 2021, 11, 1–6. [CrossRef] 28. Abbaschian, BJ; Sierra-Sosa, D.; Elmaghraby, A. Deep Learning Techniques for Speech Emotion Recognition, fra databaser til modeller. Sensorer 2021, 21, 1249. [CrossRef] 29. Rakhimov, M.; Mamadjanov, D.; Mukhiddinov, A. En høyytelses parallell tilnærming til bildebehandling i distribuert databehandling. I Proceedings of the 2020 IEEE 14th International Conference on Application of Information and Communication Technologies (AICT), Usbekistan, Tasjkent, 7.–9. oktober 2020; s. 1–5. [CrossRef] 30. Abdusalomov, A.; Mukhiddinov, M.; Djuraev, O.; Khamdamov, U.; Whangbo, TK Automatisk utvinning av fremtredende objekter basert på lokalt adaptiv terskelverdi for å generere taktil grafikk. Appl. Sci. 2020, 10, 3350. [CrossRef] 31. Abdusalomov, A.; Whangbo, TK En forbedring av metoden for forgrunnsgjenkjenning ved bruk av skyggefjerningsteknikk for innendørsmiljøer. Int. J. Wavelets Multiresolution Inf. Prosess. 2017, 15, 1750039. [CrossRef] 32. Abdusalomov, A.; Whangbo, TK Deteksjon og fjerning av skygger i bevegelse ved bruk av geometri og fargeinformasjon for innendørs videostrømmer. Appl. Sci. 2019, 9, 5165. [CrossRef] 33. Mery, D. Computer Vision for X-ray Testing; Springer International Publishing: Cham, Sveits, 2015; s. 271, ISBN 978-3319207469. 34. Mark, S. Talebilder rekalibrerer tale-oppfatningsgrenser. Klokken ti. Percept. Psykofys. 2016, 78, 1496–1511. [CrossRef] 35. Mudgal, E.; Mukuntharaj, S.; Modak, MU; Rao, YS Malbasert talegjenkjenning i sanntid ved bruk av digitale filtre på DSP-TMS320F28335. I Proceedings of the 2018 Fourth International Conference on Computing Communication Control and Automation (ICCUBEA), Pune, India, 16.–18. august 2018; s. 1–6. [CrossRef]






