Forbedret funksjonsparameterutvinning fra talesignaler ved hjelp av maskinlæringsalgoritme(1)

May 30, 2023

Abstrakt: Talegjenkjenning refererer til programvarens eller maskinvarens evne til å motta et talesignal, identifisere høyttalerens funksjoner i talesignalet og gjenkjenne høyttaleren deretter. Generelt involverer talegjenkjenningsprosessen tre hovedtrinn: akustisk prosessering, funksjonsutvinning og klassifisering/gjenkjenning. Hensikten med funksjonsutvinning er å illustrere et talesignal ved bruk av et forhåndsbestemt antall signalkomponenter. Dette er fordi all informasjon i det akustiske signalet er for tungvint å håndtere, og noe informasjon er irrelevant i identifiseringsoppgaven. Denne studien foreslår en maskinlæringsbasert tilnærming som utfører funksjonsparameterekstraksjon fra talesignaler for å forbedre ytelsen til talegjenkjenningsapplikasjoner i sanntids smarte bymiljøer. Dessuten brukes prinsippet om å kartlegge en blokk med hovedminne til cachen effektivt for å redusere databehandlingstiden. Blokkstørrelsen til hurtigbufferminnet er en parameter som sterkt påvirker bufferytelsen. Spesielt krever implementering av slike prosesser i sanntidssystemer en høy beregningshastighet. Behandlingshastighet spiller en viktig rolle i talegjenkjenning i sanntidssystemer. Det krever bruk av moderne teknologier og raske algoritmer som øker akselerasjonen i å trekke ut funksjonsparametrene fra talesignaler. Problemer med overklokking under digital behandling av talesignaler har ennå ikke blitt fullstendig løst. De eksperimentelle resultatene viser at den foreslåtte metoden med hell trekker ut signalfunksjonene og oppnår sømløs klassifiseringsytelse sammenlignet med andre konvensjonelle talegjenkjenningsalgoritmer.

Cistanche deserticola slice (11)

Cistanche deserticola

Nøkkelord: talegjenkjenning; parallell databehandling; distribuert databehandling; multicore prosessor; funksjonsekstraksjon; spektral analyse

1. Introduksjon

Etablering av kommunikasjonstilnærminger mellom mennesker og datateknologi er en kritisk oppgave i moderne kunstig intelligens. En av de enkleste metodene for brukere å legge inn informasjon er gjennom talesignaler. Derfor har talesignalbehandlingsteknologi og dens verktøy blitt en nødvendig del av informasjonssamfunnet. Talegjenkjenning er et viktig forskningsaspekt ved talesignalbehandling og en viktig interaksjonsteknikk mellom menneske og datamaskin. Talesignaler inneholder semantisk, personlig og miljøinformasjon [1]. Den generelle tilnærmingen til talesignalbehandling er å bruke korttidsanalyse, der signalet deles inn i tidsvinduer med fast størrelse, forutsatt at signalparametrene ikke endres. En overlapping er plassert mellom vinduer for å få en mer nøyaktig signalrepresentasjon. Funksjonsekstraksjonsalgoritmer som spektralanalyse og lineær prediksjon brukes på hvert vindu. Disse prosessene bør imidlertid også vurdere hastighet og tid.

Desert living cistanche

Desert ginseng

Timing er en betydelig bekymring på flere områder av sanntidssignalbehandling. Behandlingshastighetsforholdet kan økes ved å effektivt bruke prosessorressurser og utvikle nye og raske algoritmer for å redusere den digitale behandlingstiden. Imidlertid er problemer med høy ytelse ennå ikke helt løst [2]. Dessuten har det blitt gjort betydelige fremskritt innen automatisk talegjenkjenning med utviklingen av maskinvare og programvare for digital signalbehandling. Til tross for disse fremskrittene kan imidlertid ikke maskiner matche ytelsen til sine menneskelige kolleger når det gjelder nøyaktighet og hastighetsgjenkjenning, spesielt i høyttaleruavhengig talegjenkjenning. En stor mengde forskning som har blitt utført på talegjenkjenning har derfor fokusert på talegjenkjenningsproblemer som er uavhengige av taleren, på grunn av det brede spekteret av anvendelser og begrensningene til tilgjengelige talegjenkjenningsteknikker [3].

Oppsummert er hovedbidragene fra studien som følger:

cistanche tea

Cistanche te

Klikk her for å se Cistanche deserticola te-produkter

【Be om mer】 E-post:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

Prosessen med å identifisere en person ved hjelp av talesignaler består av flere stadier. Blant dem krever noen trinn mer beregningstid. Dette er en spektralanalyse. En av parameterne som er spesielt viktige i maskinlæringsalgoritmer er treningstiden. I dette arbeidet fant vi ut at prosessen med å trekke ut funksjoner er viktig for identifisering av talesignaler. I tillegg tar det mye tid i maskinlæring. Det er fastslått at prosessen med spektralanalyse består av uavhengige operasjoner, og parallellisering er mulig.

Eksperimenter har vist at FFT- og DCT-spektraltransformasjoner gir gode resultater i spektralanalyse. Spektralanalyseprosessen er gyldig for hvert segment av talesignalet. Dette lar oss tydelig skille disse funksjonene fra talesignalet. Ved hjelp av verktøyene OpenMP og TBB ble det utviklet en parallell beregningsalgoritme som gjorde det mulig å fremskynde beregningene.

Segmentstørrelsen er viktig når du deler et talesignal i segmenter. Under eksperimentene ble det funnet at størrelsen på segmentet til talesignalet avhenger av hurtigbufferminnet til sentralprosessoren. Spesielt har matching av segment til hurtigbufferstørrelse i flerkjerneprosessorer vist seg å ha en positiv effekt på beregningshastighet i maskinlæring.

En ny parallell implementeringsmetode er foreslått for spektrale transformasjoner av signaler for funksjonsparameterekstraksjon fra talesignaler ved bruk av en maskinlæringsalgoritme på flerkjerneprosessorer som bruker TBB og OpenMP.

Det ble også funnet at effektiv bruk av prinsippet om å kartlegge hovedminneblokken til cachen og størrelsen på cache-minneblokken kan øke prosesseringshastigheten.

Cistanche supplement near me—Improve memory2

Cistanche-tilskudd i nærheten av meg - Forbedre hukommelsen

Resten av denne artikkelen er organisert som følger. Seksjon 2 gjennomgår eksisterende studier for å trekke ut spesifikke talesignalegenskaper. Del 3 beskriver funksjonsekstraksjonstrinnene med eksperimenter. Del 4 presenterer den foreslåtte høyytelses beregningsalgoritmen for å trekke ut funksjonsparametrene fra talesignaler i detalj. De eksperimentelle resultatene basert på vår implementering er diskutert i del 5. Del 6 fremhever begrensningene ved den foreslåtte metoden. Til slutt avslutter seksjon 7 studien med å oppsummere funnene og notere fremtidige forskningsretninger.

2. Relaterte verk

Nye metoder, algoritmer og mer moderne applikasjoner utvikles og forbedres for tiden for segmentering av talesignaler og beregning av parametriske indikatorer for utvalgte fragmenter, og skaper dermed et spektrogram av talesignaler ved bruk av spektralanalyse [4–7]. Høyttaleridentifikasjon med diversifiserte stemmeklipp over hele kloden er en avgjørende og utfordrende oppgave, spesielt når det gjelder å trekke ut kraftige og diskriminerende funksjoner [8]. En ny Mel Frequency Cepstral Coefficients (MFCC) har et ekstraksjonssystem som er raskere og mer energieffektivt enn den tradisjonelle MFCC-realiseringen ble foreslått av Korkmaz et al. [9]. I stedet for å bruke et høypass-foruthevingsfilter, brukte de et lavpassfilter. De implementerte et båndpassfilter med et høypassfilter fordi det er nødvendig med forhåndsbetoning for å øke signalets energi i høye frekvenser. I vårt tidligere arbeid [10] presenterte vi en ny MFCC-basert metode for høyttaleridentifikasjon. I stedet for å bruke konvensjonelle MFCC-er, bruker vi piksler fra Mel-spektrogrammet som funksjonssett. Spektrogrammet ble transformert til en 2-D-matrise for å lage et nytt datasett. For å identifisere foredragsholderen ble flere læringsalgoritmer tatt i bruk med en 10-fold kryssvalideringsteknikk. Ved hjelp av et flerlagsperceptron (MLP) med tanh-aktiveringsfunksjon ble den beste nøyaktigheten på 90,2 prosent oppnådd.

Funksjonsutvinning oppnås ved å endre talebølgeformen til en form for parametrisk representasjon med en relativt lavere datahastighet for påfølgende prosessering og analyse [11–14]. Funksjonsekstraksjonstilnærminger gir vanligvis en flerdimensjonal egenskapsvektor for hvert talesignal. Funksjonsutvinning er den mest relevante delen av høyttalergjenkjenning. Funksjoner ved tale har en viktig rolle i at en taler skiller seg fra andre. Funksjonsutvinning reduserer størrelsen på talesignalet, uten å forårsake skade på kraften til talesignalet [15–17]. I [18] introduserte forfatterne en ny tilnærming som utnytter finjusteringen av størrelsen og skiftparametrene til spektralanalysevinduet som brukes til å beregne den første korttids Fourier-transformasjonen for å forbedre ytelsen til en høyttaleravhengig automatisk talegjenkjenning (ASR) system. I fravær av leger kan lekfolk bruke beslutningshjelpssystemer som ble opprettet ved hjelp av kunstig intelligens-tilnærminger. Tidlig og ikke-invasiv hjertestatusdeteksjon kan oppnås ved bruk av fonokardiogram (PCG) signaler [19–21].

Konvolusjonelle nevrale nettverk (CNN-er) har blitt demonstrert for å lykkes med å simulere strukturell lokalitet i funksjonsrommet, samt benytte pooling innenfor et skjevt frekvensområde for å redusere translasjonsvariasjon og justere for forstyrrelser og små endringer i funksjonsrommet [22]. Mukhamadiyev et al. foreslått en ende-til-ende dypt nevralt nettverk-skjult Markov-modell talegjenkjenningsmodell og et hybrid konneksjonistisk tidsklassifisering (CTC)-oppmerksomhetsnettverk for det usbekiske språket og dets dialekter. Den foreslåtte tilnærmingen reduserer treningstiden og forbedrer talegjenkjenningsnøyaktigheten ved å effektivt bruke CTC-objektivfunksjonen i oppmerksomhetsmodelltrening [23]. Funksjonsutvinning og klassifisering ved hjelp av en endimensjonal konvolusjonelt nevralt nettverk (CNN) modell, som deler hjertelydsignaler inn i normale og unormale direkte uavhengig av et elektrokardiogram (EKG), ble foreslått i [24]. De hevder at klassifiseringsnøyaktigheten er høyere i 1D CNN enn i 2D CNN for hjertelydsignalene brukt i denne studien når konvolusjonskjernen er mindre enn 52 fordi en stor konvolusjonskjerne kan føre til beregningskompleksitet og er stadig mer tidkrevende . I [25] ble et dypt nevralt nettverk trent for å maksimere den bakre nøyaktigheten til tilstandssekvensene til akustiske modeller angående talefunksjonssekvensene ved å bruke TIMIT-databasen (TIMIT Acoustic-Phonetic Continuous Speech Corpus).

3. Forbehandling: Materialoversikt

cistanche—Improve memory4

Cistanche-tilskudd i nærheten av meg - Forbedre hukommelsen

For dette formålet er utviklingen av raske algoritmer for å trekke ut funksjonsparametere fra talesignaler og parametriske representasjoner, utvinning av nyttige og informative prøver for prosessering og utvikling av programmer for implementering av spektrogrammer av utvalgte akustiske segmenter uunnværlig.

Talegjenkjenningssystemer består av to hovedundersystemer:

Den primære behandlingen av talesignaler (fonogram);

Klassifiseringen av akustiske symboler ved hjelp av en intelligent algoritme (spektrogram).

Det første delsystemet genererer akustiske symboler som et sett med informative akustiske egenskaper til signalene og signalkarakteristikker. Det andre undersystemet konverterer talesignalet til en parametrisk form basert på de oppnådde akustiske egenskapene. Talesignalbehandling består av følgende trinn:

Separasjon av grensene til talesignalet;

Digital filtrering;

Segmentering;

Påføring av et utjevningsvindu;

Spektral transformasjon, og normalisering av spektralfrekvenser.

Disse trinnene brukes mye for å trekke ut funksjonsparametere fra talesignaler, og hovedtrekkene deres vurderes i det følgende.

3.1. Separasjon av grenser

Uttak av kun deler av tale fra det innkommende signalet eller bestemmelse av start- og sluttøyeblikk for en setning i et støyende miljø er en viktig oppgave i talebehandling. Følgende egenskaper til talesignalet brukes til å løse dette problemet: korttidsenergien til talesignalet, antall punkter som skjærer hverandre ved null, tettheten av fordelingen av verdiene til stillhetsfeltet i signalet, og spektral entropi. Tradisjonelle talegjenkjenningssystemer bruker teknikker som er basert på de forbigående og spektrale energiene til et signal (f.eks. stemmeaktivitetsdeteksjon) for å bestemme talegrensene fra innkommende talesignaler [26–28].

Hovedparametrene til talesignalet er den kortsiktige energien til talesignalet og antall punkter som går gjennom null. Som regel endres parametrene til et talesignal raskt over tid; derfor er det vanlig å behandle et talesignal til fragmenter på 10 til 30 ms i lengde som ikke overlapper. Talesignalet er stasjonært innenfor dette området, og områder med stillhet i talesignalet fjernes ved å beregne transientenergien. Algoritmen for å løse dette problemet er delt inn i N sekvenser av 256 kortsiktige energiverdier for det neste talesignalet.

Beregningen av energien til hvert fragment ved å dele talesignalet er passende for parallell og distribuert databehandling. Hvert fragment behandles uavhengig. Hvis prosessering brukes i en n-kjerne multiprosessor, vil det være mulig å beregne energien til n fragmenter samtidig. Derfor er det mulig å øke effektiviteten av parallellbehandling i løpet av dette stadiet [29–32].

3.2. Antall nullkryssinger

Et nullkryss er et punkt der tegnet til en matematisk funksjon endres (f.eks. fra positiv til negativ), som er representert ved et snitt av aksen (nullverdi) i grafen til funksjonen [33]. Nullkryssingsfrekvensen i et signal kan være den enkleste indikatoren på dets spektrale egenskaper. For eksempel kan antall punkter som går gjennom null i et talesignal bestemmes ved å bruke følgende ligning:

Figure 1. Method of speech separation based on spectral entropy analysis.


Figur 1. Metode for taleseparasjon basert på spektral entropianalyse.

3.3. Digital filtrering

I tillegg til et typisk, nyttig signal, er ulike typer støy tilstede. Siden støy påvirker kvaliteten på talegjenkjenningssystemer negativt, er håndtering av støy et presserende problem. To typer digitale filtre brukes for å redusere støynivåene i systemet: et linjefilter og et startfilter. Et lineært filter kan betraktes som en kombinasjon av lav- og høyfrekvente filtre da det fanger opp alle lave og høye frekvenser. Innledende filtrering brukes for å minimere innvirkningen av lokale forstyrrelser på de karakteristiske merkingene som brukes for etterfølgende identifikasjon. Et talesignal må føres gjennom et lavpassfilter for spektraljustering [35].

3.4. Segmentering

Segmentering er prosessen med å dele et talesignal i diskrete, ikke-overlappende fragmenter. Signalet er vanligvis delt inn i taleenheter som setninger, ord, stavelser, fonemer eller enda mindre fonetiske enheter. Segmenteringen av opptak som inneholder ytringene fra mange talere kan bestå av å tilskrive ytringer til bestemte talere. Begrepet "segmentstasjoner" brukes noen ganger for å referere til en oppdeling av talesignalet i rammer før dets parameterisering [36,37].

3.5. Spektral transformasjon

Det er nødvendig å skille hovedtrekkene til talesignaler som brukes i de senere stadiene av talegjenkjenningsprosessen. De innledende funksjonene bestemmes ved å analysere de spektrale egenskapene til talesignalene. Den raske Fourier-transformasjonsalgoritmen brukes vanligvis for å oppnå spektralfrekvensen til et talesignal [38,39].

3.6. Normalisering av spektrale frekvenser

Hele beregningsprosessen i intelligente algoritmer er basert på bevegelige desimaltall. Derfor er parameterne til objektene som er klassifisert ved bruk av nevrale nettverk begrenset til området [{{0}}.0, 1.0]. Det resulterende spekteret normaliseres mellom 0 og 1 for å bruke spektral prosessering ved å bruke det nevrale nettverket. For å oppnå dette er hver vektorkomponent delt inn i sine maksimale komponenter.

Spektralbehandlingsmetoder muliggjør bruk av alle dataprøver som er hentet fra talesignalet. Mange talesignaler har en spesifikk frekvensstruktur og spektrale egenskaper. Spektralmetoder gir høypresisjonsbehandling av talesignaler. Ulempene med spektral prosessering inkluderer lav fleksibilitet i de lokale egenskapene til signalene, mangel på spektraldimensjoner og relativt høye beregningskostnader.

Fourier-transformasjon, wavelet-analyse og mange andre algoritmer brukes mye i spektralbehandling av talesignaler. Fourier-transformasjon brukes i mange vitenskapsfelt, inkludert talebehandling. I talesignalbehandling konverterer Fourier-transformasjon signalet fra tidsfeltet til spektralfeltet som en frekvenskomponent [40].

I tidligere studier ble diskret Fourier-transformasjon (DFT), diskret cosinus-transformasjon (DCT), kortsiktig Fourier-transformasjon og wavelet-transformasjon brukt for spektralanalyse. Disse metodene ble brukt til å transformere fragmenter av et talesignal til frekvensdomenet og beregne spekteret. TBB- og OpenMP-pakkene ble brukt til å lage parallelle algoritmer for spektrale transformasjoner. I disse metodene deler kommandoen signalet inn i rammer; for eksempel N=16, 32, … eller 4096 for hver ramme [4]. Størrelsen på hver opprettet ramme er lik blokkstørrelsen til hurtigbufferminnet fordi hurtigbufferminnet er en faktor som påvirker effektiviteten til parallell prosessering. Akselerasjonsresultatene er avbildet i figur 2.

Figure 2. Acceleration results for (a) four- and (b) eight-core processors.


Figur 2. Akselerasjonsresultater for (a) fire- og (b) åttekjerners prosessorer.

For programvareimplementering av parallellbehandlingsalgoritmene ble seriell og parallell prosessering utført på fire- og åttekjernes prosessorer, som ble brukt ved bruk av personlige datamaskiner og servere, som oppført i tabell 1.

Tabell 1. Kjennetegn ved Intel-prosessorer.

Table 1. Characteristics of Intel processors.

Hovedtrekket til DCT-algoritmen er periodisitet. En fordel med DCT er at den har en tendens til å konsentrere mesteparten av signalenergien om et lite antall faktorer. Følgende ligninger gir elementene i koeffisientmatrisen:

imageimage


hvor L(k) er verdien av DCT, k er en indeks av koeffisienter, x(n) representerer dataelementer, og N er rammestørrelsen.

Fourier-analyseparametere er grunnlaget for metodene som brukes til å generere egenskapsvektorer i de fleste talegjenkjenningssystemer i digital prosessering av talesignaler innenfor det spektrale domenet. Mel-frekvens cepstrale koeffisienter (MFCCs) [41] og lineær prediktiv koding (LPC) teknikker [42,43] brukes i Fourier-analyse for å generere spektrogrambilder fra talesignaler. Spektrene som oppnås ved bruk av Fourier-analyse gir kortfattet og presis informasjon om et talesignal, som illustrert i figur 3.

Figure 3. DFT: (a) change in frequency range within time domain and (b) spectrogram.


Figur 3. DFT: (a) endring i frekvensområde innenfor tidsdomenet og (b) spektrogram.

Todimensjonale (2D) signaler ble brukt til spektralanalyse i eksperimentene. 2D-spektralanalysekarakteristikkene som brukes i parallelle bildebehandlingsalgoritmer er egnet for parallellbehandling i flerkjerneprosessorer [38]. Spesielt fremover og inverse transformasjonsvektorer og matriser har binære dimensjoner, og kompatibiliteten til denne flerkjerneprosessorarkitekturen kan effektivt øke beregningshastigheten. Derfor brukte vi sekvensiell og parallell prosessering på en datamaskin med forskjellige prosessoregenskaper for maskinvareimplementeringen av algoritmene som ble brukt til å behandle 2D-signaler (tabell 2)

Tabell 2. Kjennetegn ved bruk av Intel-prosessorer.

Table 2. Characteristics of applying Intel processors.


Hele 2D-signalet ble delt inn i identiske fragmenter av forskjellige størrelser på hvert trinn [44]. Verdiene til de valgte fragmentene var mellom pikseloppløsninger på 16 × 16 og 1024 × 1024. Hastigheten til den parallelle DCT-algoritmen ved bruk av OpenMP-pakken sammenlignet med den til den sekvensielle algoritmen er presentert i figur 4 Bruken av en parallell 2D-spektralanalyse algoritme på flerkjerneprosessorer gir et overklokkingsresultat som er nær antall kjerner.

Figure 4. Acceleration results for 2D parallel spectral analysis.

Figur 4. Akselerasjonsresultater for 2D parallell spektralanalyse.

Du kommer kanskje også til å like