masters-thesis

Unnamed repository; edit this file 'description' to name the repository.
Log | Files | Refs | README

commit 9131a1f22a0a674c8d56ccd14e4fc57f5c9dba9a
parent 4a5c2624aead9e4c12c24b2b17d16c210f5949c7
Author: Silas Brack <s174433@student.dtu.dk>
Date:   Thu,  9 Feb 2023 16:31:24 +0100

Updated abstract.

Diffstat:
Mchapters/abstract.tex | 49+++++++++++++++++++++++++++++--------------------
1 file changed, 29 insertions(+), 20 deletions(-)

diff --git a/chapters/abstract.tex b/chapters/abstract.tex @@ -28,23 +28,32 @@ This is the first method for performing the Laplace approximation while only acc \chapter*{Resum\'e} \addcontentsline{toc}{chapter}{Resum\'e} -Bayesianske metoder lover at give en principiel m{\aa}de at kvantificere usikkerheden i neurale netv{\ae}rk p{\aa} -Dette er vigtigt for mange anvendelser inden for maskinl{\ae}ring, f.eks. i forbindelse med sikkerhedskritiske beslutninger, som er afh{\ae}ngige af risikovurdering og fortolkningsmuligheder. -Bayesiansk inferens er imidlertid ofte beregningsm{\ae}ssigt uoverkommelig, s{\aa} der anvendes tiln{\ae}rmede metoder, som g{\aa}r p{\aa} kompromis med ydeevnen for at opn{\aa} praktiske fordele. -Laplace-approximationen (LA) er en s{\aa}dan metode, selv om den typisk er afh{\ae}ngig af grove tiln{\ae}rmelser af den efterf{\o}lgende pr{\ae}cisionsmatrix for at g{\o}re den beregningsm{\ae}ssigt gennemf{\o}rlig. -N{\aa}r vi ikke faktoriserer den efterf{\o}lgende pr{\ae}cision i mere praktiske tiln{\ae}rmelser, skal den fulde efterf{\o}lgende pr{\ae}cision instantieres. -Vi kalder dette den fulde Laplace-approximation. -Da den fulde pr{\ae}cisionsmatrix skalerer kvadratisk med antallet af parametre, kan den fulde posteriorpr{\ae}cision ikke lagres i hukommelsen for alle problemer undtagen leget{\o}jsproblemer, da den fulde pr{\ae}cisionsmatrix skalerer kvadratisk med antallet af parametre. - -I dette arbejde foresl{\aa}r vi en metode til beregning af Laplace-approksimationen udelukkende ved hj{\ae}lp af jacobian-vektorprodukter, som g{\o}r det muligt at udf{\o}re marginal tr{\ae}ning og posterior sampling ved hj{\ae}lp af den fulde Laplace-approksimation uden at lagre hele matrixen for posterior pr{\ae}cision. -For at opn{\aa} dette viser vi, at vi kan estimere den posteriore pr{\ae}cisionens log-determinant og den inverse kvadratrod ved hj{\ae}lp af kun jacobianiske vektorprodukter. -For at overvinde de konditioneringsproblemer, der opst{\aa}r under pr{\o}veudtagning, foresl{\aa}r vi flere potentielle pr{\ae}konditioneringsv{\ae}rkt{\o}jer, som kan anvendes til at forbedre konvergensen af den inverse kvadratrodsapproximation. -Dern{\ae}st foresl{\aa}r vi en teknik til at evaluere kvaliteten af de efterf{\o}lgende stikpr{\o}ver uden at instantiere eller invertere den efterf{\o}lgende pr{\ae}cision baseret p{\aa} resultater fra traditionel statistik. -Til at gennemf{\o}re disse metoder anvender vi JAX, et bibliotek til automatisk differentiering, som g{\o}r det muligt at udf{\o}re jacobian-vektorprodukter effektivt uden eksplicit lagring af hele den efterf{\o}lgende pr{\ae}cision. - -Vi udf{\o}rer den fulde Laplace-approximation p{\aa} b{\aa}de en sinusfunktion og MNIST ved hj{\ae}lp af vores metode. -Denne best{\aa}r af to trin: (a) tr{\ae}ning af et neuralt netv{\ae}rk ved at maksimere enten dets efterf{\o}lgende sandsynlighed eller marginale sandsynlighed og (b) pr{\o}veudtagning fra denne efterf{\o}lgende sandsynlighed. -Vi finder, at vores tiln{\ae}rmede maksimale marginale tr{\ae}ningsprocedure er i stand til at l{\ae}re et s{\ae}t parametre, som giver en ydeevne, der kan sammenlignes med den maksimale posterior- og maksimale sandsynlighedstr{\ae}ningsprocedure. -Ved at analysere quantile--quantile-plots af vores posteriorpr{\o}ver og visualisere disse pr{\o}ver finder vi, at vores tiln{\ae}rmede pr{\o}veudtagningsmetode giver pr{\o}ver, der er korrekt fordelt. -Vores benchmarks af Jacobian-vektorprodukternes ydeevne ansl{\aa}r, at vores metode giver en 10\ 000x hukommelsesreduktion i forhold til den konventionelle fulde Laplace-approximation, da den ikke lagrer den kvadratisk skalerende matrix med fuld pr{\ae}cision for den efterf{\o}lgende periode. -Dette er den f{\o}rste metode til at udf{\o}re Laplace-approximationen, hvor der kun er implicit adgang til den efterf{\o}lgende pr{\ae}cision. +Bayesianske metoder lover at give en principiel m{\aa}de at kvantificere usikkerheden i neurale netv{\ae}rk p{\aa} Dette er +vigtigt for mange anvendelser inden for maskinindl{\ae}ring, f.eks. for sikkerhedskritiske beslutninger, der er afh{\ae}ngige af +p{\aa} risikovurdering og fortolkelighed. Bayesiansk inferens er imidlertid ofte beregningsm{\ae}ssigt uh{\aa}ndterbar, s{\aa} +anvendes der tiln{\ae}rmede metoder, som g{\aa}r p{\aa} kompromis med ydeevnen for at opn{\aa} praktiske fordele. Laplace-approximation +(LA) er en s{\aa}dan metode, selv om den i sig selv typisk er baseret p{\aa} grove tiln{\ae}rmelser til den efterf{\o}lgende pr{\ae}cision +matrix for at g{\o}re den beregningsm{\ae}ssigt gennemf{\o}rlig. N{\aa}r vi ikke faktoriserer den efterf{\o}lgende pr{\ae}cision i mere +praktiske tiln{\ae}rmelser, kr{\ae}ver de eksisterende metoder, at den fulde posteriore pr{\ae}cision skal instantieres. Vi kalder +dette den fulde Laplace-approximation. For alle problemer undtagen leget{\o}jsproblemer er det imidlertid s{\aa}dan, at den fulde pr{\ae}cisionsmatrix skalerer +kvadratisk med antallet af parametre, er denne matrix for stor til at blive lagret i hukommelsen. +I dette arbejde foresl{\aa}r vi en metode til beregning af Laplace-approximationen ved hj{\ae}lp af kun Jacobian-vektor +produkter. Dette giver os mulighed for at udf{\o}re marginal tr{\ae}ning og posterior sampling ved hj{\ae}lp af den fulde Laplace +approksimation uden at lagre hele den efterf{\o}lgende pr{\ae}cisionsmatrix. For at opn{\aa} dette viser vi, at vi kan +estimere den posteriore pr{\ae}cisionens log-determinant og den inverse kvadratrod ved hj{\ae}lp af kun jacobian-vektorprodukter. +For at overvinde de konditioneringsproblemer, der opst{\aa}r under pr{\o}vetagning, tilbyder vi flere potentielle pr{\ae}konditioneringssystemer +som kan bruges til at forbedre konvergensen af den inverse kvadratrodsapproksimation. Dern{\ae}st giver vi en teknik +til at evaluere kvaliteten af de efterf{\o}lgende stikpr{\o}ver uden at instantiere eller invertere den efterf{\o}lgende pr{\ae}cision +baseret p{\aa} resultater fra traditionel statistik. Til at gennemf{\o}re disse metoder anvender vi JAX, et bibliotek til automatisk +differentiering, som g{\o}r det muligt for os at udf{\o}re Jacobian-vektorprodukter effektivt uden eksplicit at lagre den +hele den posteriore pr{\ae}cision. +Vi udf{\o}rer den fulde Laplace-approximation p{\aa} b{\aa}de en sinusfunktion og MNIST ved hj{\ae}lp af vores metode. Denne +best{\aa}r af to trin, (a) tr{\ae}ning af et neuralt netv{\ae}rk ved at maksimere enten dets posterior sandsynlighed eller marginale +sandsynlighed og (b) udtagning af pr{\o}ver fra denne posterior. Vores tiln{\ae}rmede maksimale marginale tr{\ae}ningsprocedure er +i stand til at l{\ae}re et s{\ae}t parametre, der giver en pr{\ae}station, som er sammenlignelig med den maksimale posterior- og +maksimal sandsynlighed. Ved at analysere kvantil-kvantil-plots af vores posteriorpr{\o}ver +og visualisering af disse pr{\o}ver finder vi, at vores tiln{\ae}rmede pr{\o}veudtagningsmetode giver pr{\o}ver, som +er korrekt fordelt. Vores benchmarks af Jacobian-vektorprodukternes ydeevne vurderer, at vores +metode giver en 10 000x hukommelsesreduktion i forhold til den konventionelle fulde Laplace-approximation, da den ikke +ikke lagrer den kvadratisk skalerende matrix med fuld pr{\ae}cision for den efterf{\o}lgende tid. Dette er den f{\o}rste metode til at udf{\o}re den +Laplace-approximation, samtidig med at der kun er implicit adgang til den efterf{\o}lgende pr{\ae}cision.