masters-thesis

Unnamed repository; edit this file 'description' to name the repository.
Log | Files | Refs | README

abstract.tex (6703B)


      1 \chapter*{Abstract}
      2 \addcontentsline{toc}{chapter}{Abstract}
      3 
      4 Bayesian methods promise to provide a principled way to quantify uncertainty in neural networks.
      5 This is important for many applications in machine learning, such as those involving safety-critical decisions that rely on risk assessment and interpretability.
      6 However, Bayesian inference is often computationally intractable, so approximate methods which compromise performance for practicality are used.
      7 The Laplace approximation (LA) is one such method, though it itself typically relies on crude approximations to the posterior precision matrix to make it computationally feasible.
      8 When we do not factorise the posterior precision into more practical approximations, existing methods require that the full posterior precision be instantiated.
      9 We call this the full Laplace approximation.
     10 For all but toy problems, however, since the full precision matrix scales quadratically with the number of parameters, this matrix is too large to be stored in memory.
     11 
     12 In this work, we propose a method for computing the Laplace approximation using only Jacobian-vector products.
     13 This allows us to perform marginal training and posterior sampling using the full Laplace approximation without storing the entire posterior precision matrix.
     14 To accomplish this, we show that we can estimate the posterior precision's log-determinant and inverse square root using only Jacobian-vector products.
     15 To overcome the conditioning issues that arise during sampling, we offer several potential preconditioners which can be used to improve convergence of the inverse square root approximation.
     16 Next, we give a technique for evaluating the quality of the posterior samples without instantiating nor inverting the posterior precision based on results from traditional statistics.
     17 To implement these methods, we use JAX, a library for automatic differentiation which enables us to efficiently perform Jacobian-vector products without explicitly storing the entire posterior precision.
     18 
     19 We perform the full Laplace approximation on both a sine function and MNIST using our method.
     20 This consists of two steps: (a) training a neural network by maximising either its posterior probability or marginal likelihood and (b) sampling from this posterior.
     21 Our approximate maximum marginal training procedure is able to learn a set of parameters which yields performance comparable to that of the maximum posterior and maximum likelihood training procedures.
     22 By analysing quantile--quantile plots of our posterior samples and visualising these samples, we find that our approximate sampling method produces samples which are correctly distributed.
     23 Our benchmarks of the performance of Jacobian-vector products estimate that our method yields a 10\,000x memory reduction over the conventional full Laplace approximation, since it does not store the quadratically-scaling full posterior precision matrix.
     24 This is the first method for performing the Laplace approximation while only accessing the posterior precision implicitly.
     25 
     26 \chapter*{Resum\'e}
     27 \addcontentsline{toc}{chapter}{Resum\'e}
     28 
     29 Bayesianske metoder lover at give en principiel m{\aa}de at kvantificere usikkerheden i neurale netv{\ae}rk p{\aa}.
     30 Dette er vigtigt for mange anvendelser inden for machine learning, f.eks. i forbindelse med sikkerhedskritiske beslutninger, der er afh{\ae}ngige af risikovurdering og fortolkningsmuligheder.
     31 Bayesiansk inferens er imidlertid ofte beregningsm{\ae}ssigt uh{\aa}ndterbar, s{\aa} der anvendes tiln{\ae}rmede metoder, som g{\aa}r p{\aa} kompromis med ydeevnen for at opn{\aa} praktisk anvendelighed.
     32 Laplace-approksimationen (LA) er en s{\aa}dan metode, selv om den typisk er afh{\ae}ngig af grove tiln{\ae}rmelser af den efterf{\o}lgende pr{\ae}cisionsmatrix for at g{\o}re den beregningsm{\ae}ssigt gennemf{\o}rlig.
     33 N{\aa}r vi ikke faktoriserer den efterf{\o}lgende pr{\ae}cision i mere praktiske tiln{\ae}rmelser, kr{\ae}ver de eksisterende metoder, at den fulde efterf{\o}lgende pr{\ae}cision skal instantieres.
     34 Vi kalder dette den fulde Laplace-approksimation.
     35 Da den fulde pr{\ae}cisionsmatrix imidlertid for alle problemer undtagen leget{\o}jsproblemer skalerer kvadratisk med antallet af parametre, er denne matrix for stor til at blive lagret i hukommelsen.
     36 
     37 I dette studie foresl{\aa}r vi en metode til beregning af Laplace-approksimationen ved hj{\ae}lp af Jacobian-vektorprodukter alene.
     38 Dette giver os mulighed for at udf{\o}re marginal tr{\ae}ning og efterf{\o}lgende stikpr{\o}veudtagning ved hj{\ae}lp af den fulde Laplace-approksimation uden at lagre hele den efterf{\o}lgende pr{\ae}cisionsmatrix.
     39 For at opn{\aa} dette viser vi, at vi kan estimere den posteriore pr{\ae}cisionens log-determinant og den inverse kvadratrod ved hj{\ae}lp af kun jacobianiske vektorprodukter.
     40 For at overvinde de konditioneringsproblemer, der opst{\aa}r under sampling, tilbyder vi flere potentielle pr{\ae}konditioneringsv{\ae}rkt{\o}jer, som kan anvendes til at forbedre konvergensen af den inverse kvadratrodsapproksimation.
     41 Dern{\ae}st giver vi en teknik til at evaluere kvaliteten af de efterf{\o}lgende stikpr{\o}ver uden at instantiere eller invertere den efterf{\o}lgende pr{\ae}cision baseret p{\aa} resultater fra traditionel statistik.
     42 Til at gennemf{\o}re disse metoder anvender vi JAX, et bibliotek til automatisk differentiering, som g{\o}r det muligt at udf{\o}re jacobian-vektorprodukter effektivt uden eksplicit lagring af hele den efterf{\o}lgende pr{\ae}cision.
     43 
     44 Vi udf{\o}rer den fulde Laplace-approksimation p{\aa} b{\aa}de en sinusfunktion og MNIST ved hj{\ae}lp af vores metode.
     45 Denne best{\aa}r af to trin: (a) tr{\ae}ning af et neuralt netv{\ae}rk ved at maksimere enten dets posterior sandsynlighed eller marginale sandsynlighed og (b) pr{\o}veudtagning fra denne posterior.
     46 Vores tiln{\ae}rmede maksimale marginale tr{\ae}ningsprocedure er i stand til at l{\ae}re et s{\ae}t parametre, som giver en ydeevne, der er sammenlignelig med den maksimale posterior- og maksimale sandsynlighedstr{\ae}ningsprocedure.
     47 Ved at analysere quantile--quantile-plots af vores posteriorpr{\o}ver og visualisere disse pr{\o}ver finder vi, at vores tiln{\ae}rmede pr{\o}veudtagningsmetode giver pr{\o}ver, der er korrekt fordelt.
     48 Vores benchmarks af Jacobian-vektorprodukternes ydeevne ansl{\aa}r, at vores metode giver en 10\,000x hukommelsesreduktion i forhold til den konventionelle fulde Laplace-approksimation, da den ikke lagrer den kvadratisk skalerende matrix med fuld pr{\ae}cision for den efterf{\o}lgende periode.
     49 Dette er den f{\o}rste metode til at udf{\o}re Laplace-approksimationen, hvor der kun er implicit adgang til den efterf{\o}lgende pr{\ae}cision.