Performance Optimization of 3D Lattice Boltzmann Flow Solver on a GPU

<table class="algorithm-group"><tr><td><table class="algorithm" id="alg3"><tr><td colspan="2">(<svg height="8.39864pt" id="M87" style="vertical-align:-0.04981995pt" version="1.1" viewbox="-0.0498162 -8.34882 6.36303 8.39864" width="6.36303pt" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink"><g transform="matrix(.013,0,0,-0.013,0,0)"><path d="M384 0V27C293 34 287 42 287 114V635C232 613 172 594 109 583V559L157 557C201 555 205 550 205 499V114C205 42 199 34 109 27V0H384Z" id="g113-50"></path><glyph.data ascent="3473" descent="-2876" horiz-adv-x="480" vert-adv-y="480"></glyph.data></g></svg>) int  i; </td></tr><tr><td colspan="2">(<svg height="8.39864pt" id="M88" style="vertical-align:-0.04981995pt" version="1.1" viewbox="-0.0498162 -8.34882 6.36303 8.39864" width="6.36303pt" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink"><g transform="matrix(.013,0,0,-0.013,0,0)"><path d="M412 140C382 77 369 73 315 73H129L270 222C362 320 402 379 402 466C402 571 322 635 234 635C177 635 130 609 99 576L42 495L64 475C90 514 133 568 201 568C274 568 318 519 318 435C318 349 255 267 193 193C144 135 87 78 32 23V0H405C417 45 427 89 440 131L412 140Z" id="g113-51"></path><glyph.data ascent="3473" descent="-2876" horiz-adv-x="480" vert-adv-y="480"></glyph.data></g></svg>) for(i = 0; i &lt; timeSteps; i++) </td></tr><tr><td colspan="2">(<svg height="8.55521pt" id="M89" style="vertical-align:-0.2063904pt" version="1.1" viewbox="-0.0498162 -8.34882 6.36303 8.55521" width="6.36303pt" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink"><g transform="matrix(.013,0,0,-0.013,0,0)"><path d="M285 378C315 398 338 416 353 432C373 451 384 474 384 503C384 579 325 635 236 635H235C182 635 136 610 108 579L65 516L85 496C110 533 150 575 205 575C258 575 300 543 300 481C300 407 232 369 141 339L147 310C163 315 188 321 211 321C268 321 338 284 338 192C338 94 288 40 217 40C160 40 119 68 93 91C85 98 77 97 69 91C60 84 47 71 46 58C44 46 48 35 62 22C75 10 116 -12 162 -12C234 -12 424 62 424 224C424 297 373 359 285 376V378Z" id="g113-52"></path><glyph.data ascent="3473" descent="-2876" horiz-adv-x="480" vert-adv-y="480"></glyph.data></g></svg>) <svg height="11.5564pt" id="M90" style="vertical-align:-2.26807pt" version="1.1" viewbox="-0.0498162 -9.28833 4.62754 11.5564" width="4.62754pt" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink"><g transform="matrix(.013,0,0,-0.013,0,0)"><path d="M293 -169V-141C218 -131 209 -90 209 -44C209 19 222 85 222 152C222 207 198 255 139 269V273C199 286 222 334 222 388C222 454 209 523 209 588C209 632 218 671 293 681V709C234 709 148 695 148 577C147 513 155 438 155 372C155 337 152 291 64 285V256C152 250 155 204 155 169C156 105 148 31 148 -41C148 -157 234 -169 293 -169Z" id="g113-124"></path><glyph.data ascent="3473" descent="-2876" horiz-adv-x="347" vert-adv-y="347"></glyph.data></g></svg></td></tr><tr><td colspan="2">(<svg height="8.39864pt" id="M91" style="vertical-align:-0.04981995pt" version="1.1" viewbox="-0.0498162 -8.34882 6.36303 8.39864" width="6.36303pt" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink"><g transform="matrix(.013,0,0,-0.013,0,0)"><path d="M456 178V225H360V632H320C217 496 115 347 20 206V178H280V106C280 40 276 34 189 27V0H445V27C364 34 360 39 360 106V178H456ZM280 225H82C149 335 214 431 278 520H280V225Z" id="g113-53"></path><glyph.data ascent="3473" descent="-2876" horiz-adv-x="480" vert-adv-y="480"></glyph.data></g></svg>)  collision_kernel&lt;&lt;&lt;GRID, BLOCK&gt;&gt;&gt;</td></tr><tr><td colspan="2">     (source_grid, temp_grid, xdim, ydim,</td></tr><tr><td colspan="2">     zdim, cell_size, grid_size); </td></tr><tr><td colspan="2">(<svg height="8.32035pt" id="M92" style="vertical-align:-0.2063999pt" version="1.1" viewbox="-0.0498162 -8.11395 6.36303 8.32035" width="6.36303pt" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink"><g transform="matrix(.013,0,0,-0.013,0,0)"><path d="M153 550H386L412 615L406 623H120L82 318C104 327 142 338 184 338C294 338 347 275 347 187C347 112 305 39 221 39C160 39 119 71 97 89C88 97 80 96 71 90C59 80 50 67 49 57C48 45 52 36 66 23C80 9 123 -12 169 -12C221 -11 288 15 342 59C403 109 431 165 431 225C431 308 366 395 238 395C212 395 165 379 127 364L153 550Z" id="g113-54"></path><glyph.data ascent="3473" descent="-2876" horiz-adv-x="480" vert-adv-y="480"></glyph.data></g></svg>)  cudaThreadSynchronize(); </td></tr><tr><td colspan="2">(<svg height="8.55521pt" id="M93" style="vertical-align:-0.2063904pt" version="1.1" viewbox="-0.0498162 -8.34882 6.36303 8.55521" width="6.36303pt" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink"><g transform="matrix(.013,0,0,-0.013,0,0)"><path d="M137 343C167 482 260 545 321 574C357 591 397 603 429 609L423 641C382 634 335 622 295 608C189 570 37 457 37 238C37 84 125 -12 242 -12C362 -12 447 89 447 209C447 311 374 393 267 393C247 393 226 386 204 376L137 343ZM227 337C318 337 361 256 361 173C361 105 336 22 258 22C176 22 126 120 126 240C126 266 127 291 132 310C155 323 189 337 227 337Z" id="g113-55"></path><glyph.data ascent="3473" descent="-2876" horiz-adv-x="480" vert-adv-y="480"></glyph.data></g></svg>)  streaming_kernel&lt;&lt;&lt;GRID, BLOCK&gt;&gt;&gt;(temp_grid,</td></tr><tr><td colspan="2">     dest_grid, xdim, ydim, zdim, cell_size,</td></tr><tr><td colspan="2">     grid_size); </td></tr><tr><td colspan="2">(<svg height="8.32035pt" id="M94" style="vertical-align:-0.2063999pt" version="1.1" viewbox="-0.0498162 -8.11395 6.36303 8.32035" width="6.36303pt" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink"><g transform="matrix(.013,0,0,-0.013,0,0)"><path d="M447 623H65C61 580 56 530 47 475H76C100 541 106 550 172 550H388C308 376 196 170 91 -1L98 -12L172 -2C268 204 360 408 455 611L447 623Z" id="g113-56"></path><glyph.data ascent="3473" descent="-2876" horiz-adv-x="480" vert-adv-y="480"></glyph.data></g></svg>)  cudaThreadSynchronize(); </td></tr><tr><td colspan="2">(<svg height="8.55521pt" id="M95" style="vertical-align:-0.2063904pt" version="1.1" viewbox="-0.0498162 -8.34882 6.36303 8.55521" width="6.36303pt" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink"><g transform="matrix(.013,0,0,-0.013,0,0)"><path d="M249 635C141 635 70 555 70 471C70 401 114 353 179 316C143 294 106 267 90 252C68 231 45 202 45 157C45 50 130 -12 237 -12C322 -12 435 52 435 169C435 256 372 304 303 343C349 374 375 398 383 407C401 429 411 458 411 487C411 569 344 635 249 635ZM238 603C285 603 337 567 337 482C337 422 310 385 276 358C205 393 145 426 145 500C145 552 179 603 238 603ZM248 20C183 20 125 70 125 163C125 218 158 268 206 300C284 261 355 217 355 143C355 66 308 20 248 20Z" id="g113-57"></path><glyph.data ascent="3473" descent="-2876" horiz-adv-x="480" vert-adv-y="480"></glyph.data></g></svg>)  swap_grid(source_grid, dest_grid);</td></tr><tr><td colspan="2">(<svg height="8.55521pt" id="M96" style="vertical-align:-0.2063904pt" version="1.1" viewbox="-0.0498162 -8.34882 6.36301 8.55521" width="6.36301pt" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink"><g transform="matrix(.013,0,0,-0.013,0,0)"><path d="M244 635C114 635 38 519 38 422C38 317 111 240 217 240C236 240 255 244 277 256L345 292C311 140 203 39 59 15L64 -15C89 -15 150 -5 204 17C339 72 440 202 440 386C440 521 368 635 244 635ZM228 602C326 602 352 479 352 390C352 370 351 347 348 324C327 308 293 296 258 296C174 296 124 369 124 458C124 517 152 602 228 602Z" id="g113-58"></path><glyph.data ascent="3473" descent="-2876" horiz-adv-x="480" vert-adv-y="480"></glyph.data></g></svg>) <svg height="11.5564pt" id="M97" style="vertical-align:-2.26807pt" version="1.1" viewbox="-0.0498162 -9.28833 6.80666 11.5564" width="6.80666pt" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink"><g transform="matrix(.013,0,0,-0.013,2.179,0)"><path d="M283 255V284C195 290 192 337 192 375C192 436 200 508 200 580C200 696 116 709 54 709V681C127 671 139 634 139 588C138 524 125 452 125 387C125 333 149 286 209 272V268C148 253 125 206 125 151C126 87 139 16 139 -47C139 -92 127 -131 54 -141V-169C115 -169 200 -152 200 -41C200 32 192 104 192 164C192 202 195 249 283 255Z" id="g113-126"></path><glyph.data ascent="3473" descent="-2876" horiz-adv-x="347" vert-adv-y="347"></glyph.data></g></svg></td></tr></table></td></tr></table>

<div>Two separate CUDA kernels for different phases of LBM.</div>

Scientific Programming

alg3

Algorithm 3

Algorithm 3: Performance Optimization of 3D Lattice Boltzmann Flow Solver on a GPU