{"id":"https://openalex.org/W6891784806","doi":"https://doi.org/10.48550/arxiv.2305.01024","title":"Anatomy of High-Performance GEMM with Online Fault Tolerance on GPUs","display_name":"Anatomy of High-Performance GEMM with Online Fault Tolerance on GPUs","publication_year":2023,"publication_date":"2023-05-01","ids":{"openalex":"https://openalex.org/W6891784806","doi":"https://doi.org/10.48550/arxiv.2305.01024"},"language":"en","primary_location":{"id":"doi:10.48550/arxiv.2305.01024","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2305.01024","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"article-journal"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2305.01024","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":null,"display_name":"Wu, Shixun","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wu, Shixun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":null,"display_name":"Zhai, Yujia","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhai, Yujia","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":null,"display_name":"Liu, Jinyang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Jinyang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":null,"display_name":"Huang, Jiajun","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Huang, Jiajun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":null,"display_name":"Jian, Zizhe","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jian, Zizhe","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":null,"display_name":"Wong, Bryan M.","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wong, Bryan M.","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":null,"display_name":"Chen, Zizhong","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Zizhong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":true,"primary_topic":{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.896399974822998,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.896399974822998,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10829","display_name":"Interconnection Networks and Systems","score":0.015799999237060547,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10772","display_name":"Distributed systems and fault tolerance","score":0.014499999582767487,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/kernel","display_name":"Kernel (algebra)","score":0.5080999732017517},{"id":"https://openalex.org/keywords/fault-tolerance","display_name":"Fault tolerance","score":0.5065000057220459},{"id":"https://openalex.org/keywords/overhead","display_name":"Overhead (engineering)","score":0.46650001406669617},{"id":"https://openalex.org/keywords/code","display_name":"Code (set theory)","score":0.4569999873638153},{"id":"https://openalex.org/keywords/software","display_name":"Software","score":0.45570001006126404},{"id":"https://openalex.org/keywords/matrix-multiplication","display_name":"Matrix multiplication","score":0.44920000433921814},{"id":"https://openalex.org/keywords/code-generation","display_name":"Code generation","score":0.34139999747276306},{"id":"https://openalex.org/keywords/double-precision-floating-point-format","display_name":"Double-precision floating-point format","score":0.3262999951839447}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8199999928474426},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.6254000067710876},{"id":"https://openalex.org/C74193536","wikidata":"https://www.wikidata.org/wiki/Q574844","display_name":"Kernel (algebra)","level":2,"score":0.5080999732017517},{"id":"https://openalex.org/C63540848","wikidata":"https://www.wikidata.org/wiki/Q3140932","display_name":"Fault tolerance","level":2,"score":0.5065000057220459},{"id":"https://openalex.org/C2779960059","wikidata":"https://www.wikidata.org/wiki/Q7113681","display_name":"Overhead (engineering)","level":2,"score":0.46650001406669617},{"id":"https://openalex.org/C2776760102","wikidata":"https://www.wikidata.org/wiki/Q5139990","display_name":"Code (set theory)","level":3,"score":0.4569999873638153},{"id":"https://openalex.org/C2777904410","wikidata":"https://www.wikidata.org/wiki/Q7397","display_name":"Software","level":2,"score":0.45570001006126404},{"id":"https://openalex.org/C17349429","wikidata":"https://www.wikidata.org/wiki/Q1049914","display_name":"Matrix multiplication","level":3,"score":0.44920000433921814},{"id":"https://openalex.org/C133162039","wikidata":"https://www.wikidata.org/wiki/Q1061077","display_name":"Code generation","level":3,"score":0.34139999747276306},{"id":"https://openalex.org/C459310","wikidata":"https://www.wikidata.org/wiki/Q117801","display_name":"Computational science","level":1,"score":0.3361000120639801},{"id":"https://openalex.org/C35912277","wikidata":"https://www.wikidata.org/wiki/Q1243369","display_name":"Double-precision floating-point format","level":3,"score":0.3262999951839447},{"id":"https://openalex.org/C113775141","wikidata":"https://www.wikidata.org/wiki/Q428691","display_name":"Computer engineering","level":1,"score":0.3190000057220459},{"id":"https://openalex.org/C43126263","wikidata":"https://www.wikidata.org/wiki/Q128751","display_name":"Source code","level":2,"score":0.3154999911785126},{"id":"https://openalex.org/C204323151","wikidata":"https://www.wikidata.org/wiki/Q905424","display_name":"Range (aeronautics)","level":2,"score":0.31200000643730164},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.2921000123023987},{"id":"https://openalex.org/C82876162","wikidata":"https://www.wikidata.org/wiki/Q17096504","display_name":"Latency (audio)","level":2,"score":0.2784000039100647},{"id":"https://openalex.org/C84211073","wikidata":"https://www.wikidata.org/wiki/Q117879","display_name":"Floating point","level":2,"score":0.2741999924182892},{"id":"https://openalex.org/C2778119891","wikidata":"https://www.wikidata.org/wiki/Q477690","display_name":"CUDA","level":2,"score":0.2676999866962433},{"id":"https://openalex.org/C83283714","wikidata":"https://www.wikidata.org/wiki/Q121117","display_name":"Supercomputer","level":2,"score":0.2669000029563904},{"id":"https://openalex.org/C42935608","wikidata":"https://www.wikidata.org/wiki/Q190411","display_name":"Field-programmable gate array","level":2,"score":0.26089999079704285},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.25870001316070557},{"id":"https://openalex.org/C55526617","wikidata":"https://www.wikidata.org/wiki/Q719375","display_name":"Operand","level":2,"score":0.25}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2305.01024","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2305.01024","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"article-journal"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2305.01024","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2305.01024","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"article-journal"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/9","display_name":"Industry, innovation and infrastructure","score":0.4107280671596527}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"General":[0],"Matrix":[1],"Multiplication":[2],"(GEMM)":[3],"is":[4,23,97],"a":[5,62,65,92,110,132,145,193],"crucial":[6],"algorithm":[7],"for":[8,25,35,64,72,80,148,152,229],"various":[9],"applications":[10],"such":[11],"as":[12],"machine":[13],"learning":[14],"and":[15,18,54,86,89,116,139,155,167,225,231],"scientific":[16],"computing,":[17],"an":[19],"efficient":[20],"GEMM":[21,67,81,94,128,157,177,190],"implementation":[22,95],"essential":[24],"the":[26,43,83,103,118,126,185,214],"performance":[27,37,182],"of":[28,46,135,205,221],"these":[29,47],"systems.":[30],"While":[31],"researchers":[32],"often":[33],"strive":[34],"faster":[36,101],"by":[38,236],"using":[39],"large":[40],"compute":[41],"platforms,":[42],"increased":[44],"scale":[45],"systems":[48],"can":[49],"raise":[50],"concerns":[51],"about":[52],"hardware":[53],"software":[55],"reliability.":[56],"In":[57],"this":[58],"paper,":[59],"we":[60,143],"present":[61,109,144],"design":[63],"high-performance":[66],"with":[68,99,125,203],"algorithm-based":[69],"fault":[70,123],"tolerance":[71,124],"use":[73],"on":[74,163,197],"GPUs.":[75,170],"We":[76,108,159],"describe":[77],"fault-tolerant":[78,154,189,230],"designs":[79],"at":[82],"thread,":[84],"warp,":[85],"threadblock":[87],"levels,":[88],"also":[90],"provide":[91],"baseline":[93,176],"that":[96,174],"competitive":[98],"or":[100,180],"than":[102],"state-of-the-art,":[104],"proprietary":[105],"cuBLAS":[106,201,235],"GEMM.":[107],"kernel":[111],"fusion":[112],"strategy":[113],"to":[114,122,184,200,238],"overlap":[115],"mitigate":[117],"memory":[119],"latency":[120],"due":[121],"original":[127],"computation.":[129],"To":[130],"support":[131],"wide":[133],"range":[134],"input":[136],"matrix":[137],"shapes":[138],"reduce":[140],"development":[141],"costs,":[142],"template-based":[146],"approach":[147],"automatic":[149],"code":[150,215],"generation":[151],"both":[153],"non-fault-tolerant":[156,232],"implementations.":[158],"evaluate":[160],"our":[161,175],"work":[162],"NVIDIA":[164],"Tesla":[165],"T4":[166],"A100":[168],"server":[169],"Experimental":[171],"results":[172],"demonstrate":[173],"presents":[178],"comparable":[179],"superior":[181],"compared":[183,199],"closed-source":[186],"cuBLAS.":[187],"The":[188],"incurs":[191],"only":[192],"minimal":[194],"overhead":[195],"(8.89\\%":[196],"average)":[198],"even":[202],"hundreds":[204],"errors":[206],"injected":[207],"per":[208],"minute.":[209],"For":[210],"irregularly":[211],"shaped":[212],"inputs,":[213],"generator-generated":[216],"kernels":[217],"show":[218],"remarkable":[219],"speedups":[220],"$160\\%":[222],"\\sim":[223,227],"183.5\\%$":[224],"$148.55\\%":[226],"165.12\\%$":[228],"GEMMs,":[233],"outperforming":[234],"up":[237],"$41.40\\%$.":[239]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2025-10-10T00:00:00"}
