-trace_opcode_latency_initiation_int 4,2 -trace_opcode_latency_initiation_sp 4,2 -trace_opcode_latency_initiation_dp 8,4 -trace_opcode_latency_initiation_sfu 20,8 -trace_opcode_latency_initiation_tensor 8,4 #execute branch insts on spec unit 1 #in Turing, there is a dedicated branch unit #,,,,, -specialized_unit_1 1,4,4,4,4,BRA #, -trace_opcode_latency_initiation_spec_op_1 4,4 #TEX unit, make fixed latency for all tex insts -specialized_unit_2 1,1,200,4,4,TEX -trace_opcode_latency_initiation_spec_op_2 200,4 #tensor unit -specialized_unit_3 1,4,8,4,4,TENSOR -trace_opcode_latency_initiation_spec_op_3 8,4 #UDP unit #for more info about UDP, see https://www.hotchips.org/hc31/HC31_2.12_NVIDIA_final.pdf -specialized_unit_4 1,4,4,4,4,UDP -trace_opcode_latency_initiation_spec_op_4 4,2