diff options
Diffstat (limited to 'cuda-kernels')
24 files changed, 0 insertions, 7798 deletions
diff --git a/cuda-kernels/Makefile b/cuda-kernels/Makefile deleted file mode 100755 index b33519f..0000000 --- a/cuda-kernels/Makefile +++ /dev/null @@ -1,11 +0,0 @@ -all: tensorcore_type32_32.cu - nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o tensor_core tensorcore_type32_32.cu -# nvcc -arch=sm_70 -lcudart -g -o tensor_core tensor_core.cu - -.PHONY: -clean: - rm _cuob* - rm gpgpusim_power* - rm gpgpu_inst_stats.txt - rm gpgpusim_visualizer* -# nvcc -arch=sm_70 --gpu-architecture=compute_50 --gpu-code=compute_50 -lcudart -g -o tensor_core tensor_core.cu diff --git a/cuda-kernels/TensorCoreMatrixCArrangement.xlsx b/cuda-kernels/TensorCoreMatrixCArrangement.xlsx Binary files differdeleted file mode 100644 index 785ecc3..0000000 --- a/cuda-kernels/TensorCoreMatrixCArrangement.xlsx +++ /dev/null diff --git a/cuda-kernels/VPlog/parsing_script.py b/cuda-kernels/VPlog/parsing_script.py deleted file mode 100644 index 627c216..0000000 --- a/cuda-kernels/VPlog/parsing_script.py +++ /dev/null @@ -1,140 +0,0 @@ -import re -import time -from time import strftime - -def main(): -# time_now = str(strftime("%Y-%m-%d %H-%M-%S", time.localtime())) -# file = "\\" + "Parser Output " + time_now + ".txt" - - regexlist=[] - regexlist.append('gpu_sim_cycle.*') - regexlist.append('gpu_ipc.*') - regexlist.append('gpu_tot_issued_cta.*') - regexlist.append('L1I_total_cache_accesses.*' ) - regexlist.append('L1I_total_cache_misses.*') - regexlist.append('L1C_total_cache_accesses.*') - regexlist.append('L1C_total_cache_misses.*') - regexlist.append('Total_core_cache_stats_breakdown\[CONST_ACC_R\]\[HIT\].*') - regexlist.append('Total_core_cache_stats_breakdown\[CONST_ACC_R\]\[MISS\].*') - regexlist.append('Total_core_cache_stats_breakdown\[INST_ACC_R\]\[HIT\].*') - regexlist.append('Total_core_cache_stats_breakdown\[INST_ACC_R\]\[MISS\].*') - regexlist.append('gpgpu_n_tot_thrd_icount.*') - regexlist.append('gpgpu_n_tot_w_icount.*') - regexlist.append('gpgpu_n_stall_shd_mem.*') - regexlist.append('gpgpu_n_mem_read_global.*') - regexlist.append('gpgpu_n_mem_write_global.*') - regexlist.append('gpgpu_n_mem_const.*') - regexlist.append('gpgpu_n_load_insn.*') - regexlist.append('gpgpu_n_store_insn.*') - regexlist.append('gpgpu_n_param_mem_insn.*') - regexlist.append('traffic_breakdown_coretomem\[CONST_ACC_R\].*') - regexlist.append('traffic_breakdown_coretomem\[GLOBAL_ACC_R\].*') - regexlist.append('traffic_breakdown_coretomem\[GLOBAL_ACC_W\].*') - regexlist.append('traffic_breakdown_coretomem\[INST_ACC_R\].*') - regexlist.append('traffic_breakdown_memtocore\[CONST_ACC_R\].*') - regexlist.append('traffic_breakdown_memtocore\[GLOBAL_ACC_R\].*') - regexlist.append('traffic_breakdown_memtocore\[GLOBAL_ACC_W\].*') - regexlist.append('traffic_breakdown_memtocore\[INST_ACC_R\].*') - regexlist.append('L2_total_cache_accesses.*') - regexlist.append('L2_total_cache_misses.*') - regexlist.append('L2_cache_stats_breakdown\[GLOBAL_ACC_R\]\[HIT\].*') - regexlist.append('L2_cache_stats_breakdown\[GLOBAL_ACC_R\]\[MISS\].*') - regexlist.append('L2_cache_stats_breakdown\[CONST_ACC_R\]\[HIT\].*') - regexlist.append('L2_cache_stats_breakdown\[CONST_ACC_R\]\[MISS\].*') - regexlist.append('L2_cache_stats_breakdown\[GLOBAL_ACC_W\]\[HIT\].*') - regexlist.append('L2_cache_stats_breakdown\[GLOBAL_ACC_W\]\[MISS\].*') - regexlist.append('L2_cache_stats_breakdown\[INST_ACC_R\]\[MISS\].*') - - #VP4 - log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp4_16_summary" - export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp4_16_parsed" - for regex in regexlist: - parseData(log_file_path, export_file, regex, read_line=True) - log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp4_32_summary" - export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp4_32_parsed" - for regex in regexlist: - parseData(log_file_path, export_file, regex, read_line=True) - log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp4_64_summary" - export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp4_64_parsed" - for regex in regexlist: - parseData(log_file_path, export_file, regex, read_line=True) - log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp4_128_summary" - export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp4_128_parsed" - for regex in regexlist: - parseData(log_file_path, export_file, regex, read_line=True) - log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp4_256_summary" - export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp4_256_parsed" - for regex in regexlist: - parseData(log_file_path, export_file, regex, read_line=True) - - - #VP8 - log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp8_16_summary" - export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp8_16_parsed" - for regex in regexlist: - parseData(log_file_path, export_file, regex, read_line=True) - log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp8_32_summary" - export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp8_32_parsed" - for regex in regexlist: - parseData(log_file_path, export_file, regex, read_line=True) - log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp8_64_summary" - export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp8_64_parsed" - for regex in regexlist: - parseData(log_file_path, export_file, regex, read_line=True) - log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp8_128_summary" - export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp8_128_parsed" - for regex in regexlist: - parseData(log_file_path, export_file, regex, read_line=True) - log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp8_256_summary" - export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp8_256_parsed" - for regex in regexlist: - parseData(log_file_path, export_file, regex, read_line=True) - - #VP16 - log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp16_16_summary" - export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp16_16_parsed" - for regex in regexlist: - parseData(log_file_path, export_file, regex, read_line=True) - log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp16_32_summary" - export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp16_32_parsed" - for regex in regexlist: - parseData(log_file_path, export_file, regex, read_line=True) - log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp16_64_summary" - export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp16_64_parsed" - for regex in regexlist: - parseData(log_file_path, export_file, regex, read_line=True) - log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp16_128_summary" - export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp16_128_parsed" - for regex in regexlist: - parseData(log_file_path, export_file, regex, read_line=True) - log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp16_256_summary" - export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp16_256_parsed" - for regex in regexlist: - parseData(log_file_path, export_file, regex, read_line=True) - -def parseData(log_file_path, export_file, regex, read_line=True): - with open(log_file_path, "r") as file: - match_list = [] - if read_line == True: - for line in file: - for match in re.finditer(regex, line, re.S): - match_text = match.group() - match_text = re.sub('^.*=','',match_text.rstrip()) - match_list.append(match_text+'\n') - print match_text - else: - data = file.read() - for match in re.finditer(regex, data, re.S): - match_text = match.group(); - match_list.append(match_text) - file.close() - - with open(export_file, "a+") as file: - match_list_clean = list(set(match_list)) - for item in xrange(0, len(match_list_clean)): - print match_list_clean[item] - file.write(match_list_clean[item] )#+ "\n") - file.close() - -if __name__ == '__main__': - main() diff --git a/cuda-kernels/config_fermi_islip.icnt b/cuda-kernels/config_fermi_islip.icnt deleted file mode 100755 index 3b8b496..0000000 --- a/cuda-kernels/config_fermi_islip.icnt +++ /dev/null @@ -1,70 +0,0 @@ -//21*1 fly with 32 flits per packet under gpgpusim injection mode -use_map = 0; -flit_size = 32; - -// currently we do not use this, see subnets below -network_count = 2; - -// Topology -topology = fly; -k = 102; -n = 1; - -// Routing - -routing_function = dest_tag; - -// Flow control - -num_vcs = 1; -vc_buf_size = 8; - -wait_for_tail_credit = 0; - -// Router architecture - -vc_allocator = islip; //separable_input_first; -sw_allocator = islip; //separable_input_first; -alloc_iters = 1; - -credit_delay = 0; -routing_delay = 0; -vc_alloc_delay = 1; -sw_alloc_delay = 1; - -input_speedup = 2; -output_speedup = 1; -internal_speedup = 1.0; - -// Traffic, GPGPU-Sim does not use this - -traffic = uniform; -packet_size ={{1,2,3,4},{10,20}}; -packet_size_rate={{1,1,1,1},{2,1}}; - -// Simulation - Don't change - -sim_type = gpgpusim; -//sim_type = latency; -injection_rate = 0.1; - -subnets = 2; - -// Always use read and write no matter following line -//use_read_write = 1; - - -read_request_subnet = 0; -read_reply_subnet = 1; -write_request_subnet = 0; -write_reply_subnet = 1; - -read_request_begin_vc = 0; -read_request_end_vc = 0; -write_request_begin_vc = 0; -write_request_end_vc = 0; -read_reply_begin_vc = 0; -read_reply_end_vc = 0; -write_reply_begin_vc = 0; -write_reply_end_vc = 0; - diff --git a/cuda-kernels/genericMatrixMultiply.cu b/cuda-kernels/genericMatrixMultiply.cu deleted file mode 100644 index 8b96483..0000000 --- a/cuda-kernels/genericMatrixMultiply.cu +++ /dev/null @@ -1,288 +0,0 @@ -/* Copyright (c) 1993-2017, NVIDIA CORPORATION. All rights reserved. - * - * Redistribution and use in source and binary forms, with or without - * modification, are permitted provided that the following conditions - * are met: - * * Redistributions of source code must retain the above copyright - * notice, this list of conditions and the following disclaimer. - * * Redistributions in binary form must reproduce the above copyright - * notice, this list of conditions and the following disclaimer in the - * documentation and/or other materials provided with the distribution. - * * Neither the name of NVIDIA CORPORATION nor the names of its - * contributors may be used to endorse or promote products derived - * from this software without specific prior written permission. - * - * THIS SOFTWARE IS PROVIDED BY THE COPYRIGHT HOLDERS ``AS IS'' AND ANY - * EXPRESS OR IMPLIED WARRANTIES, INCLUDING, BUT NOT LIMITED TO, THE - * IMPLIED WARRANTIES OF MERCHANTABILITY AND FITNESS FOR A PARTICULAR - * PURPOSE ARE DISCLAIMED. IN NO EVENT SHALL THE COPYRIGHT OWNER OR - * CONTRIBUTORS BE LIABLE FOR ANY DIRECT, INDIRECT, INCIDENTAL, SPECIAL, - * EXEMPLARY, OR CONSEQUENTIAL DAMAGES (INCLUDING, BUT NOT LIMITED TO, - * PROCUREMENT OF SUBSTITUTE GOODS OR SERVICES; LOSS OF USE, DATA, OR - * PROFITS; OR BUSINESS INTERRUPTION) HOWEVER CAUSED AND ON ANY THEORY - * OF LIABILITY, WHETHER IN CONTRACT, STRICT LIABILITY, OR TORT - * (INCLUDING NEGLIGENCE OR OTHERWISE) ARISING IN ANY WAY OUT OF THE USE - * OF THIS SOFTWARE, EVEN IF ADVISED OF THE POSSIBILITY OF SUCH DAMAGE. - */ - -#include <stdio.h> -#include <stdlib.h> -// Define some error checking macros. -#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); } -void cudaErrCheck_(cudaError_t stat, const char *file, int line) { - if (stat != cudaSuccess) { - fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line); - } -} - - -#include <mma.h> -using namespace nvcuda; - -// Must be multiples of 16 for wmma code to work -#define MATRIX_M (64) -#define MATRIX_N (64) -#define MATRIX_K (64) - - - -// The only dimensions currently supported by WMMA -const int WMMA_M = 16; -const int WMMA_N = 16; -const int WMMA_K = 16; - -__global__ void wmma_example(half *a, half *b, float *c, int M, int N, int K, float alpha, float beta) { - // Leading dimensions. Packed with no transpositions. - int lda = M; - int ldb = K; - int ldc = M; - - // Tile using a 2D grid - int warpM = (blockIdx.x * blockDim.x + threadIdx.x) / warpSize; - int warpN = (blockIdx.y * blockDim.y + threadIdx.y); - - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> acc_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - - wmma::fill_fragment(acc_frag, 0.0f); - - // Loop over k - for (int i = 0; i < K; i += WMMA_K) { - int aRow = warpM * WMMA_M; - int aCol = i; - - int bRow = i; - int bCol = warpN * WMMA_N; - - // Bounds checking - if (aRow < M && aCol < K && bRow < K && bCol < N) { - // Load the inputs - wmma::load_matrix_sync(a_frag, a + aRow + aCol * lda, lda); - wmma::load_matrix_sync(b_frag, b + bRow + bCol * ldb, ldb); - - // Perform the matrix multiplication - wmma::mma_sync(acc_frag, a_frag, b_frag, acc_frag); - - } - } - - // Load in the current value of c, scale it by beta, and add this our result scaled by alpha - int cRow = warpM * WMMA_M; - int cCol = warpN * WMMA_N; - - if (cRow < M && cCol < N) { - wmma::load_matrix_sync(c_frag, c + cRow + cCol * ldc, ldc, wmma::mem_col_major); - - - for(int i=0; i < c_frag.num_elements; i++) { - c_frag.x[i] = alpha * acc_frag.x[i] + beta * c_frag.x[i]; - } - - // Store the output - wmma::store_matrix_sync(c + cRow + cCol * ldc, c_frag, ldc, wmma::mem_col_major); - } -} - -__global__ void convertFp32ToFp16 (half *out, float *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} - -int main(int argc, char* argv[]) { - float *a_fp32; - float *b_fp32; - half *a_fp16; - half *b_fp16; - - float *c; - float *c_wmma; - - float *d_host_wmma; - float *d_cal_host_wmma; - float *a_host_wmma; - float *b_host_wmma; - float *c_host_wmma; - - - cudaEvent_t startWMMA; - cudaEvent_t stopWMMA; - - - cudaErrCheck(cudaEventCreate(&startWMMA)); - cudaErrCheck(cudaEventCreate(&stopWMMA)); - - // Use tensor cores - cudaErrCheck(cudaMalloc((void**)&a_fp32, MATRIX_M * MATRIX_K * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&b_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&a_fp16, MATRIX_M * MATRIX_K * sizeof(half))); - cudaErrCheck(cudaMalloc((void**)&b_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - - cudaErrCheck(cudaMalloc((void**)&c, MATRIX_M * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&c_wmma, MATRIX_M * MATRIX_N * sizeof(float))); - - d_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - d_cal_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - c_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - a_host_wmma = (float*)malloc(MATRIX_M * MATRIX_K * sizeof(float)); - b_host_wmma = (float*)malloc(MATRIX_K * MATRIX_N * sizeof(float)); - - - printf("INITIAL_MATRIX_A\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_K;n++){ - a_host_wmma[m*MATRIX_K+n]= (rand()%3);///3.0; - printf("%.2f ",a_host_wmma[m*MATRIX_K+n]); - } - printf("\n"); - } - printf("INITIAL_MATRIX_B\n"); - for(int m=0;m<MATRIX_K;m++){ - for(int n=0;n<MATRIX_N;n++){ - b_host_wmma[m*MATRIX_N+n]=(rand()%3);///3.0; - printf("%.2f ",b_host_wmma[m*MATRIX_K+n]); - } - printf("\n"); - } - printf("INITIAL_MATRIX_C\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - c_host_wmma[m*MATRIX_N+n]= (rand()%3);///3.0; - printf("%.2f ",c_host_wmma[m*MATRIX_K+n]); - } - printf("\n"); - } - - cudaErrCheck(cudaMemcpy(a_fp32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(float), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(b_fp32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice)); - - convertFp32ToFp16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_fp16, a_fp32, MATRIX_M * MATRIX_K); - convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N); - - cudaErrCheck(cudaMemcpy(c, c_host_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(c_wmma, c, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToDevice)); - - float alpha = 1.0f; - float beta = 1.0f; - - - printf("\nM = %d, N = %d, K = %d. alpha = %f, beta = %f\n\n", MATRIX_M, MATRIX_N, MATRIX_K, alpha, beta); - - // First: using WMMA - dim3 gridDim; - dim3 blockDim; - - // blockDim.x must be a multple of warpSize - // 128x4 means we have 16 warps and a block computes a 64x64 output tile - blockDim.x = 64; - blockDim.y = 2; - - gridDim.x = (MATRIX_M + (WMMA_M * blockDim.x / 32 - 1)) / (WMMA_M * blockDim.x / 32); - gridDim.y = (MATRIX_N + WMMA_N * blockDim.y - 1) / (WMMA_N * blockDim.y); - printf("GRID:X=%d,Y=%d\n",gridDim.x,gridDim.y); - printf("BLOCK:X=%d,Y=%d\n",blockDim.x,blockDim.y); - - printf("Running with wmma...\n"); - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example <<< gridDim, blockDim >>> (a_fp16, b_fp16, c_wmma, MATRIX_M, MATRIX_N, MATRIX_K, alpha, beta); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - - printf("\nChecking results...\n"); - cudaErrCheck(cudaMemcpy(d_host_wmma, c_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - - int t=200000000; - while(t-->0); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m]; - } - } - printf("cal:d\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%.2f ",d_cal_host_wmma[m*MATRIX_K+n]); - } - printf("\n"); - } - printf("wmma:d\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%.2f ",d_host_wmma[m*MATRIX_K+n]); - } - printf("\n"); - } - int suc=1; - float relative_error; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - relative_error=100*abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])/d_host_wmma[m*MATRIX_N+n]; - printf("relative_error=%f\n",relative_error); - if((int)relative_error>1) - { - printf("ERROR:\n"); - suc=0; - printf("ROW=%d,COL=%d:cpu=%f,gpgpusim=%f\n",m,n,d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("COMPLETED_SUCCESSFULLY\n"); - - //int errors = 0; - //for (int i = 0; i < MATRIX_M * MATRIX_N; i++) { - // float v1 = c_host_wmma[i]; - // float v2 = c_host_cublas[i]; - // if (v1 / v2 > 1.0001 || v2 / v1 > 1.0001 || abs(v1 - v2) > 1e-5) { - // errors++; - // if (errors < 10) printf("%f %f\n", v1, v2); - // } - //} - - float wmmaTime; - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma took %fms\n", wmmaTime); - - cudaErrCheck(cudaEventDestroy(startWMMA)); - cudaErrCheck(cudaEventDestroy(stopWMMA)); - cudaErrCheck(cudaFree(a_fp32)); - cudaErrCheck(cudaFree(b_fp32)); - cudaErrCheck(cudaFree(a_fp16)); - cudaErrCheck(cudaFree(b_fp16)); - cudaErrCheck(cudaFree(c)); - cudaErrCheck(cudaFree(c_wmma)); - free(d_host_wmma); - free(c_host_wmma); - cudaErrCheck(cudaDeviceReset()); - return 0; -} - - diff --git a/cuda-kernels/genericMatrixMultiplyRow.cu b/cuda-kernels/genericMatrixMultiplyRow.cu deleted file mode 100644 index 6194492..0000000 --- a/cuda-kernels/genericMatrixMultiplyRow.cu +++ /dev/null @@ -1,289 +0,0 @@ -/* Copyright (c) 1993-2017, NVIDIA CORPORATION. All rights reserved. - * - * Redistribution and use in source and binary forms, with or without - * modification, are permitted provided that the following conditions - * are met: - * * Redistributions of source code must retain the above copyright - * notice, this list of conditions and the following disclaimer. - * * Redistributions in binary form must reproduce the above copyright - * notice, this list of conditions and the following disclaimer in the - * documentation and/or other materials provided with the distribution. - * * Neither the name of NVIDIA CORPORATION nor the names of its - * contributors may be used to endorse or promote products derived - * from this software without specific prior written permission. - * - * THIS SOFTWARE IS PROVIDED BY THE COPYRIGHT HOLDERS ``AS IS'' AND ANY - * EXPRESS OR IMPLIED WARRANTIES, INCLUDING, BUT NOT LIMITED TO, THE - * IMPLIED WARRANTIES OF MERCHANTABILITY AND FITNESS FOR A PARTICULAR - * PURPOSE ARE DISCLAIMED. IN NO EVENT SHALL THE COPYRIGHT OWNER OR - * CONTRIBUTORS BE LIABLE FOR ANY DIRECT, INDIRECT, INCIDENTAL, SPECIAL, - * EXEMPLARY, OR CONSEQUENTIAL DAMAGES (INCLUDING, BUT NOT LIMITED TO, - * PROCUREMENT OF SUBSTITUTE GOODS OR SERVICES; LOSS OF USE, DATA, OR - * PROFITS; OR BUSINESS INTERRUPTION) HOWEVER CAUSED AND ON ANY THEORY - * OF LIABILITY, WHETHER IN CONTRACT, STRICT LIABILITY, OR TORT - * (INCLUDING NEGLIGENCE OR OTHERWISE) ARISING IN ANY WAY OUT OF THE USE - * OF THIS SOFTWARE, EVEN IF ADVISED OF THE POSSIBILITY OF SUCH DAMAGE. - */ - -#include <stdio.h> -#include <stdlib.h> -// Define some error checking macros. -#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); } -void cudaErrCheck_(cudaError_t stat, const char *file, int line) { - if (stat != cudaSuccess) { - fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line); - } -} - - -#include <mma.h> -using namespace nvcuda; - -// Must be multiples of 16 for wmma code to work -#define MATRIX_M (32) -#define MATRIX_N (32) -#define MATRIX_K (32) - - - -// The only dimensions currently supported by WMMA -const int WMMA_M = 16; -const int WMMA_N = 16; -const int WMMA_K = 16; - -__global__ void wmma_example(half *a, half *b, float *c, int M, int N, int K, float alpha, float beta) { - // Leading dimensions. Packed with no transpositions. - int lda = M; - int ldb = K; - int ldc = M; - - // Tile using a 2D grid - int warpM = (blockIdx.x * blockDim.x + threadIdx.x) / warpSize; - int warpN = (blockIdx.y * blockDim.y + threadIdx.y); - - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> acc_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - - wmma::fill_fragment(acc_frag, 0.0f); - - // Loop over k - for (int i = 0; i < K; i += WMMA_K) { - int aRow = warpM * WMMA_M; - int aCol = i; - - int bRow = i; - int bCol = warpN * WMMA_N; - - // Bounds checking - if (aRow < M && aCol < K && bRow < K && bCol < N) { - // Load the inputs - wmma::load_matrix_sync(a_frag, a + aRow * lda+ aCol , lda); - wmma::load_matrix_sync(b_frag, b + bRow * ldb+ bCol , ldb); - - // Perform the matrix multiplication - wmma::mma_sync(acc_frag, a_frag, b_frag, acc_frag); - - } - } - - // Load in the current value of c, scale it by beta, and add this our result scaled by alpha - int cRow = warpM * WMMA_M; - int cCol = warpN * WMMA_N; - - if (cRow < M && cCol < N) { - wmma::load_matrix_sync(c_frag, c + cRow*ldc + cCol , ldc, wmma::mem_row_major); - - - for(int i=0; i < c_frag.num_elements; i++) { - c_frag.x[i] = alpha * acc_frag.x[i] + beta * c_frag.x[i]; - } - - // Store the output - wmma::store_matrix_sync(c + cRow *ldc + cCol , c_frag, ldc, wmma::mem_row_major); - } -} - -__global__ void convertFp32ToFp16 (half *out, float *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} - -int main(int argc, char* argv[]) { - float *a_fp32; - float *b_fp32; - half *a_fp16; - half *b_fp16; - - float *c; - float *c_wmma; - - float *d_host_wmma; - float *d_cal_host_wmma; - float *a_host_wmma; - float *b_host_wmma; - float *c_host_wmma; - - - cudaEvent_t startWMMA; - cudaEvent_t stopWMMA; - - - cudaErrCheck(cudaEventCreate(&startWMMA)); - cudaErrCheck(cudaEventCreate(&stopWMMA)); - - // Use tensor cores - cudaErrCheck(cudaMalloc((void**)&a_fp32, MATRIX_M * MATRIX_K * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&b_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&a_fp16, MATRIX_M * MATRIX_K * sizeof(half))); - cudaErrCheck(cudaMalloc((void**)&b_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - - cudaErrCheck(cudaMalloc((void**)&c, MATRIX_M * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&c_wmma, MATRIX_M * MATRIX_N * sizeof(float))); - - d_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - d_cal_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - c_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - a_host_wmma = (float*)malloc(MATRIX_M * MATRIX_K * sizeof(float)); - b_host_wmma = (float*)malloc(MATRIX_K * MATRIX_N * sizeof(float)); - - - printf("INITIAL_MATRIX_A\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_K;n++){ - a_host_wmma[m*MATRIX_K+n]= (rand()%3);///3.0; - printf("%.2f ",a_host_wmma[m*MATRIX_K+n]); - } - printf("\n"); - } - printf("INITIAL_MATRIX_B\n"); - for(int m=0;m<MATRIX_K;m++){ - for(int n=0;n<MATRIX_N;n++){ - b_host_wmma[m*MATRIX_N+n]=(rand()%3);///3.0; - printf("%.2f ",b_host_wmma[m*MATRIX_K+n]); - } - printf("\n"); - } - printf("INITIAL_MATRIX_C\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - c_host_wmma[m*MATRIX_N+n]= (rand()%3);///3.0; - printf("%.2f ",c_host_wmma[m*MATRIX_K+n]); - } - printf("\n"); - } - - cudaErrCheck(cudaMemcpy(a_fp32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(float), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(b_fp32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice)); - - convertFp32ToFp16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_fp16, a_fp32, MATRIX_M * MATRIX_K); - convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N); - - cudaErrCheck(cudaMemcpy(c, c_host_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(c_wmma, c, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToDevice)); - - float alpha = 1.0f; - float beta = 1.0f; - - - printf("\nM = %d, N = %d, K = %d. alpha = %f, beta = %f\n\n", MATRIX_M, MATRIX_N, MATRIX_K, alpha, beta); - - // First: using WMMA - dim3 gridDim; - dim3 blockDim; - - // blockDim.x must be a multple of warpSize - // 128x4 means we have 16 warps and a block computes a 64x64 output tile - blockDim.x = 64; - blockDim.y = 2; - - gridDim.x = (MATRIX_M + (WMMA_M * blockDim.x / 32 - 1)) / (WMMA_M * blockDim.x / 32); - gridDim.y = (MATRIX_N + WMMA_N * blockDim.y - 1) / (WMMA_N * blockDim.y); - printf("GRID:X=%d,Y=%d\n",gridDim.x,gridDim.y); - printf("BLOCK:X=%d,Y=%d\n",blockDim.x,blockDim.y); - - printf("Running with wmma...\n"); - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example <<< gridDim, blockDim >>> (a_fp16, b_fp16, c_wmma, MATRIX_M, MATRIX_N, MATRIX_K, alpha, beta); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - - printf("\nChecking results...\n"); - cudaErrCheck(cudaMemcpy(d_host_wmma, c_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - - int t=200000000; - while(t-->0); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - printf("cal:d\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%.2f ",d_cal_host_wmma[m*MATRIX_K+n]); - } - printf("\n"); - } - printf("wmma:d\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%.2f ",d_host_wmma[m*MATRIX_K+n]); - } - printf("\n"); - } - int suc=1; - float relative_error; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - relative_error=100*abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])/d_host_wmma[m*MATRIX_N+n]; - printf("relative_error=%f\n",relative_error); - if((int)relative_error>1) - { - printf("ERROR:\n"); - suc=0; - printf("ROW=%d,COL=%d:cpu=%f,gpgpusim=%f\n",m,n,d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("COMPLETED_SUCCESSFULLY\n"); - - //int errors = 0; - //for (int i = 0; i < MATRIX_M * MATRIX_N; i++) { - // float v1 = c_host_wmma[i]; - // float v2 = c_host_cublas[i]; - // if (v1 / v2 > 1.0001 || v2 / v1 > 1.0001 || abs(v1 - v2) > 1e-5) { - // errors++; - // if (errors < 10) printf("%f %f\n", v1, v2); - // } - //} - - float wmmaTime; - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma took %fms\n", wmmaTime); - - cudaErrCheck(cudaEventDestroy(startWMMA)); - cudaErrCheck(cudaEventDestroy(stopWMMA)); - cudaErrCheck(cudaFree(a_fp32)); - cudaErrCheck(cudaFree(b_fp32)); - cudaErrCheck(cudaFree(a_fp16)); - cudaErrCheck(cudaFree(b_fp16)); - cudaErrCheck(cudaFree(c)); - cudaErrCheck(cudaFree(c_wmma)); - free(d_host_wmma); - free(c_host_wmma); - cudaErrCheck(cudaDeviceReset()); - return 0; -} - - diff --git a/cuda-kernels/gpgpusim.config b/cuda-kernels/gpgpusim.config deleted file mode 100755 index 5f1be25..0000000 --- a/cuda-kernels/gpgpusim.config +++ /dev/null @@ -1,151 +0,0 @@ -# This config models the Pascal GP102 (GeForceGTX 1080Ti) - -# functional simulator specification --gpgpu_ptx_instruction_classification 0 --gpgpu_ptx_sim_mode 0 --gpgpu_ptx_force_max_capability 70 - -# SASS execution (only supported with CUDA >= 4.0) --gpgpu_ptx_convert_to_ptxplus 0 --gpgpu_ptx_save_converted_ptxplus 0 - -# high level architecture configuration --gpgpu_n_clusters 80 --gpgpu_n_cores_per_cluster 1 --gpgpu_n_mem 11 --gpgpu_n_sub_partition_per_mchannel 2 - -# Pascal clock domains -#-gpgpu_clock_domains <Core Clock>:<Interconnect Clock>:<L2 Clock>:<DRAM Clock> -# Pascal NVIDIA TITAN X clock domains are adopted from -# https://en.wikipedia.org/wiki/GeForce_10_series --gpgpu_clock_domains 1481.0:2962.0:1481.0:2750.0 - -# shader core pipeline config --gpgpu_shader_registers 65536 - -# This implies a maximum of 64 warps/SM --gpgpu_shader_core_pipeline 2048:32 --gpgpu_shader_cta 32 --gpgpu_simd_model 1 - -# Pipeline widths and number of FUs -# ID_OC_SP,ID_OC_SFU,ID_OC_MEM,OC_EX_SP,OC_EX_SFU,OC_EX_MEM,EX_WB -## Pascal GP102 has 4 SP SIMD units and 1 SFU unit -## we need to scale the number of pipeline registers to be equal to the number of SP units --gpgpu_pipeline_widths 4,1,1,1,1,4,1,1,1,1,6 --gpgpu_num_sp_units 4 --gpgpu_num_sfu_units 1 -# Instruction latencies and initiation intervals -# "ADD,MAX,MUL,MAD,DIV" -# SFU is 32-width in pascal, then dp units initiation is 1 cycle --ptx_opcode_latency_int 4,13,4,5,145,16,4 --ptx_opcode_initiation_int 1,2,2,2,8,16,4 --ptx_opcode_latency_fp 4,13,4,5,39 --ptx_opcode_initiation_fp 1,2,1,1,4 --ptx_opcode_latency_dp 8,19,8,8,330 --ptx_opcode_initiation_dp 1,2,1,1,130 - -# <nsets>:<bsize>:<assoc>,<rep>:<wr>:<alloc>:<wr_alloc>:<set_index_fn>,<mshr>:<N>:<merge>,<mq>:**<fifo_entry> -# ** Optional parameter - Required when mshr_type==Texture Fifo -# Note: Hashing set index function (H) only applies to a set size of 32 or 64. -# Pascal GP102 has 96KB Shared memory -# Pascal GP102 has 64KB L1 cache -# The default is to disable the L1 cache, unless cache modifieres is used --gpgpu_cache:dl1 64:128:6,L:L:m:N:H,A:128:8,8 --gpgpu_shmem_size 98304 --gmem_skip_L1D 1 - -# 64 sets, each 128 bytes 16-way for each memory sub partition (128 KB per memory sub partition). This gives 3MB L2 cache --gpgpu_cache:dl2 64:128:16,L:B:m:W:L,A:1024:1024,4:0,32 # used to be 128:4 --gpgpu_cache:dl2_texture_only 0 - -# 4 KB Inst. --gpgpu_cache:il1 8:128:4,L:R:f:N:L,A:2:48,4 -# 48 KB Tex --gpgpu_tex_cache:l1 16:128:24,L:R:m:N:L,F:128:4,128:2 -# 12 KB Const --gpgpu_const_cache:l1 128:64:2,L:R:f:N:L,A:2:64,4 - -# enable operand collector -## larger operand collectors and reg_banks are needed for the 4 warp schedulers and 4 SIMD units --gpgpu_operand_collector_num_units_sp 20 --gpgpu_operand_collector_num_units_sfu 4 -#-gpgpu_operand_collector_num_units_tensor_core 24 --gpgpu_operand_collector_num_units_mem 8 --gpgpu_operand_collector_num_in_ports_sp 4 --gpgpu_operand_collector_num_out_ports_sp 4 --gpgpu_operand_collector_num_in_ports_sfu 1 --gpgpu_operand_collector_num_out_ports_sfu 1 -#-gpgpu_operand_collector_num_in_ports_tensor_core 1 -#-gpgpu_operand_collector_num_out_ports_tensor_core 1 --gpgpu_operand_collector_num_in_ports_mem 10 --gpgpu_operand_collector_num_out_ports_mem 10 -# gpgpu_num_reg_banks should be increased to 32, but it gives an error! --gpgpu_num_reg_banks 32 - -# shared memory bankconflict detection --gpgpu_shmem_num_banks 32 --gpgpu_shmem_limited_broadcast 0 --gpgpu_shmem_warp_parts 1 - -## In Pascal, a warp scheduler can issue 2 insts per cycle --gpgpu_max_insn_issue_per_warp 2 - -# interconnection --network_mode 1 --inter_config_file config_fermi_islip.icnt - -# memory partition latency config --rop_latency 120 --dram_latency 100 - -# dram model config --gpgpu_dram_scheduler 1 -# The DRAM return queue and the scheduler queue together should provide buffer -# to sustain the memory level parallelism to tolerate DRAM latency -# To allow 100% DRAM utility, there should at least be enough buffer to sustain -# the minimum DRAM latency (100 core cycles). I.e. -# Total buffer space required = 100 x 924MHz / 700MHz = 132 --gpgpu_frfcfs_dram_sched_queue_size 64 --gpgpu_dram_return_queue_size 116 - -# for NVIDIA GeForceGTX 1080Ti, bus width is 352bits (11 DRAM chips x 32 bits) -# 11 memory paritions, 4 bytes (1 DRAM chip) per memory partition -# the atom size of GDDR5X (the smallest read request) is 32 bytes --gpgpu_n_mem_per_ctrlr 1 --gpgpu_dram_buswidth 4 --gpgpu_dram_burst_length 8 --dram_data_command_freq_ratio 4 # GDDR5X is QDR --gpgpu_mem_address_mask 1 --gpgpu_mem_addr_mapping dramid@8;00000000.00000000.00000000.00000000.0000RRRR.RRRRRRRR.RBBBCCCC.BCCSSSSS - -# Use the same GDDR5 timing from hynix H5GQ1H24AFR -# disable bank groups for now, set nbkgrp to 1 and tCCDL and tRTPL to 0 --gpgpu_dram_timing_opt "nbk=16:CCD=2:RRD=6:RCD=12:RAS=28:RP=12:RC=40: - CL=12:WL=4:CDLR=5:WR=12:nbkgrp=1:CCDL=0:RTPL=0" - -# Pascal has four schedulers per core --gpgpu_num_sched_per_core 2 -# Two Level Scheduler with active and pending pools -#-gpgpu_scheduler two_level_active:6:0:1 -# Loose round robbin scheduler -#-gpgpu_scheduler lrr -# Greedy then oldest scheduler --gpgpu_scheduler gto - -# stat collection --gpgpu_memlatency_stat 14 --gpgpu_runtime_stat 500 --enable_ptx_file_line_stats 1 --visualizer_enabled 1 - -# power model configs --power_simulation_enabled 1 --gpuwattch_xml_file gpuwattch_gtx1080Ti.xml - -# tracing functionality -#-trace_enabled 1 -#-trace_components WARP_SCHEDULER,SCOREBOARD -#-trace_sampling_core 0 - diff --git a/cuda-kernels/gpuwattch_gtx1080Ti.xml b/cuda-kernels/gpuwattch_gtx1080Ti.xml deleted file mode 100755 index 02619ff..0000000 --- a/cuda-kernels/gpuwattch_gtx1080Ti.xml +++ /dev/null @@ -1,538 +0,0 @@ -<?xml version="1.0" ?> -<component id="root" name="root"> - <component id="system" name="system"> - <!--McPAT will skip the components if number is set to 0 --> - <param name="GPU_Architecture" value="1"/><!-- 0-G80; 1-Fermi; others not supported --> - <param name="number_of_cores" value="28"/> - <param name="architecture" value="1"/> <!-- fermi:1 quadro:2 other: undefined--> - <param name="number_of_L1Directories" value="0"/> - <param name="number_of_L2Directories" value="0"/> - <param name="number_of_L2s" value="1"/> <!-- This number means how many L2 clusters in each cluster there can be multiple banks/ports --> - <param name="number_of_L3s" value="0"/> <!-- This number means how many L3 clusters --> - <param name="number_of_NoCs" value="1"/> - <param name="homogeneous_cores" value="1"/><!--1 means homo --> - <param name="homogeneous_L2s" value="1"/> - <param name="homogeneous_L1Directorys" value="1"/> - <param name="homogeneous_L2Directorys" value="1"/> - <param name="homogeneous_L3s" value="1"/> - <param name="homogeneous_ccs" value="1"/><!--cache coherece hardware --> - <param name="homogeneous_NoCs" value="1"/> - <param name="core_tech_node" value="23"/><!-- nm --> - <param name="target_core_clockrate" value="1481"/><!--MHz --> - <param name="temperature" value="380"/> <!-- Kelvin --> - <param name="number_cache_levels" value="2"/> - <param name="interconnect_projection_type" value="0"/><!--0: agressive wire technology; 1: conservative wire technology --> - <param name="device_type" value="0"/><!--0: HP(High Performance Type); 1: LSTP(Low standby power) 2: LOP (Low Operating Power) --> - <param name="longer_channel_device" value="1"/><!-- 0 no use; 1 use when possible --> - <param name="machine_bits" value="32"/> - <param name="virtual_address_width" value="32"/> - <param name="physical_address_width" value="32"/> - <param name="virtual_memory_page_size" value="4096"/> - <param name="idle_core_power" value="1.59"/><!-- idle core power for GTX479 --> - <!--param name="scaling_coefficients" value="10,0.0884816,10,10,8,10,4.12782,10,2.48832,10,10,10,4.29982,0.387764,0.0714269,0.14302,0.01,0.546811,0.485351,0.806633,0.818073,1.9207,100,100,100,87.9303,100,10,4.3548,10"/--> - <param name="TOT_INST" value="10" /> - <param name="FP_INT" value="10" /> - <param name="IC_H" value="0.001" /> - <param name="IC_M" value="10" /> - <param name="DC_RH" value="1" /> - <param name="DC_RM" value="1" /> - <param name="DC_WH" value="1" /> - <param name="DC_WM" value="1" /> - <param name="TC_H" value="0.001" /> - <param name="TC_M" value="10" /> - <param name="CC_H" value="4.5071" /> - <param name="CC_M" value="10" /> - <param name="SHRD_ACC" value="10" /> - <param name="REG_RD" value="1.6294" /> - <param name="REG_WR" value="0.5031" /> - <param name="NON_REG_OPs" value="0.01" /> - <param name="SP_ACC" value="10" /> - <param name="SFU_ACC" value="0.0082" /> - <param name="FPU_ACC" value="0.4126" /> - <param name="MEM_RD" value="0.1234" /> - <param name="MEM_WR" value="0.001" /> - <param name="MEM_PRE" value="0.001" /> - <param name="L2_RH" value="100" /> - <param name="L2_RM" value="100" /> - <param name="L2_WH" value="100" /> - <param name="L2_WM" value="42.6966" /> - <param name="NOC_A" value="100" /> - <param name="PIPE_A" value="44.8085" /> - <param name="IDLE_CORE_N" value="2.0382"/> - <param name="CONST_DYNAMICN" value="5.0005" /> - <stat name="num_idle_cores" value="0"/><!-- Average Number of idle cores during this period --> - <stat name="total_cycles" value="total_cycles_match_mcpat"/> - <stat name="idle_cycles" value="idle_cycles_match_mcpat"/> - <stat name="busy_cycles" value="busy_cycles_match_mcpat"/> - <!--This page size(B) is complete different from the page size in Main memo secction. this page size is the size of - virtual memory from OS/Archi perspective; the page size in Main memo secction is the actuall physical line in a DRAM bank --> - <!-- *********************** cores ******************* --> - <component id="system.core0" name="core0"> - <!-- Core property --> - <param name="clock_rate" value="1481"/> - <param name="instruction_length" value="32"/> - <param name="opcode_width" value="9"/> - <!-- address width determins the tag_width in Cache, LSQ and buffers in cache controller - default value is machine_bits, if not set --> - <param name="machine_type" value="1"/><!-- 1 inorder; 0 OOO--> - <!-- inorder/OoO --> - <param name="number_hardware_threads" value="32"/> - <!-- number_instruction_fetch_ports(icache ports) is always 1 in single-thread processor, - it only may be more than one in SMT processors. BTB ports always equals to fetch ports since - branch information in consective branch instructions in the same fetch group can be read out from BTB once.--> - <param name="fetch_width" value="1"/> - <!-- fetch_width determins the size of cachelines of L1 cache block --> - <param name="number_instruction_fetch_ports" value="1"/> - <param name="decode_width" value="1"/> - <!-- decode_width determins the number of ports of the - renaming table (both RAM and CAM) scheme --> - <param name="issue_width" value="2"/> - <!-- issue_width determins the number of ports of Issue window and other logic - as in the complexity effective proccessors paper; issue_width==dispatch_width --> - <param name="commit_width" value="2"/> - <!-- commit_width determins the number of ports of register files --> - <param name="fp_issue_width" value="1"/> - <param name="prediction_width" value="0"/> - <!-- number of branch instructions can be predicted simultannouesl--> - <!-- Current version of McPAT does not distinguish int and floating point pipelines - Theses parameters are reserved for future use.--> - <param name="pipelines_per_core" value="1,1"/> - <!--integer_pipeline and floating_pipelines, if the floating_pipelines is 0, then the pipeline is shared--> - <param name="pipeline_depth" value="8,8"/> - <!-- pipeline depth of int and fp, if pipeline is shared, the second number is the average cycles of fp ops --> - <!-- issue and exe unit--> - <param name="ALU_per_core" value="32"/> - <!-- contains an adder, a shifter, and a logical unit --> - <param name="MUL_per_core" value="4"/> - <!-- For MUL and Div --> - <param name="FPU_per_core" value="32"/> - <!-- buffer between IF and ID stage --> - <param name="instruction_buffer_size" value="1"/> - <!-- buffer between ID and sche/exe stage --> - <param name="decoded_stream_buffer_size" value="1"/> - <param name="instruction_window_scheme" value="0"/><!-- 0 PHYREG based, 1 RSBASED--> - <!-- McPAT support 2 types of OoO cores, RS based and physical reg based--> - <param name="instruction_window_size" value="1"/> - <param name="fp_instruction_window_size" value="1"/> - <!-- the instruction issue Q as in Alpha 21264; The RS as in Intel P6 --> - <param name="ROB_size" value="0"/> - <!-- each in-flight instruction has an entry in ROB --> - <!-- registers --> - <!-- SM parameters Added by Syed Gilani --> - <param name="rf_banks" value="32"/> - <param name="simd_width" value="32"/> - <param name="collector_units" value="32"/> - <param name="core_clock_ratio" value="2"/> - <param name="warp_size" value="32"/> - - <param name="archi_Regs_IRF_size" value="65536"/> - <param name="archi_Regs_FRF_size" value="32"/> - <!-- if OoO processor, phy_reg number is needed for renaming logic, - renaming logic is for both integer and floating point insts. --> - <param name="phy_Regs_IRF_size" value="32"/> - <param name="phy_Regs_FRF_size" value="32"/> - <!-- rename logic --> - <param name="rename_scheme" value="0"/> - <!-- can be RAM based(0) or CAM based(1) rename scheme - RAM-based scheme will have free list, status table; - CAM-based scheme have the valid bit in the data field of the CAM - both RAM and CAM need RAM-based checkpoint table, checkpoint_depth=# of in_flight instructions; - Detailed RAT Implementation see TR --> - <param name="register_windows_size" value="0"/> - <!-- how many windows in the windowed register file, sun processors; - no register windowing is used when this number is 0 --> - <!-- In OoO cores, loads and stores can be issued whether inorder(Pentium Pro) or (OoO)out-of-order(Alpha), - They will always try to exeute out-of-order though. --> - <param name="LSU_order" value="inorder"/> - <param name="store_buffer_size" value="32"/> - <!-- By default, in-order cores do not have load buffers --> - <param name="load_buffer_size" value="32"/> - <!-- number of ports refer to sustainable concurrent memory accesses --> - <param name="memory_ports" value="2"/> - <!-- max_allowed_in_flight_memo_instructions determins the # of ports of load and store buffer - as well as the ports of Dcache which is connected to LSU --> - <!-- dual-pumped Dcache can be used to save the extra read/write ports --> - <param name="RAS_size" value="1"/> - <!-- general stats, defines simulation periods;require total, idle, and busy cycles for senity check --> - <!-- please note: if target architecture is X86, then all the instrucions refer to (fused) micro-ops --> - <stat name="total_instructions" value="total_instructions_match_mcpat"/> - <stat name="int_instructions" value="int_instruction_match_mcpat"/> - <stat name="fp_instructions" value="flt_instruction_match_mcpat"/> - <stat name="branch_instructions" value="branch_instruction_match_mcpat"/> - <stat name="branch_mispredictions" value="0"/> - <stat name="load_instructions" value="load_instruction_match_mcpat"/> - <stat name="store_instructions" value="store_instruction_match_mcpat"/> - <stat name="committed_instructions" value="total_instructions_match_mcpat"/> - <stat name="committed_int_instructions" value="int_instruction_match_mcpat"/> - <stat name="committed_fp_instructions" value="flt_instruction_match_mcpat"/> - <stat name="pipeline_duty_cycle" value="0.6"/><!--<=1, runtime_ipc/peak_ipc; averaged for all cores if homogenous --> - <!-- the following cycle stats are used for heterogeneouse cores only, - please ignore them if homogeneouse cores --> - <stat name="total_cycles" value="total_cycles_match_mcpat"/> - <stat name="idle_cycles" value="idle_cycles_match_mcpat"/> - <stat name="busy_cycles" value="busy_cycles_match_mcpat"/> - <!-- instruction buffer stats --> - <!-- ROB stats, both RS and Phy based OoOs have ROB - performance simulator should capture the difference on accesses, - otherwise, McPAT has to guess based on number of commited instructions. --> - <stat name="ROB_reads" value="263886"/> - <stat name="ROB_writes" value="263886"/> - <!-- RAT accesses --> - <stat name="rename_accesses" value="263886"/> - <stat name="fp_rename_accesses" value="263886"/> - <!-- decode and rename stage use this, should be total ic - nop --> - <!-- Inst window stats --> - <stat name="inst_window_reads" value="263886"/> - <stat name="inst_window_writes" value="263886"/> - <stat name="inst_window_wakeup_accesses" value="263886"/> - <stat name="fp_inst_window_reads" value="263886"/> - <stat name="fp_inst_window_writes" value="263886"/> - <stat name="fp_inst_window_wakeup_accesses" value="263886"/> - <!-- RF accesses --> - <stat name="int_regfile_reads" value="int_register_read_access_match_mcpat"/> - <stat name="float_regfile_reads" value="int_register_write_access_match_mcpat"/> - <stat name="int_regfile_writes" value="float_register_read_access_match_mcpat"/> - <stat name="float_regfile_writes" value="float_register_write_access_match_mcpat"/> - - <!-- The following stat is for operand collector power - Added by Syed --> - <stat name="non_rf_operands" value="0"/> - - <!-- accesses to the working reg --> - <stat name="function_calls" value="0"/> - <stat name="context_switches" value="0"/> <!--not used in the McPAT --> - <!-- Number of Windowes switches (number of function calls and returns)--> - <!-- Alu stats by default, the processor has one FPU that includes the divider and - multiplier. The fpu accesses should include accesses to multiplier and divider --> - <stat name="ialu_accesses" value="ialu_accesses_match_mcpat"/> - <stat name="fpu_accesses" value="fpu_accesses_match_mcpat"/> - <stat name="mul_accesses" value="mul_accesses_match_mcpat"/> - <stat name="cdb_alu_accesses" value="0"/> - <stat name="cdb_mul_accesses" value="0"/> - <stat name="cdb_fpu_accesses" value="0"/> - <!-- multiple cycle accesses should be counted multiple times, - otherwise, McPAT can use internal counter for different floating point instructions - to get final accesses. But that needs detailed info for floating point inst mix --> - <!-- currently the performance simulator should - make sure all the numbers are final numbers, - including the explicit read/write accesses, - and the implicite accesses such as replacements and etc. - Future versions of McPAT may be able to reason the implicite access - based on param and stats of last level cache - The same rule applies to all cache access stats too! --> - <!-- following is AF for max power computation. - Do not change them, unless you understand them--> - <stat name="IFU_duty_cycle" value="0.25"/> - <stat name="LSU_duty_cycle" value="0.25"/> - <stat name="MemManU_I_duty_cycle" value="1"/> - <stat name="MemManU_D_duty_cycle" value="0.25"/> - <stat name="ALU_duty_cycle" value="0.9"/> - <stat name="MUL_duty_cycle" value="0.5"/> - <stat name="FPU_duty_cycle" value="1"/><!-- FPU numbers are already average --> - <stat name="ALU_cdb_duty_cycle" value="0.9"/> - <stat name="MUL_cdb_duty_cycle" value="0.5"/> - <stat name="FPU_cdb_duty_cycle" value="15"/> - <component id="system.core0.predictor" name="PBT"> - <!-- branch predictor; tournament predictor see Alpha implementation --> - <param name="local_predictor_size" value="10,3"/> - <param name="local_predictor_entries" value="1024"/> - <param name="global_predictor_entries" value="4096"/> - <param name="global_predictor_bits" value="2"/> - <param name="chooser_predictor_entries" value="4096"/> - <param name="chooser_predictor_bits" value="2"/> - <!-- These parameters can be combined like below in next version - <param name="load_predictor" value="10,3,1024"/> - <param name="global_predictor" value="4096,2"/> - <param name="predictor_chooser" value="4096,2"/> - --> - </component> - <component id="system.core0.itlb" name="itlb"> - <param name="number_entries" value="1"/> - <stat name="total_accesses" value="0"/> - <stat name="total_misses" value="0"/> - <stat name="conflicts" value="0"/> - <!-- there is no write requests to itlb although writes happen to itlb after miss, - which is actually a replacement --> - </component> - <component id="system.core0.icache" name="icache"> - <!-- there is no write requests to itlb although writes happen to it after miss, - which is actually a replacement --> - <param name="icache_config" value="16384,128,4,1,1,3,8,0"/> - <!-- the parameters are capacity,block_width, associativity, bank, throughput w.r.t. core clock, latency w.r.t. core clock,output_width, cache policy --> - <!-- cache_policy;//0 no write or write-though with non-write allocate;1 write-back with write-allocate --> - <param name="buffer_sizes" value="16, 16, 16,0"/> - <!-- cache controller buffer sizes: miss_buffer_size(MSHR),fill_buffer_size,prefetch_buffer_size,wb_buffer_size--> - <stat name="read_accesses" value="total_instructions_match_mcpat"/> - <stat name="read_misses" value="0"/> - <stat name="conflicts" value="0"/> - </component> - <component id="system.core0.dtlb" name="dtlb"> - <param name="number_entries" value="1"/> - <stat name="total_accesses" value="0"/> - <stat name="total_misses" value="0"/> - <stat name="conflicts" value="0"/> - </component> - <component id="system.core0.ccache" name="ccache"> - <!-- all the buffer related are optional --> - <param name="ccache_config" value="16384,64,2,1,1,3,8,0"/> - <param name="buffer_sizes" value="16, 16, 16, 0"/> - <!-- cache controller buffer sizes: miss_buffer_size(MSHR),fill_buffer_size,prefetch_buffer_size,wb_buffer_size--> - <stat name="read_accesses" value="ccache_read_accesses_match_mcpat"/> - <stat name="write_accesses" value="0"/> - <stat name="read_misses" value="ccache_read_misses_match_mcpat"/> - <stat name="write_misses" value="0"/> - <stat name="conflicts" value="0"/> - </component> - <component id="system.core0.tcache" name="tcache"> - <!-- all the buffer related are optional --> - <param name="tcache_config" value="49152,128,8,1,1,3,8,0"/> - <param name="buffer_sizes" value="16, 16, 16, 0"/> - <!-- cache controller buffer sizes: miss_buffer_size(MSHR),fill_buffer_size,prefetch_buffer_size,wb_buffer_size--> - <stat name="read_accesses" value="tcache_read_accesses_match_mcpat"/> - <stat name="write_accesses" value="0"/> - <stat name="read_misses" value="tcache_read_misses_match_mcpat"/> - <stat name="write_misses" value="0"/> - <stat name="conflicts" value="0"/> - </component> - <!--model the shared memory by mimicing dcache--> - <component id="system.core0.sharedmemory" name="sharedmemory"> - <!-- all the buffer related are optional --> - <param name="sharedmemory_config" value="98304,16,1,16,1,3,16,0"/> - <!-- the parameters are capacity,block_width, associativity, bank, throughput w.r.t. core clock, latency w.r.t. core clock,output_width, cache policy --> - <param name="buffer_sizes" value="16, 16, 16, 16"/> - <!-- cache controller buffer sizes: miss_buffer_size(MSHR),fill_buffer_size,prefetch_buffer_size,wb_buffer_size--> - <stat name="read_accesses" value="sharedmemory_read_access_match_mcpat"/> - <stat name="write_accesses" value="sharedmemory_write_access_match_mcpat"/> - <stat name="read_misses" value="0"/> - <stat name="write_misses" value="0"/> - <stat name="conflicts" value="0"/> - </component> - <component id="system.core0.dcache" name="dcache"> - <!-- all the buffer related are optional --> - <param name="dcache_config" value="16384,32,4,1,1,3,8,0"/> - <param name="buffer_sizes" value="16, 16, 16, 0"/> - <!-- cache controller buffer sizes: miss_buffer_size(MSHR),fill_buffer_size,prefetch_buffer_size,wb_buffer_size--> - <stat name="read_accesses" value="dcache_read_access_match_mcpat"/> - <stat name="write_accesses" value="dcache_write_access_match_mcpat"/> - <stat name="read_misses" value="dcache_read_miss_match_mcpat"/> - <stat name="write_misses" value="dcache_write_miss_match_mcpat"/> - <stat name="conflicts" value="0"/> - </component> - <component id="system.core0.BTB" name="BTB"> - <!-- all the buffer related are optional --> - <param name="BTB_config" value="8192,4,2,1, 1,3"/> - <!-- the parameters are capacity,block_width,associativity,bank, throughput w.r.t. core clock, latency w.r.t. core clock,--> - </component> - </component> - <component id="system.L1Directory0" name="L1Directory0"> - <param name="Directory_type" value="0"/> - <!--0 cam based shadowed tag. 1 directory cache --> - <param name="Dir_config" value="2048,1,0,1, 4, 4,8"/> - <!-- the parameters are capacity,block_width, associativity,bank, throughput w.r.t. core clock, latency w.r.t. core clock,--> - <param name="buffer_sizes" value="8, 8, 8, 8"/> - <!-- all the buffer related are optional --> - <param name="clockrate" value="1400"/> - <param name="ports" value="1,1,1"/> - <!-- number of r, w, and rw search ports --> - <param name="device_type" value="0"/> - <!-- altough there are multiple access types, - Performance simulator needs to cast them into reads or writes - e.g. the invalidates can be considered as writes --> - <stat name="read_accesses" value="800000"/> - <stat name="write_accesses" value="27276"/> - <stat name="read_misses" value="1632"/> - <stat name="write_misses" value="183"/> - <stat name="conflicts" value="20"/> - <stat name="duty_cycle" value="0.45"/> - </component> - <component id="system.L2Directory0" name="L2Directory0"> - <param name="Directory_type" value="1"/> - <!--0 cam based shadowed tag. 1 directory cache --> - <param name="Dir_config" value="1048576,16,16,1,2, 100"/> - <!-- the parameters are capacity,block_width, associativity,bank, throughput w.r.t. core clock, latency w.r.t. core clock,--> - <param name="buffer_sizes" value="8, 8, 8, 8"/> - <!-- all the buffer related are optional --> - <param name="clockrate" value="1400"/> - <param name="ports" value="1,1,1"/> - <!-- number of r, w, and rw search ports --> - <param name="device_type" value="0"/> - <!-- altough there are multiple access types, - Performance simulator needs to cast them into reads or writes - e.g. the invalidates can be considered as writes --> - <stat name="read_accesses" value="0"/> - <stat name="write_accesses" value="0"/> - <stat name="read_misses" value="0"/> - <stat name="write_misses" value="0"/> - <stat name="conflicts" value="0"/> - <stat name="duty_cycle" value="0.45"/> - </component> - <component id="system.L20" name="L20"> - <!-- all the buffer related are optional --> - <param name="L2_config" value="131072,128,16,1, 4,23, 64, 1"/> - <!-- consider 4-way bank interleaving for Niagara 1 --> - <!-- the parameters are capacity,block_width, associativity, bank, throughput w.r.t. core clock, latency w.r.t. core clock,output_width, cache policy --> - <param name="buffer_sizes" value="16, 16, 16, 16"/> - <!-- cache controller buffer sizes: miss_buffer_size(MSHR),fill_buffer_size,prefetch_buffer_size,wb_buffer_size--> - <param name="clockrate" value="2962"/> - <param name="ports" value="1,1,1"/> - <!-- number of r, w, and rw ports --> - <param name="device_type" value="0"/> - <stat name="read_accesses" value="200000"/> - <stat name="write_accesses" value="0"/> - <stat name="read_misses" value="0"/> - <stat name="write_misses" value="0"/> - <stat name="conflicts" value="0"/> - <stat name="duty_cycle" value="0.5"/> - </component> - -<!--**********************************************************************--> -<component id="system.L30" name="L30"> - <param name="L3_config" value="1048576,64,16,1, 2,100, 64,1"/> - <!-- the parameters are capacity,block_width, associativity, bank, throughput w.r.t. core clock, latency w.r.t. core clock,output_width, cache policy --> - <param name="clockrate" value="3500"/> - <param name="ports" value="1,1,1"/> - <!-- number of r, w, and rw ports --> - <param name="device_type" value="0"/> - <param name="buffer_sizes" value="16, 16, 16, 16"/> - <!-- cache controller buffer sizes: miss_buffer_size(MSHR),fill_buffer_size,prefetch_buffer_size,wb_buffer_size--> - <stat name="read_accesses" value="58824"/> - <stat name="write_accesses" value="27276"/> - <stat name="read_misses" value="1632"/> - <stat name="write_misses" value="183"/> - <stat name="conflicts" value="0"/> - <stat name="duty_cycle" value="0.35"/> - </component> - - -<!--**********************************************************************--> - <component id="system.NoC0" name="noc0"> - <param name="clockrate" value="700"/> - <param name="type" value="1"/> - <!-- 1 NoC, O bus --> - <param name="horizontal_nodes" value="2"/> - <param name="vertical_nodes" value="1"/> - <param name="has_global_link" value="0"/> - <!-- 1 has global link, 0 does not have global link --> - <param name="link_throughput" value="1"/><!--w.r.t clock --> - <param name="link_latency" value="1"/><!--w.r.t clock --> - <!-- througput >= latency --> - <!-- Router architecture --> - <param name="input_ports" value="6"/> - <param name="output_ports" value="6"/> - <param name="virtual_channel_per_port" value="1"/> - <!-- input buffer; in classic routers only input ports need buffers --> - <param name="flit_bits" value="32"/> - <param name="input_buffer_entries_per_vc" value="1"/><!--VCs within the same ports share input buffers whose size is propotional to the number of VCs--> - <param name="chip_coverage" value="1"/> - <!-- When multiple NOC present, one NOC will cover part of the whole chip. chip_coverage <=1 --> - <stat name="total_accesses" value="0"/> - <!-- This is the number of total accesses within the whole network not for each router --> - <stat name="duty_cycle" value="0.6"/> - </component> -<!--**********************************************************************--> -<!--**********************************************************************--> - - <component id="system.mem" name="mem"> - <!-- Main memory property --> - <param name="mem_tech_node" value="23"/> - <param name="device_clock" value="200"/><!--MHz, this is clock rate of the actual memory device, not the FSB --> - <param name="peak_transfer_rate" value="3200"/><!--MB/S--> - <param name="internal_prefetch_of_DRAM_chip" value="4"/> - <!-- 2 for DDR, 4 for DDR2, 8 for DDR3...--> - <!-- the device clock, peak_transfer_rate, and the internal prefetch decide the DIMM property --> - <!-- above numbers can be easily found from Wikipedia --> - <param name="capacity_per_channel" value="4096"/> <!-- MB --> - <!-- capacity_per_Dram_chip=capacity_per_channel/number_of_dimms/number_ranks/Dram_chips_per_rank - Current McPAT assumes single DIMMs are used.--> - <param name="number_ranks" value="2"/> - <param name="num_banks_of_DRAM_chip" value="6"/> - <param name="Block_width_of_DRAM_chip" value="64"/> <!-- B --> - <param name="output_width_of_DRAM_chip" value="8"/> - <!--number of Dram_chips_per_rank=" 72/output_width_of_DRAM_chip--> - <!--number of Dram_chips_per_rank=" 72/output_width_of_DRAM_chip--> - <param name="page_size_of_DRAM_chip" value="8"/> <!-- 8 or 16 --> - <param name="burstlength_of_DRAM_chip" value="8"/> - <stat name="memory_accesses" value="1052"/> - <stat name="memory_reads" value="1052"/> - <stat name="memory_writes" value="1052"/> - </component> - <component id="system.mc" name="mc"> - <!-- Memeory controllers are for DDR(2,3...) DIMMs --> - <!-- current version of McPAT uses published values for base parameters of memory controller - improvments on MC will be added in later versions. --> - <param name="type" value="0"/> <!-- 1: low power; 0 high performance --> - <param name="mc_clock" value="1848"/><!--DIMM IO bus clock rate MHz DDR2-400 for Niagara 1--> - <param name="peak_transfer_rate" value="29568"/><!--MB/S Syed: GTX 470 has 177.4GB/s mem transfer rate with 6 MCs --> - <param name="block_size" value="64"/><!--B--> - <param name="number_mcs" value="6"/><!-- 6 GDDR5 memory controllers --> - <!-- current McPAT only supports homogeneous memory controllers --> - <param name="memory_channels_per_mc" value="2"/> - <param name="number_ranks" value="1"/> - <param name="withPHY" value="0"/> - <!-- # of ranks of each channel--> - <param name="req_window_size_per_channel" value="16"/> - <param name="IO_buffer_size_per_channel" value="16"/> - <param name="databus_width" value="32"/> - <param name="addressbus_width" value="32"/> - <param name="PRT_entries" value="32"/> - <!-- # of empirical DRAM model parameter --> - <param name="dram_cmd_coeff" value="0"/> - <param name="dram_act_coeff" value="0"/> - <param name="dram_nop_coeff" value="0"/> - <param name="dram_activity_coeff" value="0"/> - <param name="dram_pre_coeff" value="3.8475e-8f"/> - <param name="dram_rd_coeff" value="7.74707143e-8f"/> - <param name="dram_wr_coeff" value="3.54664286e-8f"/> - <param name="dram_req_coeff" value="0"/> - <param name="dram_const_coeff" value="0"/> - - <!-- McPAT will add the control bus width to the addressbus width automatically --> - <stat name="memory_accesses" value="memory_accesses_match_mcpat"/> - <stat name="memory_reads" value="memory_reads_match_mcpat"/> - <stat name="memory_writes" value="memory_writes_match_mcpat"/> - <!-- McPAT does not track individual mc, instead, it takes the total accesses and calculate - the average power per MC or per channel. This is sufficent for most application. - Further trackdown can be easily added in later versions. --> - </component> -<!--**********************************************************************--> - <component id="system.niu" name="niu"> - <!-- On chip 10Gb Ethernet NIC, including XAUI Phy and MAC controller --> - <!-- For a minimum IP packet size of 84B at 10Gb/s, a new packet arrives every 67.2ns. - the low bound of clock rate of a 10Gb MAC is 150Mhz --> - <param name="type" value="0"/> <!-- 1: low power; 0 high performance --> - <param name="clockrate" value="350"/> - <param name="number_units" value="0"/> <!-- unlike PCIe and memory controllers, each Ethernet controller only have one port --> - <stat name="duty_cycle" value="1.0"/> <!-- achievable max load <= 1.0 --> - <stat name="total_load_perc" value="0.7"/> <!-- ratio of total achived load to total achivable bandwidth --> - <!-- McPAT does not track individual nic, instead, it takes the total accesses and calculate - the average power per nic or per channel. This is sufficent for most application. --> - </component> -<!--**********************************************************************--> - <component id="system.pcie" name="pcie"> - <!-- On chip PCIe controller, including Phy--> - <!-- For a minimum PCIe packet size of 84B at 8Gb/s per lane (PCIe 3.0), a new packet arrives every 84ns. - the low bound of clock rate of a PCIe per lane logic is 120Mhz --> - <param name="type" value="0"/> <!-- 1: low power; 0 high performance --> - <param name="withPHY" value="1"/> - <param name="clockrate" value="350"/> - <param name="number_units" value="0"/> - <param name="num_channels" value="8"/> <!-- 2 ,4 ,8 ,16 ,32 --> - <stat name="duty_cycle" value="1.0"/> <!-- achievable max load <= 1.0 --> - <stat name="total_load_perc" value="0.7"/> <!-- Percentage of total achived load to total achivable bandwidth --> - <!-- McPAT does not track individual pcie controllers, instead, it takes the total accesses and calculate - the average power per pcie controller or per channel. This is sufficent for most application. --> - </component> -<!--**********************************************************************--> - <component id="system.flashc" name="flashc"> - <param name="number_flashcs" value="0"/> - <param name="type" value="1"/> <!-- 1: low power; 0 high performance --> - <param name="withPHY" value="1"/> - <param name="peak_transfer_rate" value="200"/><!--Per controller sustainable reak rate MB/S --> - <stat name="duty_cycle" value="1.0"/> <!-- achievable max load <= 1.0 --> - <stat name="total_load_perc" value="0.7"/> <!-- Percentage of total achived load to total achivable bandwidth --> - <!-- McPAT does not track individual flash controller, instead, it takes the total accesses and calculate - the average power per fc or per channel. This is sufficent for most application --> - </component> -<!--**********************************************************************--> - - </component> -</component> diff --git a/cuda-kernels/scripts b/cuda-kernels/scripts deleted file mode 100755 index a24fb72..0000000 --- a/cuda-kernels/scripts +++ /dev/null @@ -1,139 +0,0 @@ -#!/bin/bash -nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp4_16 v4p_genericMatrixMultiply.cu -DSIZE=16 -nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp4_32 v4p_genericMatrixMultiply.cu -DSIZE=32 -nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp4_64 v4p_genericMatrixMultiply.cu -DSIZE=64 -nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp4_128 v4p_genericMatrixMultiply.cu -DSIZE=128 -nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp4_256 v4p_genericMatrixMultiply.cu -DSIZE=256 -./vp4_16>vp4_log16 -./vp4_32>vp4_log32 -./vp4_64>vp4_log64 -./vp4_128>vp4_log128 -./vp4_256>vp4_log256 - -#grep "kernel_name.*convertInt32To" -A 589 vp4_log16 >vp4_16_summary -#grep "kernel_name.*convertInt32To" -A 589 vp4_log32 >vp4_32_summary -#grep "kernel_name.*convertInt32To" -A 589 vp4_log64 >vp4_64_summary -#grep "kernel_name.*convertInt32To" -A 589 vp4_log128 >vp4_128_summary -#grep "kernel_name.*convertInt32To" -A 589 vp4_log256 >vp4_256_summary -###grep "kernel_name.*vp_example" -A 589 vp4_log16 >>vp4_16_summary -###grep "kernel_name.*vp_example" -A 589 vp4_log32 >>vp4_32_summary -###grep "kernel_name.*vp_example" -A 589 vp4_log64 >>vp4_64_summary -#grep "kernel_name.*vp_example" -A 589 vp4_log128 >>vp4_128_summary -#grep "kernel_name.*vp_example" -A 589 vp4_log256 >>vp4_256_summary - - -nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp8_16 v8p_genericMatrixMultiply.cu -DSIZE=16 -nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp8_32 v8p_genericMatrixMultiply.cu -DSIZE=32 -nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp8_64 v8p_genericMatrixMultiply.cu -DSIZE=64 -nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp8_128 v8p_genericMatrixMultiply.cu -DSIZE=128 -nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp8_256 v8p_genericMatrixMultiply.cu -DSIZE=256 -./vp8_16 >vp8_log16 -./vp8_32 >vp8_log32 -./vp8_64 >vp8_log64 -./vp8_128>vp8_log128 -./vp8_256>vp8_log256 - -#grep "kernel_name.*convertInt32To" -A 589 vp8_log16 >vp8_16_summary -#grep "kernel_name.*convertInt32To" -A 589 vp8_log32 >vp8_32_summary -#grep "kernel_name.*convertInt32To" -A 589 vp8_log64 >vp8_64_summary -#grep "kernel_name.*convertInt32To" -A 589 vp8_log128 >vp8_128_summary -#grep "kernel_name.*convertInt32To" -A 589 vp8_log256 >vp8_256_summary -##grep "kernel_name.*vp_example" -A 589 vp8_log16 >>vp8_16_summary -##grep "kernel_name.*vp_example" -A 589 vp8_log32 >>vp8_32_summary -##grep "kernel_name.*vp_example" -A 589 vp8_log64 >>vp8_64_summary -#grep "kernel_name.*vp_example" -A 589 vp8_log128 >>vp8_128_summary -#grep "kernel_name.*vp_example" -A 589 vp8_log256 >>vp8_256_summary - -nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp16_16 v16p_genericMatrixMultiply.cu -DSIZE=16 -nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp16_32 v16p_genericMatrixMultiply.cu -DSIZE=32 -nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp16_64 v16p_genericMatrixMultiply.cu -DSIZE=64 -nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp16_128 v16p_genericMatrixMultiply.cu -DSIZE=128 -nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp16_256 v16p_genericMatrixMultiply.cu -DSIZE=256 -./vp16_16>vp16_log16 -./vp16_32>vp16_log32 -./vp16_64>vp16_log64 -./vp16_128>vp16_log128 -./vp16_256>vp16_log256 - -#grep "kernel_name.*convertInt32To" -A 589 vp16_log16 >vp16_16_summary -#grep "kernel_name.*convertInt32To" -A 589 vp16_log32 >vp16_32_summary -#grep "kernel_name.*convertInt32To" -A 589 vp16_log64 >vp16_64_summary -#grep "kernel_name.*convertInt32To" -A 589 vp16_log128 >vp16_128_summary -#grep "kernel_name.*convertInt32To" -A 589 vp16_log256 >vp16_256_summary -##grep "kernel_name.*vp_example" -A 589 vp16_log16 >>vp16_16_summary -##grep "kernel_name.*vp_example" -A 589 vp16_log32 >>vp16_32_summary -##grep "kernel_name.*vp_example" -A 589 vp16_log64 >>vp16_64_summary -#grep "kernel_name.*vp_example" -A 589 vp16_log128 >>vp16_128_summary -#grep "kernel_name.*vp_example" -A 589 vp16_log256 >>vp16_256_summary - -###sed -n '/bind.*to.*kernel.*vp_example/,$p' vp4_log16 > kernel_log_vp4_log16 -###sed -n '/bind.*to.*kernel.*vp_example/,$p' vp4_log32 > kernel_log_vp4_log32 -###sed -n '/bind.*to.*kernel.*vp_example/,$p' vp4_log64 > kernel_log_vp4_log64 -####sed -n '/bind.*to.*kernel.*vp_example/,$p' vp4_log128 > kernel_log_vp4_log128 -####sed -n '/bind.*to.*kernel.*vp_example/,$p' vp4_log256 > kernel_log_vp4_log256 -###sed -n '/bind.*to.*kernel.*vp_example/,$p' vp8_log16 > kernel_log_vp8_log16 -###sed -n '/bind.*to.*kernel.*vp_example/,$p' vp8_log32 > kernel_log_vp8_log32 -###sed -n '/bind.*to.*kernel.*vp_example/,$p' vp8_log64 > kernel_log_vp8_log64 -####sed -n '/bind.*to.*kernel.*vp_example/,$p' vp8_log128 > kernel_log_vp8_log128 -####sed -n '/bind.*to.*kernel.*vp_example/,$p' vp8_log256 > kernel_log_vp8_log256 -###sed -n '/bind.*to.*kernel.*vp_example/,$p' vp16_log16 > kernel_log_vp16_log16 -###sed -n '/bind.*to.*kernel.*vp_example/,$p' vp16_log32 > kernel_log_vp16_log32 -###sed -n '/bind.*to.*kernel.*vp_example/,$p' vp16_log64 > kernel_log_vp16_log64 -####sed -n '/bind.*to.*kernel.*vp_example/,$p' vp16_log128 > kernel_log_vp16_log128 -####sed -n '/bind.*to.*kernel.*vp_example/,$p' vp16_log256 > kernel_log_vp16_log256 -### -###grep memtocore:Icnt kernel_log_vp4_log16>memtocore_vp4_log16 -###grep coretomem:Icnt kernel_log_vp4_log16>coretomem_vp4_log16 -###grep MEM_TXN kernel_log_vp4_log16> gen_mem_vp4_log16 -###grep memtocore:Icnt kernel_log_vp4_log32>memtocore_vp4_log32 -###grep coretomem:Icnt kernel_log_vp4_log32>coretomem_vp4_log32 -###grep MEM_TXN kernel_log_vp4_log32> gen_mem_vp4_log32 -###grep memtocore:Icnt kernel_log_vp4_log64>memtocore_vp4_log64 -###grep coretomem:Icnt kernel_log_vp4_log64>coretomem_vp4_log64 -###grep MEM_TXN kernel_log_vp4_log64> gen_mem_vp4_log64 -####grep memtocore:Icnt kernel_log_vp4_log128>memtocore_vp4_log128 -####grep coretomem:Icnt kernel_log_vp4_log128>coretomem_vp4_log128 -####grep MEM_TXN kernel_log_vp4_log128> gen_mem_vp4_log128 -####grep memtocore:Icnt kernel_log_vp4_log256>memtocore_vp4_log256 -####grep coretomem:Icnt kernel_log_vp4_log256>coretomem_vp4_log256 -####grep MEM_TXN kernel_log_vp4_log256> gen_mem_vp4_log256 -### -###grep memtocore:Icnt kernel_log_vp8_log16>memtocore_vp8_log16 -###grep coretomem:Icnt kernel_log_vp8_log16>coretomem_vp8_log16 -###grep MEM_TXN kernel_log_vp8_log16> gen_mem_vp8_log16 -###grep memtocore:Icnt kernel_log_vp8_log32>memtocore_vp8_log32 -###grep coretomem:Icnt kernel_log_vp8_log32>coretomem_vp8_log32 -###grep MEM_TXN kernel_log_vp8_log32> gen_mem_vp8_log32 -###grep memtocore:Icnt kernel_log_vp8_log64>memtocore_vp8_log64 -###grep coretomem:Icnt kernel_log_vp8_log64>coretomem_vp8_log64 -###grep MEM_TXN kernel_log_vp8_log64> gen_mem_vp8_log64 -####grep memtocore:Icnt kernel_log_vp8_log128>memtocore_vp8_log128 -####grep coretomem:Icnt kernel_log_vp8_log128>coretomem_vp8_log128 -####grep MEM_TXN kernel_log_vp8_log128> gen_mem_vp8_log128 -####grep memtocore:Icnt kernel_log_vp8_log256>memtocore_vp8_log256 -####grep coretomem:Icnt kernel_log_vp8_log256>coretomem_vp8_log256 -####grep MEM_TXN kernel_log_vp8_log256> gen_mem_vp8_log256 -### -###grep memtocore:Icnt kernel_log_vp16_log16>memtocore_vp16_log16 -###grep coretomem:Icnt kernel_log_vp16_log16>coretomem_vp16_log16 -###grep MEM_TXN kernel_log_vp16_log16> gen_mem_vp16_log16 -###grep memtocore:Icnt kernel_log_vp16_log32>memtocore_vp16_log32 -###grep coretomem:Icnt kernel_log_vp16_log32>coretomem_vp16_log32 -###grep MEM_TXN kernel_log_vp16_log32> gen_mem_vp16_log32 -###grep memtocore:Icnt kernel_log_vp16_log64>memtocore_vp16_log64 -###grep coretomem:Icnt kernel_log_vp16_log64>coretomem_vp16_log64 -###grep MEM_TXN kernel_log_vp16_log64> gen_mem_vp16_log64 -####grep memtocore:Icnt kernel_log_vp16_log128>memtocore_vp16_log128 -####grep coretomem:Icnt kernel_log_vp16_log128>coretomem_vp16_log128 -####grep MEM_TXN kernel_log_vp16_log128> gen_mem_vp16_log128 -####grep memtocore:Icnt kernel_log_vp16_log256>memtocore_vp16_log256 -####grep coretomem:Icnt kernel_log_vp16_log256>coretomem_vp16_log256 -####grep MEM_TXN kernel_log_vp16_log256> gen_mem_vp16_log256 -### -###mv kernel_* MemTraffic/ -###mv memtocore* MemTraffic/ -###mv coretomem* MemTraffic/ -###mv gen_mem* MemTraffic/ -### -###mv vp* VPlog/ -###make clean diff --git a/cuda-kernels/tensor_core.cu b/cuda-kernels/tensor_core.cu deleted file mode 100644 index b7090c4..0000000 --- a/cuda-kernels/tensor_core.cu +++ /dev/null @@ -1,245 +0,0 @@ -/* Copyright (c) 1993-2017, NVIDIA CORPORATION. All rights reserved. - * - * Redistribution and use in source and binary forms, with or without - * modification, are permitted provided that the following conditions - * are met: - * * Redistributions of source code must retain the above copyright - * notice, this list of conditions and the following disclaimer. - * * Redistributions in binary form must reproduce the above copyright - * notice, this list of conditions and the following disclaimer in the - * documentation and/or other materials provided with the distribution. - * * Neither the name of NVIDIA CORPORATION nor the names of its - * contributors may be used to endorse or promote products derived - * from this software without specific prior written permission. - * - * THIS SOFTWARE IS PROVIDED BY THE COPYRIGHT HOLDERS ``AS IS'' AND ANY - * EXPRESS OR IMPLIED WARRANTIES, INCLUDING, BUT NOT LIMITED TO, THE - * IMPLIED WARRANTIES OF MERCHANTABILITY AND FITNESS FOR A PARTICULAR - * PURPOSE ARE DISCLAIMED. IN NO EVENT SHALL THE COPYRIGHT OWNER OR - * CONTRIBUTORS BE LIABLE FOR ANY DIRECT, INDIRECT, INCIDENTAL, SPECIAL, - * EXEMPLARY, OR CONSEQUENTIAL DAMAGES (INCLUDING, BUT NOT LIMITED TO, - * PROCUREMENT OF SUBSTITUTE GOODS OR SERVICES; LOSS OF USE, DATA, OR - * PROFITS; OR BUSINESS INTERRUPTION) HOWEVER CAUSED AND ON ANY THEORY - * OF LIABILITY, WHETHER IN CONTRACT, STRICT LIABILITY, OR TORT - * (INCLUDING NEGLIGENCE OR OTHERWISE) ARISING IN ANY WAY OUT OF THE USE - * OF THIS SOFTWARE, EVEN IF ADVISED OF THE POSSIBILITY OF SUCH DAMAGE. - */ - -#include <stdio.h> - -// Define some error checking macros. -#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); } -void cudaErrCheck_(cudaError_t stat, const char *file, int line) { - if (stat != cudaSuccess) { - fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line); - } -} - - - - -#include <mma.h> -using namespace nvcuda; - -// Must be multiples of 16 for wmma code to work -#define MATRIX_M (16) -#define MATRIX_N (16) -#define MATRIX_K (16) - - - -// The only dimensions currently supported by WMMA -const int WMMA_M = 16; -const int WMMA_N = 16; -const int WMMA_K = 16; - - -// Performs an MxNxK GEMM (C=alpha*A*B + beta*C) assuming: -// 1) Matrices are packed in memory. -// 2) M, N and K are multiples of 16. -// 3) Neither A nor B are transposed. -// Note: This is NOT a high performance example but is for demonstration purposes only -// For a high performance code please use the GEMM provided in cuBLAS. -__global__ void wmma_example(half *a, half *b, float *c, int M, int N, int K, float alpha, float beta) { - unsigned int start_time=0,end_time=0; - // Leading dimensions. Packed with no transpositions. - start_time=clock(); - int lda = M; - int ldb = K; - int ldc = M; - - // Tile using a 2D grid/ - int warpM = (blockIdx.x * blockDim.x + threadIdx.x) / warpSize; - int warpN = (blockIdx.y * blockDim.y + threadIdx.y); - - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> acc_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - - wmma::fill_fragment(c_frag, 0.0f); - - int i=0; - int aRow = warpM * WMMA_M; - int bCol = warpN * WMMA_N; - int aCol = i; - int bRow = i; - - - // Bounds checking - if (aRow < M && aCol < K && bRow < K && bCol < N) { - wmma::load_matrix_sync(a_frag, a+aRow+aCol*lda, lda); - wmma::load_matrix_sync(b_frag, b+bRow*ldb+bCol, ldb); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - //wmma::mma_sync(acc_frag, a_frag, b_frag, acc_frag); - } - int cRow = warpM * WMMA_M; - int cCol = warpN * WMMA_N; - wmma::store_matrix_sync(c + cRow + cCol * ldc, c_frag, ldc, wmma::mem_col_major); - end_time=clock(); - printf("clock=%d",end_time-start_time); -} - -__global__ void convertFp32ToFp16 (half *out, float *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} - -int main(int argc, char* argv[]) { - float *a_fp32; - float *b_fp32; - half *a_fp16; - half *b_fp16; - - float *c; - float *c_cublas; - float *c_wmma; - - float *c_host_cublas; - float *c_host_wmma; - float *a_host_wmma; - float *b_host_wmma; - float *c_init_host_wmma; - - - cudaEvent_t startWMMA; - cudaEvent_t stopWMMA; - - - cudaErrCheck(cudaEventCreate(&startWMMA)); - cudaErrCheck(cudaEventCreate(&stopWMMA)); - - // Use tensor cores - - cudaErrCheck(cudaMalloc((void**)&a_fp32, MATRIX_M * MATRIX_K * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&b_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&a_fp16, MATRIX_M * MATRIX_K * sizeof(half))); - cudaErrCheck(cudaMalloc((void**)&b_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - - cudaErrCheck(cudaMalloc((void**)&c, MATRIX_M * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&c_wmma, MATRIX_M * MATRIX_N * sizeof(float))); - - c_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - c_init_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - a_host_wmma = (float*)malloc(MATRIX_M * MATRIX_K * sizeof(float)); - b_host_wmma = (float*)malloc(MATRIX_K * MATRIX_N * sizeof(float)); - -// printf("a_fp32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_K;n++){ - a_host_wmma[m*MATRIX_K+n]=(m*MATRIX_K+n)%10; - } - //printf(";\n"); - } - - // printf("b_fp32\n"); - for(int m=0;m<MATRIX_K;m++){ - for(int n=0;n<MATRIX_N;n++){ - b_host_wmma[m*MATRIX_N+n]=(m*MATRIX_N+n)%10; - // printf("%f ",b_host_wmma[m*MATRIX_N+n]); - } - // printf(";\n"); - } - cudaErrCheck(cudaMemcpy(a_fp32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(float), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(b_fp32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice)); - - // curand doesn't currently support fp16 so we generate in fp32 and convert to fp16. - convertFp32ToFp16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_fp16, a_fp32, MATRIX_M * MATRIX_K); - convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - c_init_host_wmma[m*MATRIX_N+n]=(m*MATRIX_M+n)%10; - } - } - cudaErrCheck(cudaMemcpy(c, c_init_host_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(c_wmma, c, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToDevice)); - - float alpha = 1.0f; - float beta = 1.0f; - - - printf("\nM = %d, N = %d, K = %d. alpha = %f, beta = %f\n\n", MATRIX_M, MATRIX_N, MATRIX_K, alpha, beta); - - // First: using WMMA - dim3 gridDim; - dim3 blockDim; - - // blockDim.x must be a multple of warpSize - // 128x4 means we have 16 warps and a block computes a 64x64 output tile - blockDim.x = 128; - blockDim.y = 4; - - gridDim.x = (MATRIX_M + (WMMA_M * blockDim.x / 32 - 1)) / (WMMA_M * blockDim.x / 32); - gridDim.y = (MATRIX_N + WMMA_N * blockDim.y - 1) / (WMMA_N * blockDim.y); - - printf("Running with wmma...\n"); - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example <<< 1, 32>>> (a_fp16, b_fp16, c_wmma, MATRIX_M, MATRIX_N, MATRIX_K, alpha, beta); - // wmma_example <<< gridDim, blockDim >>> (a_fp16, b_fp16, c_wmma, MATRIX_M, MATRIX_N, MATRIX_K, alpha, beta); - cudaErrCheck(cudaEventRecord(stopWMMA)); - - - - - // Error checking - printf("\nChecking results...\n"); - cudaErrCheck(cudaMemcpy(c_host_wmma, c_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - // printf("c_host\n"); - // for(int m=0;m<MATRIX_M;m++){ - //for(int n=0;n<MATRIX_N;n++){ - //printf("%f ",c_host_wmma[m*MATRIX_N+n]); - //} - //printf(";\n"); - // } - - float wmmaTime; - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma took %fms\n", wmmaTime); - //printf("Clock=%d",stopWMMA-startWMMA); - printf("\nFor a faster code using wmma you should check out the cudaTensorCoreGemm sample in the CUDA Toolkit.\nThis code was written as a demo only!\n\n"); - - - cudaErrCheck(cudaEventDestroy(startWMMA)); - cudaErrCheck(cudaEventDestroy(stopWMMA)); - - - cudaErrCheck(cudaFree(a_fp32)); - cudaErrCheck(cudaFree(b_fp32)); - cudaErrCheck(cudaFree(a_fp16)); - cudaErrCheck(cudaFree(b_fp16)); - - cudaErrCheck(cudaFree(c)); - cudaErrCheck(cudaFree(c_wmma)); - - free(c_host_wmma); - - cudaErrCheck(cudaDeviceReset()); - return 0; -} - - diff --git a/cuda-kernels/tensor_core_ptx b/cuda-kernels/tensor_core_ptx deleted file mode 100644 index 36074cb..0000000 --- a/cuda-kernels/tensor_core_ptx +++ /dev/null @@ -1,171 +0,0 @@ -// -// Generated by NVIDIA NVVM Compiler -// -// Compiler Build ID: CL-22781540 -// Cuda compilation tools, release 9.0, V9.0.176 -// Based on LLVM 3.4svn -// - -.version 6.0 -.target sm_70 -.address_size 64 - - // .globl _Z12wmma_exampleP6__halfS0_Pfiiiff -.extern .func (.param .b32 func_retval0) vprintf -( - .param .b64 vprintf_param_0, - .param .b64 vprintf_param_1 -) -; -.global .align 16 .b8 $str[9] = {99, 108, 111, 99, 107, 61, 37, 100, 0}; - -.visible .entry _Z12wmma_exampleP6__halfS0_Pfiiiff( - .param .u64 _Z12wmma_exampleP6__halfS0_Pfiiiff_param_0, - .param .u64 _Z12wmma_exampleP6__halfS0_Pfiiiff_param_1, - .param .u64 _Z12wmma_exampleP6__halfS0_Pfiiiff_param_2, - .param .u32 _Z12wmma_exampleP6__halfS0_Pfiiiff_param_3, - .param .u32 _Z12wmma_exampleP6__halfS0_Pfiiiff_param_4, - .param .u32 _Z12wmma_exampleP6__halfS0_Pfiiiff_param_5, - .param .f32 _Z12wmma_exampleP6__halfS0_Pfiiiff_param_6, - .param .f32 _Z12wmma_exampleP6__halfS0_Pfiiiff_param_7 -) -{ - .local .align 8 .b8 __local_depot0[8]; - .reg .b64 %SP; - .reg .b64 %SPL; - .reg .pred %p<6>; - .reg .f32 %f<34>; - .reg .b32 %r<38>; - .reg .b64 %rd<18>; - - - mov.u64 %rd17, __local_depot0; - cvta.local.u64 %SP, %rd17; - ld.param.u64 %rd1, [_Z12wmma_exampleP6__halfS0_Pfiiiff_param_0]; - ld.param.u64 %rd2, [_Z12wmma_exampleP6__halfS0_Pfiiiff_param_1]; - ld.param.u64 %rd3, [_Z12wmma_exampleP6__halfS0_Pfiiiff_param_2]; - ld.param.u32 %r4, [_Z12wmma_exampleP6__halfS0_Pfiiiff_param_3]; - ld.param.u32 %r7, [_Z12wmma_exampleP6__halfS0_Pfiiiff_param_4]; - ld.param.u32 %r5, [_Z12wmma_exampleP6__halfS0_Pfiiiff_param_5]; - // inline asm - mov.u32 %r6, %clock; - // inline asm - mov.u32 %r8, %ntid.x; - mov.u32 %r9, %ctaid.x; - mov.u32 %r10, %tid.x; - mad.lo.s32 %r11, %r8, %r9, %r10; - mov.u32 %r12, WARP_SZ; - div.u32 %r13, %r11, %r12; - mov.u32 %r14, %ntid.y; - mov.u32 %r15, %ctaid.y; - mov.u32 %r16, %tid.y; - mad.lo.s32 %r17, %r14, %r15, %r16; - shl.b32 %r2, %r13, 4; - shl.b32 %r3, %r17, 4; - setp.lt.s32 %p1, %r2, %r4; - setp.gt.s32 %p2, %r5, 0; - and.pred %p3, %p1, %p2; - setp.lt.s32 %p4, %r3, %r7; - and.pred %p5, %p3, %p4; - mov.f32 %f26, 0f00000000; - mov.f32 %f27, %f26; - mov.f32 %f28, %f26; - mov.f32 %f29, %f26; - mov.f32 %f30, %f26; - mov.f32 %f31, %f26; - mov.f32 %f32, %f26; - mov.f32 %f33, %f26; - @!%p5 bra BB0_2; - bra.uni BB0_1; - -BB0_1: - mul.wide.s32 %rd4, %r2, 2; - add.s64 %rd5, %rd1, %rd4; - wmma.load.a.sync.row.m16n16k16.f16 {%r18, %r19, %r20, %r21, %r22, %r23, %r24, %r25}, [%rd5], %r4; - mul.wide.s32 %rd6, %r3, 2; - add.s64 %rd7, %rd2, %rd6; - wmma.load.b.sync.col.m16n16k16.f16 {%r26, %r27, %r28, %r29, %r30, %r31, %r32, %r33}, [%rd7], %r5; - mov.f32 %f25, 0f00000000; - wmma.mma.sync.row.col.m16n16k16.f32.f32 {%f33, %f32, %f31, %f30, %f29, %f28, %f27, %f26}, {%r18, %r19, %r20, %r21, %r22, %r23, %r24, %r25}, {%r26, %r27, %r28, %r29, %r30, %r31, %r32, %r33}, {%f25, %f25, %f25, %f25, %f25, %f25, %f25, %f25}; - -BB0_2: - add.u64 %rd8, %SP, 0; - cvta.to.local.u64 %rd9, %rd8; - mul.lo.s32 %r35, %r3, %r4; - cvt.s64.s32 %rd10, %r35; - cvt.s64.s32 %rd11, %r2; - add.s64 %rd12, %rd10, %rd11; - shl.b64 %rd13, %rd12, 2; - add.s64 %rd14, %rd3, %rd13; - wmma.store.d.sync.col.m16n16k16.f32 [%rd14], {%f33, %f32, %f31, %f30, %f29, %f28, %f27, %f26}, %r4; - // inline asm - mov.u32 %r34, %clock; - // inline asm - sub.s32 %r36, %r34, %r6; - st.local.u32 [%rd9], %r36; - mov.u64 %rd15, $str; - cvta.global.u64 %rd16, %rd15; - // Callseq Start 0 - { - .reg .b32 temp_param_reg; - // <end>} - .param .b64 param0; - st.param.b64 [param0+0], %rd16; - .param .b64 param1; - st.param.b64 [param1+0], %rd8; - .param .b32 retval0; - call.uni (retval0), - vprintf, - ( - param0, - param1 - ); - ld.param.b32 %r37, [retval0+0]; - - //{ - }// Callseq End 0 - ret; -} - - // .globl _Z17convertFp32ToFp16P6__halfPfi -.visible .entry _Z17convertFp32ToFp16P6__halfPfi( - .param .u64 _Z17convertFp32ToFp16P6__halfPfi_param_0, - .param .u64 _Z17convertFp32ToFp16P6__halfPfi_param_1, - .param .u32 _Z17convertFp32ToFp16P6__halfPfi_param_2 -) -{ - .reg .pred %p<2>; - .reg .b16 %rs<2>; - .reg .f32 %f<2>; - .reg .b32 %r<6>; - .reg .b64 %rd<9>; - - - ld.param.u64 %rd1, [_Z17convertFp32ToFp16P6__halfPfi_param_0]; - ld.param.u64 %rd2, [_Z17convertFp32ToFp16P6__halfPfi_param_1]; - ld.param.u32 %r2, [_Z17convertFp32ToFp16P6__halfPfi_param_2]; - mov.u32 %r3, %ntid.x; - mov.u32 %r4, %ctaid.x; - mov.u32 %r5, %tid.x; - mad.lo.s32 %r1, %r4, %r3, %r5; - setp.ge.s32 %p1, %r1, %r2; - @%p1 bra BB1_2; - - cvta.to.global.u64 %rd3, %rd2; - mul.wide.s32 %rd4, %r1, 4; - add.s64 %rd5, %rd3, %rd4; - ld.global.f32 %f1, [%rd5]; - // inline asm - { cvt.rn.f16.f32 %rs1, %f1;} - - // inline asm - cvta.to.global.u64 %rd6, %rd1; - mul.wide.s32 %rd7, %r1, 2; - add.s64 %rd8, %rd6, %rd7; - st.global.u16 [%rd8], %rs1; - -BB1_2: - ret; -} - - diff --git a/cuda-kernels/tensorcore_layout_fp16_fp16.cu b/cuda-kernels/tensorcore_layout_fp16_fp16.cu deleted file mode 100644 index c90874a..0000000 --- a/cuda-kernels/tensorcore_layout_fp16_fp16.cu +++ /dev/null @@ -1,892 +0,0 @@ -#include <stdio.h> -#include <curand.h> -#include <stdlib.h> -// Define some error checking macros. -#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); } -void cudaErrCheck_(cudaError_t stat, const char *file, int line) { - if (stat != cudaSuccess) { - fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line); - } -} - -#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); } -void curandErrCheck_(curandStatus_t stat, const char *file, int line) { - if (stat != CURAND_STATUS_SUCCESS) { - fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line); - } -} - -#include <mma.h> -using namespace nvcuda; - -// Must be multiples of 16 for wmma code to work -#define MATRIX_M (16) -#define MATRIX_N (16) -#define MATRIX_K (16) - - -// The only dimensions currently supported by WMMA -const int WMMA_M = 16; -const int WMMA_N = 16; -const int WMMA_K = 16; - -//wmma_example_dLayout_cLayout_bLayout_aLayout - -__global__ void wmma_example_col_col_col_col(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_col_col_row(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_col_row_col(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_col_row_row(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_row_col_col(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_row_col_row(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_row_row_col(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_row_row_row(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_row_col_col_col(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_col_col_row(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_col_row_col(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_col_row_row(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_row_col_col(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_row_col_row(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_row_row_col(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_row_row_row(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major); -} - -__global__ void convertFp32ToFp16 (half *out, float *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} -__global__ void convertFp16ToFp32 (float *out, half *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} - -int main(int argc, char* argv[]) { - float *a_fp32; - float *b_fp32; - float *c_fp32; - float *d_fp32; - - half *a_fp16; - half *b_fp16; - half *c_fp16; - half *d_fp16; - - float *a_host_wmma; - float *b_host_wmma; - float *c_host_wmma; - float *d_host_wmma; - float *d_cal_host_wmma; - - cudaEvent_t startWMMA; - cudaEvent_t stopWMMA; - - float wmmaTime; - - cudaErrCheck(cudaEventCreate(&startWMMA)); - cudaErrCheck(cudaEventCreate(&stopWMMA)); - - // Use tensor cores - cudaErrCheck(cudaMalloc((void**)&a_fp32, MATRIX_M * MATRIX_K * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&b_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&c_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&d_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&a_fp16, MATRIX_M * MATRIX_K * sizeof(half))); - cudaErrCheck(cudaMalloc((void**)&b_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - cudaErrCheck(cudaMalloc((void**)&c_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - cudaErrCheck(cudaMalloc((void**)&d_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - - - a_host_wmma = (float*)malloc(MATRIX_M * MATRIX_K * sizeof(float)); - b_host_wmma = (float*)malloc(MATRIX_K * MATRIX_N * sizeof(float)); - c_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - d_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - d_cal_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - - printf("a_fp32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_K;n++){ - a_host_wmma[m*MATRIX_K+n]=((rand()%9)/3.0); - printf("%f ",a_host_wmma[m*MATRIX_K+n]); - } - printf(";\n"); - } - - printf("b_fp32\n"); - for(int m=0;m<MATRIX_K;m++){ - for(int n=0;n<MATRIX_N;n++){ - b_host_wmma[m*MATRIX_N+n]=((rand()%9)/3.0); - printf("%f ",b_host_wmma[m*MATRIX_N+n]); - } - printf(";\n"); - } - - printf("c_fp32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - c_host_wmma[m*MATRIX_N+n]=((rand()%9)/3.0); - d_cal_host_wmma[m*MATRIX_N+n]=0; - printf("%f ",c_host_wmma[m*MATRIX_N+n]); - } - printf(";\n"); - } - - - cudaErrCheck(cudaMemcpy(a_fp32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(float), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(b_fp32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(c_fp32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice)); - - convertFp32ToFp16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_fp16, a_fp32, MATRIX_M * MATRIX_K); - convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N); - convertFp32ToFp16 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (c_fp16, c_fp32, MATRIX_K * MATRIX_N); - - printf("\nM = %d, N = %d, K = %d. \n", MATRIX_M, MATRIX_N, MATRIX_K); - - int suc=1; - printf("Running with wmma...\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_col_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:1 took %fms\n", wmmaTime); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m]; - } - } - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_COL_COL_COL_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_col_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:2 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_COL_COL_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_col_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:3 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_COL_ROW_COL_COMPLETED_SUCCESSFULLY\n"); - - - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_col_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:4 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_COL_ROW_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_row_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:5 took %fms\n", wmmaTime); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_ROW_COL_COL_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_row_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:6 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_ROW_COL_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_row_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:7 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_ROW_ROW_COL_COMPLETED_SUCCESSFULLY\n"); - - - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_row_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:8 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_ROW_ROW_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_col_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:9 took %fms\n", wmmaTime); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m]; - } - } - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_COL_COL_COL_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_col_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:10 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_COL_COL_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_col_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:11 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_COL_ROW_COL_COMPLETED_SUCCESSFULLY\n"); - - - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_col_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:12 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_COL_ROW_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_row_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:13 took %fms\n", wmmaTime); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_ROW_COL_COL_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_row_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:14 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_ROW_COL_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_row_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:15 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_ROW_ROW_COL_COMPLETED_SUCCESSFULLY\n"); - - - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_row_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:16 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_ROW_ROW_ROW_COMPLETED_SUCCESSFULLY\n"); - - - - cudaErrCheck(cudaEventDestroy(startWMMA)); - cudaErrCheck(cudaEventDestroy(stopWMMA)); - - cudaErrCheck(cudaFree(a_fp32)); - cudaErrCheck(cudaFree(b_fp32)); - cudaErrCheck(cudaFree(c_fp32)); - cudaErrCheck(cudaFree(d_fp32)); - cudaErrCheck(cudaFree(a_fp16)); - cudaErrCheck(cudaFree(b_fp16)); - cudaErrCheck(cudaFree(c_fp16)); - cudaErrCheck(cudaFree(d_fp16)); - - free(a_host_wmma); - free(b_host_wmma); - free(c_host_wmma); - free(d_host_wmma); - cudaErrCheck(cudaDeviceReset()); - return 0; -} - - diff --git a/cuda-kernels/tensorcore_layout_fp16_fp32.cu b/cuda-kernels/tensorcore_layout_fp16_fp32.cu deleted file mode 100644 index cd0bdf7..0000000 --- a/cuda-kernels/tensorcore_layout_fp16_fp32.cu +++ /dev/null @@ -1,892 +0,0 @@ -#include <stdio.h> -#include <curand.h> -#include <stdlib.h> -// Define some error checking macros. -#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); } -void cudaErrCheck_(cudaError_t stat, const char *file, int line) { - if (stat != cudaSuccess) { - fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line); - } -} - -#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); } -void curandErrCheck_(curandStatus_t stat, const char *file, int line) { - if (stat != CURAND_STATUS_SUCCESS) { - fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line); - } -} - -#include <mma.h> -using namespace nvcuda; - -// Must be multiples of 16 for wmma code to work -#define MATRIX_M (16) -#define MATRIX_N (16) -#define MATRIX_K (16) - - -// The only dimensions currently supported by WMMA -const int WMMA_M = 16; -const int WMMA_N = 16; -const int WMMA_K = 16; - -//wmma_example_dLayout_cLayout_bLayout_aLayout - -__global__ void wmma_example_col_col_col_col(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(d_frag,a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_col_col_row(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(d_frag,a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_col_row_col(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(d_frag,a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_col_row_row(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(d_frag,a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_row_col_col(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(d_frag,a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_row_col_row(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(d_frag,a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_row_row_col(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(d_frag,a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_row_row_row(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(d_frag,a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_row_col_col_col(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(d_frag,a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_col_col_row(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(d_frag,a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_col_row_col(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(d_frag,a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_col_row_row(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(d_frag,a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_row_col_col(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(d_frag,a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_row_col_row(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(d_frag,a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_row_row_col(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(d_frag,a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_row_row_row(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(d_frag,a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_row_major); -} - -__global__ void convertFp32ToFp16 (half *out, float *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} -__global__ void convertFp16ToFp32 (float *out, half *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} - -int main(int argc, char* argv[]) { - float *a_fp32; - float *b_fp32; - float *c_fp32; - float *d_fp32; - - half *a_fp16; - half *b_fp16; - half *c_fp16; - half *d_fp16; - - float *a_host_wmma; - float *b_host_wmma; - float *c_host_wmma; - float *d_host_wmma; - float *d_cal_host_wmma; - - cudaEvent_t startWMMA; - cudaEvent_t stopWMMA; - - float wmmaTime; - - cudaErrCheck(cudaEventCreate(&startWMMA)); - cudaErrCheck(cudaEventCreate(&stopWMMA)); - - // Use tensor cores - cudaErrCheck(cudaMalloc((void**)&a_fp32, MATRIX_M * MATRIX_K * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&b_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&c_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&d_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&a_fp16, MATRIX_M * MATRIX_K * sizeof(half))); - cudaErrCheck(cudaMalloc((void**)&b_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - cudaErrCheck(cudaMalloc((void**)&c_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - cudaErrCheck(cudaMalloc((void**)&d_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - - - a_host_wmma = (float*)malloc(MATRIX_M * MATRIX_K * sizeof(float)); - b_host_wmma = (float*)malloc(MATRIX_K * MATRIX_N * sizeof(float)); - c_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - d_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - d_cal_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - - printf("a_fp32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_K;n++){ - a_host_wmma[m*MATRIX_K+n]=((rand()%9)/3.0); - printf("%f ",a_host_wmma[m*MATRIX_K+n]); - } - printf(";\n"); - } - - printf("b_fp32\n"); - for(int m=0;m<MATRIX_K;m++){ - for(int n=0;n<MATRIX_N;n++){ - b_host_wmma[m*MATRIX_N+n]=((rand()%9)/3.0); - printf("%f ",b_host_wmma[m*MATRIX_N+n]); - } - printf(";\n"); - } - - printf("c_fp32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - c_host_wmma[m*MATRIX_N+n]=((rand()%9)/3.0); - d_cal_host_wmma[m*MATRIX_N+n]=0; - printf("%f ",c_host_wmma[m*MATRIX_N+n]); - } - printf(";\n"); - } - - - cudaErrCheck(cudaMemcpy(a_fp32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(float), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(b_fp32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(c_fp32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice)); - - convertFp32ToFp16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_fp16, a_fp32, MATRIX_M * MATRIX_K); - convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N); - convertFp32ToFp16 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (c_fp16, c_fp32, MATRIX_K * MATRIX_N); - - printf("\nM = %d, N = %d, K = %d. \n", MATRIX_M, MATRIX_N, MATRIX_K); - - int suc=1; - printf("Running with wmma...\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_col_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:1 took %fms\n", wmmaTime); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m]; - } - } - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_COL_COL_COL_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_col_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:2 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_COL_COL_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_col_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:3 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_COL_ROW_COL_COMPLETED_SUCCESSFULLY\n"); - - - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_col_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:4 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_COL_ROW_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_row_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:5 took %fms\n", wmmaTime); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_ROW_COL_COL_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_row_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:6 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_ROW_COL_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_row_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:7 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_ROW_ROW_COL_COMPLETED_SUCCESSFULLY\n"); - - - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_row_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:8 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_ROW_ROW_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_col_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:9 took %fms\n", wmmaTime); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m]; - } - } - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_COL_COL_COL_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_col_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:10 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_COL_COL_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_col_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:11 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_COL_ROW_COL_COMPLETED_SUCCESSFULLY\n"); - - - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_col_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:12 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_COL_ROW_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_row_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:13 took %fms\n", wmmaTime); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_ROW_COL_COL_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_row_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:14 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_ROW_COL_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_row_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:15 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_ROW_ROW_COL_COMPLETED_SUCCESSFULLY\n"); - - - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_row_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:16 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_ROW_ROW_COL_COMPLETED_SUCCESSFULLY\n"); - - - - cudaErrCheck(cudaEventDestroy(startWMMA)); - cudaErrCheck(cudaEventDestroy(stopWMMA)); - - cudaErrCheck(cudaFree(a_fp32)); - cudaErrCheck(cudaFree(b_fp32)); - cudaErrCheck(cudaFree(c_fp32)); - cudaErrCheck(cudaFree(d_fp32)); - cudaErrCheck(cudaFree(a_fp16)); - cudaErrCheck(cudaFree(b_fp16)); - cudaErrCheck(cudaFree(c_fp16)); - cudaErrCheck(cudaFree(d_fp16)); - - free(a_host_wmma); - free(b_host_wmma); - free(c_host_wmma); - free(d_host_wmma); - cudaErrCheck(cudaDeviceReset()); - return 0; -} - - diff --git a/cuda-kernels/tensorcore_layout_fp32_fp32.cu b/cuda-kernels/tensorcore_layout_fp32_fp32.cu deleted file mode 100644 index c901387..0000000 --- a/cuda-kernels/tensorcore_layout_fp32_fp32.cu +++ /dev/null @@ -1,876 +0,0 @@ -#include <stdio.h> -#include <curand.h> -#include <stdlib.h> -// Define some error checking macros. -#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); } -void cudaErrCheck_(cudaError_t stat, const char *file, int line) { - if (stat != cudaSuccess) { - fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line); - } -} - -#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); } -void curandErrCheck_(curandStatus_t stat, const char *file, int line) { - if (stat != CURAND_STATUS_SUCCESS) { - fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line); - } -} - -#include <mma.h> -using namespace nvcuda; - -// Must be multiples of 16 for wmma code to work -#define MATRIX_M (16) -#define MATRIX_N (16) -#define MATRIX_K (16) - - -// The only dimensions currently supported by WMMA -const int WMMA_M = 16; -const int WMMA_N = 16; -const int WMMA_K = 16; - -//wmma_example_dLayout_cLayout_bLayout_aLayout - -__global__ void wmma_example_col_col_col_col(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_col_col_row(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_col_row_col(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_col_row_row(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_row_col_col(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_row_col_row(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_row_row_col(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_col_row_row_row(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major); -} -__global__ void wmma_example_row_col_col_col(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_col_col_row(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_col_row_col(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_col_row_row(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_row_col_col(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_row_col_row(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_row_row_col(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major); -} -__global__ void wmma_example_row_row_row_row(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) { - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major); -} - -__global__ void convertFp32ToFp16 (half *out, float *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} -__global__ void convertFp16ToFp32 (float *out, half *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} - -int main(int argc, char* argv[]) { - float *a_fp32; - float *b_fp32; - float *c_fp32; - float *d_fp32; - - half *a_fp16; - half *b_fp16; - // half *c_fp16; - // half *d_fp16; - - float *a_host_wmma; - float *b_host_wmma; - float *c_host_wmma; - float *d_host_wmma; - float *d_cal_host_wmma; - - cudaEvent_t startWMMA; - cudaEvent_t stopWMMA; - - float wmmaTime; - - cudaErrCheck(cudaEventCreate(&startWMMA)); - cudaErrCheck(cudaEventCreate(&stopWMMA)); - - // Use tensor cores - cudaErrCheck(cudaMalloc((void**)&a_fp32, MATRIX_M * MATRIX_K * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&b_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&c_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&d_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&a_fp16, MATRIX_M * MATRIX_K * sizeof(half))); - cudaErrCheck(cudaMalloc((void**)&b_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - //cudaErrCheck(cudaMalloc((void**)&c_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - //cudaErrCheck(cudaMalloc((void**)&d_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - - - a_host_wmma = (float*)malloc(MATRIX_M * MATRIX_K * sizeof(float)); - b_host_wmma = (float*)malloc(MATRIX_K * MATRIX_N * sizeof(float)); - c_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - d_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - d_cal_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - - printf("a_fp32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_K;n++){ - a_host_wmma[m*MATRIX_K+n]=((rand()%9)/3.0); - printf("%f ",a_host_wmma[m*MATRIX_K+n]); - } - printf(";\n"); - } - - printf("b_fp32\n"); - for(int m=0;m<MATRIX_K;m++){ - for(int n=0;n<MATRIX_N;n++){ - b_host_wmma[m*MATRIX_N+n]=((rand()%9)/3.0); - printf("%f ",b_host_wmma[m*MATRIX_N+n]); - } - printf(";\n"); - } - - printf("c_fp32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - c_host_wmma[m*MATRIX_N+n]=((rand()%9)/3.0); - d_cal_host_wmma[m*MATRIX_N+n]=0; - printf("%f ",c_host_wmma[m*MATRIX_N+n]); - } - printf(";\n"); - } - - - cudaErrCheck(cudaMemcpy(a_fp32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(float), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(b_fp32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(c_fp32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice)); - - convertFp32ToFp16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_fp16, a_fp32, MATRIX_M * MATRIX_K); - convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N); - //convertFp32ToFp16 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (c_fp16, c_fp32, MATRIX_K * MATRIX_N); - - printf("\nM = %d, N = %d, K = %d. \n", MATRIX_M, MATRIX_N, MATRIX_K); - - int suc=1; - printf("Running with wmma...\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_col_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:1 took %fms\n", wmmaTime); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m]; - } - } - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_COL_COL_COL_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_col_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:2 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_COL_COL_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_col_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:3 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_COL_ROW_COL_COMPLETED_SUCCESSFULLY\n"); - - - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_col_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:4 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_COL_ROW_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_row_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:5 took %fms\n", wmmaTime); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_ROW_COL_COL_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_row_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:6 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_ROW_COL_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_row_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:7 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_ROW_ROW_COL_COMPLETED_SUCCESSFULLY\n"); - - - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_col_row_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:8 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[n*MATRIX_N+m]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_COL_ROW_ROW_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_col_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:9 took %fms\n", wmmaTime); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m]; - } - } - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_COL_COL_COL_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_col_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:10 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_COL_COL_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_col_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:11 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_COL_ROW_COL_COMPLETED_SUCCESSFULLY\n"); - - - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_col_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:12 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_COL_ROW_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_row_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:13 took %fms\n", wmmaTime); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_ROW_COL_COL_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_row_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:14 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_ROW_COL_ROW_COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_row_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:15 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_ROW_ROW_COL_COMPLETED_SUCCESSFULLY\n"); - - - - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example_row_row_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma_kernel:16 took %fms\n", wmmaTime); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - d_cal_host_wmma[m*MATRIX_N+n]=0; - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]); - } - } - } - if(suc==1) - printf("WMMA_CONFIG_ROW_ROW_ROW_COL_COMPLETED_SUCCESSFULLY\n"); - - - - cudaErrCheck(cudaEventDestroy(startWMMA)); - cudaErrCheck(cudaEventDestroy(stopWMMA)); - - cudaErrCheck(cudaFree(a_fp32)); - cudaErrCheck(cudaFree(b_fp32)); - cudaErrCheck(cudaFree(c_fp32)); - cudaErrCheck(cudaFree(d_fp32)); - cudaErrCheck(cudaFree(a_fp16)); - cudaErrCheck(cudaFree(b_fp16)); - //cudaErrCheck(cudaFree(c_fp16)); - //cudaErrCheck(cudaFree(d_fp16)); - - free(a_host_wmma); - free(b_host_wmma); - free(c_host_wmma); - free(d_host_wmma); - cudaErrCheck(cudaDeviceReset()); - return 0; -} - - diff --git a/cuda-kernels/tensorcore_type16_16.cu b/cuda-kernels/tensorcore_type16_16.cu deleted file mode 100644 index 2b93bf5..0000000 --- a/cuda-kernels/tensorcore_type16_16.cu +++ /dev/null @@ -1,217 +0,0 @@ -#include <stdio.h> -#include <curand.h> - -// Define some error checking macros. -#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); } -void cudaErrCheck_(cudaError_t stat, const char *file, int line) { - if (stat != cudaSuccess) { - fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line); - } -} - -#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); } -void curandErrCheck_(curandStatus_t stat, const char *file, int line) { - if (stat != CURAND_STATUS_SUCCESS) { - fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line); - } -} - -#include <mma.h> -using namespace nvcuda; - -// Must be multiples of 16 for wmma code to work -#define MATRIX_M (16) -#define MATRIX_N (16) -#define MATRIX_K (16) - - -// The only dimensions currently supported by WMMA -const int WMMA_M = 16; -const int WMMA_N = 16; -const int WMMA_K = 16; - -__global__ void wmma_example(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) { - //unsigned int start_time=0,end_time=0; - //start_time=clock(); - - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major); - //printf("clock=%d",end_time-start_time); -} - -__global__ void convertFp32ToFp16 (half *out, float *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} -__global__ void convertFp16ToFp32 (float *out, half *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} - -int main(int argc, char* argv[]) { - float *a_fp32; - float *b_fp32; - float *c_fp32; - float *d_fp32; - - half *a_fp16; - half *b_fp16; - half *c_fp16; - half *d_fp16; - - float *a_host_wmma; - float *b_host_wmma; - float *c_host_wmma; - float *d_host_wmma; - float *d_cal_host_wmma; - - cudaEvent_t startWMMA; - cudaEvent_t stopWMMA; - - - cudaErrCheck(cudaEventCreate(&startWMMA)); - cudaErrCheck(cudaEventCreate(&stopWMMA)); - - // Use tensor cores - cudaErrCheck(cudaMalloc((void**)&a_fp32, MATRIX_M * MATRIX_K * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&b_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&c_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&d_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&a_fp16, MATRIX_M * MATRIX_K * sizeof(half))); - cudaErrCheck(cudaMalloc((void**)&b_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - cudaErrCheck(cudaMalloc((void**)&c_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - cudaErrCheck(cudaMalloc((void**)&d_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - - - a_host_wmma = (float*)malloc(MATRIX_M * MATRIX_K * sizeof(float)); - b_host_wmma = (float*)malloc(MATRIX_K * MATRIX_N * sizeof(float)); - c_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - d_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - d_cal_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - - //printf("a_fp32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_K;n++){ - a_host_wmma[m*MATRIX_K+n]=(m*MATRIX_K+n)%10; - // printf("%f ",a_host_wmma[m*MATRIX_K+n]); - } - //printf(";\n"); - } - - //printf("b_fp32\n"); - for(int m=0;m<MATRIX_K;m++){ - for(int n=0;n<MATRIX_N;n++){ - b_host_wmma[m*MATRIX_N+n]=(m*MATRIX_N+n)%10; - // printf("%f ",b_host_wmma[m*MATRIX_N+n]); - } - // printf(";\n"); - } - - //printf("c_fp32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - c_host_wmma[m*MATRIX_N+n]=(m*MATRIX_N+n)%10; - d_cal_host_wmma[m*MATRIX_N+n]=0; - // printf("%f ",c_host_wmma[m*MATRIX_N+n]); - } - } - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - - - cudaErrCheck(cudaMemcpy(a_fp32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(float), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(b_fp32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(c_fp32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice)); - - convertFp32ToFp16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_fp16, a_fp32, MATRIX_M * MATRIX_K); - convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N); - convertFp32ToFp16 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (c_fp16, c_fp32, MATRIX_K * MATRIX_N); - - printf("\nM = %d, N = %d, K = %d. \n", MATRIX_M, MATRIX_N, MATRIX_K); - - printf("Running with wmma...\n"); - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - - convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N); - // Error checking - printf("\nChecking results...\n"); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - - printf("Results verified: cublas and WMMA agree.\n\n"); - float wmmaTime; - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma took %fms\n", wmmaTime); - - cudaErrCheck(cudaEventDestroy(startWMMA)); - cudaErrCheck(cudaEventDestroy(stopWMMA)); - - int t=200000; - while(t-->0); - printf("D_CALCULATED\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%.2f,",d_cal_host_wmma[m*MATRIX_N+n]); - } - printf("\n"); - } - printf("D_WMMA\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%.2f,",d_host_wmma[m*MATRIX_N+n]); - } - printf("\n"); - } - int suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - } - } - } - if(suc==1) - printf("COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaFree(a_fp32)); - cudaErrCheck(cudaFree(b_fp32)); - cudaErrCheck(cudaFree(c_fp32)); - cudaErrCheck(cudaFree(d_fp32)); - cudaErrCheck(cudaFree(a_fp16)); - cudaErrCheck(cudaFree(b_fp16)); - cudaErrCheck(cudaFree(c_fp16)); - cudaErrCheck(cudaFree(d_fp16)); - - free(a_host_wmma); - free(b_host_wmma); - free(c_host_wmma); - free(d_host_wmma); - cudaErrCheck(cudaDeviceReset()); - return 0; -} - - diff --git a/cuda-kernels/tensorcore_type16_32.cu b/cuda-kernels/tensorcore_type16_32.cu deleted file mode 100644 index 9ab86e1..0000000 --- a/cuda-kernels/tensorcore_type16_32.cu +++ /dev/null @@ -1,207 +0,0 @@ -#include <stdio.h> -#include <curand.h> - -// Define some error checking macros. -#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); } -void cudaErrCheck_(cudaError_t stat, const char *file, int line) { - if (stat != cudaSuccess) { - fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line); - } -} - -#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); } -void curandErrCheck_(curandStatus_t stat, const char *file, int line) { - if (stat != CURAND_STATUS_SUCCESS) { - fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line); - } -} - -#include <mma.h> -using namespace nvcuda; - -// Must be multiples of 16 for wmma code to work -#define MATRIX_M (16) -#define MATRIX_N (16) -#define MATRIX_K (16) - - -// The only dimensions currently supported by WMMA -const int WMMA_M = 16; -const int WMMA_N = 16; -const int WMMA_K = 16; - -__global__ void wmma_example(half *a, half *b, float *c,half *d_fp16, int M, int N, int K) { - //unsigned int start_time=0,end_time=0; - //start_time=clock(); - - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> d_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - -// for(int i=0; i < c_frag.num_elements; i++) { -//// c_frag.x[i]=c_frag.x[i]+c_frag.x[i]; -// float temp=c_frag.x[i]; -// printf("THREAD%d:%d: %f \n",threadIdx.x,i,temp ); -// } - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - for(int i=0; i < c_frag.num_elements; i++) { - d_frag.x[i]=c_frag.x[i]; - } - wmma::store_matrix_sync(d_fp16, d_frag, N, wmma::mem_col_major); - //printf("clock=%d",end_time-start_time); -} - -__global__ void convertFp32ToFp16 (half *out, float *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} -__global__ void convertFp16ToFp32 (float *out, half *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} - -int main(int argc, char* argv[]) { - float *a_fp32; - float *b_fp32; - float *c_fp32; - float *d_fp32; - - half *a_fp16; - half *b_fp16; - half *c_fp16; - half *d_fp16; - - float *a_host_wmma; - float *b_host_wmma; - float *c_host_wmma; - float *d_host_wmma; - float *d_cal_host_wmma; - - cudaEvent_t startWMMA; - cudaEvent_t stopWMMA; - - - cudaErrCheck(cudaEventCreate(&startWMMA)); - cudaErrCheck(cudaEventCreate(&stopWMMA)); - - // Use tensor cores - cudaErrCheck(cudaMalloc((void**)&a_fp32, MATRIX_M * MATRIX_K * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&b_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&c_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&d_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&a_fp16, MATRIX_M * MATRIX_K * sizeof(half))); - cudaErrCheck(cudaMalloc((void**)&b_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - cudaErrCheck(cudaMalloc((void**)&c_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - cudaErrCheck(cudaMalloc((void**)&d_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - - - a_host_wmma = (float*)malloc(MATRIX_M * MATRIX_K * sizeof(float)); - b_host_wmma = (float*)malloc(MATRIX_K * MATRIX_N * sizeof(float)); - c_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - d_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - d_cal_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - - //printf("a_fp32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_K;n++){ - a_host_wmma[m*MATRIX_K+n]=(m*MATRIX_K+n)%10; - // printf("%f ",a_host_wmma[m*MATRIX_K+n]); - } - //printf(";\n"); - } - - //printf("b_fp32\n"); - for(int m=0;m<MATRIX_K;m++){ - for(int n=0;n<MATRIX_N;n++){ - b_host_wmma[m*MATRIX_N+n]=(m*MATRIX_N+n)%10; - // printf("%f ",b_host_wmma[m*MATRIX_N+n]); - } - // printf(";\n"); - } - - //printf("c_fp32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - c_host_wmma[m*MATRIX_N+n]=(m*MATRIX_N+n); - d_cal_host_wmma[m*MATRIX_N+n]=0; - // printf("%f ",c_host_wmma[m*MATRIX_N+n]); - } - } - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - - - cudaErrCheck(cudaMemcpy(a_fp32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(float), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(b_fp32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(c_fp32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice)); - - convertFp32ToFp16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_fp16, a_fp32, MATRIX_M * MATRIX_K); - convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N); - - printf("\nM = %d, N = %d, K = %d. \n", MATRIX_M, MATRIX_N, MATRIX_K); - - printf("Running with wmma...\n"); - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - - convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N); - // Error checking - printf("\nChecking results...\n"); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - - printf("Results verified: cublas and WMMA agree.\n\n"); - float wmmaTime; - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma took %fms\n", wmmaTime); - - cudaErrCheck(cudaEventDestroy(startWMMA)); - cudaErrCheck(cudaEventDestroy(stopWMMA)); - int t=600000; - while(t-->0); - - printf("D_WMMA\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%.2f,",d_host_wmma[m*MATRIX_N+n]); - } - printf("\n"); - } - printf("Check the result by executing the kernel on volta\n"); - cudaErrCheck(cudaFree(a_fp32)); - cudaErrCheck(cudaFree(b_fp32)); - cudaErrCheck(cudaFree(c_fp32)); - cudaErrCheck(cudaFree(d_fp32)); - cudaErrCheck(cudaFree(a_fp16)); - cudaErrCheck(cudaFree(b_fp16)); - cudaErrCheck(cudaFree(c_fp16)); - cudaErrCheck(cudaFree(d_fp16)); - - free(a_host_wmma); - free(b_host_wmma); - free(c_host_wmma); - free(d_host_wmma); - cudaErrCheck(cudaDeviceReset()); - return 0; -} - - diff --git a/cuda-kernels/tensorcore_type32_16.cu b/cuda-kernels/tensorcore_type32_16.cu deleted file mode 100644 index c66d8f8..0000000 --- a/cuda-kernels/tensorcore_type32_16.cu +++ /dev/null @@ -1,218 +0,0 @@ -#include <stdio.h> -#include <curand.h> - -// Define some error checking macros. -#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); } -void cudaErrCheck_(cudaError_t stat, const char *file, int line) { - if (stat != cudaSuccess) { - fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line); - } -} - -#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); } -void curandErrCheck_(curandStatus_t stat, const char *file, int line) { - if (stat != CURAND_STATUS_SUCCESS) { - fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line); - } -} - -#include <mma.h> -using namespace nvcuda; - -// Must be multiples of 16 for wmma code to work -#define MATRIX_M (16) -#define MATRIX_N (16) -#define MATRIX_K (16) - - -// The only dimensions currently supported by WMMA -const int WMMA_M = 16; -const int WMMA_N = 16; -const int WMMA_K = 16; - -__global__ void wmma_example(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) { - //unsigned int start_time=0,end_time=0; - //start_time=clock(); - - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(d_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_col_major); - //printf("clock=%d",end_time-start_time); -} - -__global__ void convertFp32ToFp16 (half *out, float *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} -__global__ void convertFp16ToFp32 (float *out, half *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} - -int main(int argc, char* argv[]) { - float *a_fp32; - float *b_fp32; - float *c_fp32; - float *d_fp32; - - half *a_fp16; - half *b_fp16; - half *c_fp16; - half *d_fp16; - - float *a_host_wmma; - float *b_host_wmma; - float *c_host_wmma; - float *d_host_wmma; - float *d_cal_host_wmma; - - cudaEvent_t startWMMA; - cudaEvent_t stopWMMA; - - - cudaErrCheck(cudaEventCreate(&startWMMA)); - cudaErrCheck(cudaEventCreate(&stopWMMA)); - - // Use tensor cores - cudaErrCheck(cudaMalloc((void**)&a_fp32, MATRIX_M * MATRIX_K * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&b_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&c_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&d_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&a_fp16, MATRIX_M * MATRIX_K * sizeof(half))); - cudaErrCheck(cudaMalloc((void**)&b_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - cudaErrCheck(cudaMalloc((void**)&c_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - cudaErrCheck(cudaMalloc((void**)&d_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - - - a_host_wmma = (float*)malloc(MATRIX_M * MATRIX_K * sizeof(float)); - b_host_wmma = (float*)malloc(MATRIX_K * MATRIX_N * sizeof(float)); - c_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - d_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - d_cal_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - - //printf("a_fp32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_K;n++){ - a_host_wmma[m*MATRIX_K+n]=(m*MATRIX_K+n)%10; - // printf("%f ",a_host_wmma[m*MATRIX_K+n]); - } - //printf(";\n"); - } - - //printf("b_fp32\n"); - for(int m=0;m<MATRIX_K;m++){ - for(int n=0;n<MATRIX_N;n++){ - b_host_wmma[m*MATRIX_N+n]=(m*MATRIX_N+n)%10; - // printf("%f ",b_host_wmma[m*MATRIX_N+n]); - } - // printf(";\n"); - } - - //printf("c_fp32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - c_host_wmma[m*MATRIX_N+n]=(m*MATRIX_N+n)%10; - d_cal_host_wmma[m*MATRIX_N+n]=0; - // printf("%f ",c_host_wmma[m*MATRIX_N+n]); - } - } - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - - - cudaErrCheck(cudaMemcpy(a_fp32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(float), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(b_fp32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(c_fp32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice)); - - convertFp32ToFp16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_fp16, a_fp32, MATRIX_M * MATRIX_K); - convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N); - convertFp32ToFp16 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (c_fp16, c_fp32, MATRIX_K * MATRIX_N); - - printf("\nM = %d, N = %d, K = %d. \n", MATRIX_M, MATRIX_N, MATRIX_K); - - printf("Running with wmma...\n"); - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - - //convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N); - // Error checking - printf("\nChecking results...\n"); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - - printf("Results verified: cublas and WMMA agree.\n\n"); - float wmmaTime; - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma took %fms\n", wmmaTime); - - cudaErrCheck(cudaEventDestroy(startWMMA)); - cudaErrCheck(cudaEventDestroy(stopWMMA)); - - int t=600000; - while(t-->0); - printf("D_CALCULATED\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%.2f,",d_cal_host_wmma[m*MATRIX_N+n]); - } - printf("\n"); - } - printf("D_WMMA\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%.2f,",d_host_wmma[m*MATRIX_N+n]); - } - printf("\n"); - } - int suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - } - } - } - if(suc==1) - printf("COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaFree(a_fp32)); - cudaErrCheck(cudaFree(b_fp32)); - cudaErrCheck(cudaFree(c_fp32)); - cudaErrCheck(cudaFree(d_fp32)); - cudaErrCheck(cudaFree(a_fp16)); - cudaErrCheck(cudaFree(b_fp16)); - cudaErrCheck(cudaFree(c_fp16)); - cudaErrCheck(cudaFree(d_fp16)); - - free(a_host_wmma); - free(b_host_wmma); - free(c_host_wmma); - free(d_host_wmma); - cudaErrCheck(cudaDeviceReset()); - return 0; -} - - diff --git a/cuda-kernels/tensorcore_type32_32.cu b/cuda-kernels/tensorcore_type32_32.cu deleted file mode 100644 index 73386f9..0000000 --- a/cuda-kernels/tensorcore_type32_32.cu +++ /dev/null @@ -1,217 +0,0 @@ -#include <stdio.h> -#include <curand.h> - -// Define some error checking macros. -#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); } -void cudaErrCheck_(cudaError_t stat, const char *file, int line) { - if (stat != cudaSuccess) { - fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line); - } -} - -#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); } -void curandErrCheck_(curandStatus_t stat, const char *file, int line) { - if (stat != CURAND_STATUS_SUCCESS) { - fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line); - } -} - -#include <mma.h> -using namespace nvcuda; - -// Must be multiples of 16 for wmma code to work -#define MATRIX_M (16) -#define MATRIX_N (16) -#define MATRIX_K (16) - - -// The only dimensions currently supported by WMMA -const int WMMA_M = 16; -const int WMMA_N = 16; -const int WMMA_K = 16; - -__global__ void wmma_example(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) { - //unsigned int start_time=0,end_time=0; - //start_time=clock(); - - // Declare the fragments - wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag; - wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag; - wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag; - - // Bounds checking - wmma::load_matrix_sync(a_frag, a, K); - wmma::load_matrix_sync(b_frag, b, K); - wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major); - wmma::mma_sync(c_frag, a_frag, b_frag, c_frag); - - wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major); - //printf("clock=%d",end_time-start_time); -} - -__global__ void convertFp32ToFp16 (half *out, float *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} -__global__ void convertFp16ToFp32 (float *out, half *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} - -int main(int argc, char* argv[]) { - float *a_fp32; - float *b_fp32; - float *c_fp32; - float *d_fp32; - - half *a_fp16; - half *b_fp16; - // half *c_fp16; - // half *d_fp16; - - float *a_host_wmma; - float *b_host_wmma; - float *c_host_wmma; - float *d_host_wmma; - float *d_cal_host_wmma; - - cudaEvent_t startWMMA; - cudaEvent_t stopWMMA; - - - cudaErrCheck(cudaEventCreate(&startWMMA)); - cudaErrCheck(cudaEventCreate(&stopWMMA)); - - // Use tensor cores - cudaErrCheck(cudaMalloc((void**)&a_fp32, MATRIX_M * MATRIX_K * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&b_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&c_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&d_fp32, MATRIX_K * MATRIX_N * sizeof(float))); - cudaErrCheck(cudaMalloc((void**)&a_fp16, MATRIX_M * MATRIX_K * sizeof(half))); - cudaErrCheck(cudaMalloc((void**)&b_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - //cudaErrCheck(cudaMalloc((void**)&c_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - //cudaErrCheck(cudaMalloc((void**)&d_fp16, MATRIX_K * MATRIX_N * sizeof(half))); - - - a_host_wmma = (float*)malloc(MATRIX_M * MATRIX_K * sizeof(float)); - b_host_wmma = (float*)malloc(MATRIX_K * MATRIX_N * sizeof(float)); - c_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - d_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - d_cal_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float)); - - //printf("a_fp32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_K;n++){ - a_host_wmma[m*MATRIX_K+n]=(m*MATRIX_K+n)%10; - // printf("%f ",a_host_wmma[m*MATRIX_K+n]); - } - //printf(";\n"); - } - - //printf("b_fp32\n"); - for(int m=0;m<MATRIX_K;m++){ - for(int n=0;n<MATRIX_N;n++){ - b_host_wmma[m*MATRIX_N+n]=(m*MATRIX_N+n)%10; - // printf("%f ",b_host_wmma[m*MATRIX_N+n]); - } - // printf(";\n"); - } - - //printf("c_fp32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - c_host_wmma[m*MATRIX_N+n]=(m*MATRIX_N+n)%10; - d_cal_host_wmma[m*MATRIX_N+n]=0; - // printf("%f ",c_host_wmma[m*MATRIX_N+n]); - } - } - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - - - cudaErrCheck(cudaMemcpy(a_fp32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(float), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(b_fp32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(c_fp32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice)); - - convertFp32ToFp16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_fp16, a_fp32, MATRIX_M * MATRIX_K); - convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N); - //convertFp32ToFp16 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (c_fp16, c_fp32, MATRIX_K * MATRIX_N); - - printf("\nM = %d, N = %d, K = %d. \n", MATRIX_M, MATRIX_N, MATRIX_K); - - printf("Running with wmma...\n"); - cudaErrCheck(cudaEventRecord(startWMMA)); - wmma_example <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - - // Error checking - printf("\nChecking results...\n"); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - - printf("Results verified: cublas and WMMA agree.\n\n"); - float wmmaTime; - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma took %fms\n", wmmaTime); - - cudaErrCheck(cudaEventDestroy(startWMMA)); - cudaErrCheck(cudaEventDestroy(stopWMMA)); - - int t=200000; - while(t-->0); - printf("D_CALCULATED\n"); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%.2f,",d_cal_host_wmma[m*MATRIX_N+n]); - } - printf("\n"); - } - printf("D_WMMA\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%.2f,",d_host_wmma[m*MATRIX_N+n]); - } - printf("\n"); - } - int suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1) - { - printf("ERROR:\n"); - suc=0; - } - } - } - if(suc==1) - printf("COMPLETED_SUCCESSFULLY\n"); - - cudaErrCheck(cudaFree(a_fp32)); - cudaErrCheck(cudaFree(b_fp32)); - cudaErrCheck(cudaFree(c_fp32)); - cudaErrCheck(cudaFree(d_fp32)); - cudaErrCheck(cudaFree(a_fp16)); - cudaErrCheck(cudaFree(b_fp16)); - //cudaErrCheck(cudaFree(c_fp16)); - //cudaErrCheck(cudaFree(d_fp16)); - - free(a_host_wmma); - free(b_host_wmma); - free(c_host_wmma); - free(d_host_wmma); - cudaErrCheck(cudaDeviceReset()); - return 0; -} - - diff --git a/cuda-kernels/v16p_genericMatrixMultiply.cu b/cuda-kernels/v16p_genericMatrixMultiply.cu deleted file mode 100644 index 284bd7e..0000000 --- a/cuda-kernels/v16p_genericMatrixMultiply.cu +++ /dev/null @@ -1,388 +0,0 @@ -#include <stdio.h> -#include <curand.h> -#include <stdlib.h> - -// Define some error checking macros. -#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); } -void cudaErrCheck_(cudaError_t stat, const char *file, int line) { - if (stat != cudaSuccess) { - fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line); - } -} - -#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); } -void curandErrCheck_(curandStatus_t stat, const char *file, int line) { - if (stat != CURAND_STATUS_SUCCESS) { - fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line); - } -} - -#include <mma.h> -using namespace nvcuda; - -// Must be multiples of 16 for wmma code to work -#define MATRIX_M (SIZE) -#define MATRIX_N (SIZE) -#define MATRIX_K (SIZE) - - -// The only dimensions currently supported by WMMA -const int WMMA_M = 16; -const int WMMA_N = 16; -const int WMMA_K = 16; - - - -__global__ void vp_example(int *a, int *b, int *c, int M, int N, int K ) { - // Leading dimensions. Packed with no transpositions. - int lda = M; - int ldb = K; - int ldc = M; - - // Tile using a 2D grid - int warpM = (blockIdx.x * blockDim.x + threadIdx.x) / warpSize; - int warpN = (blockIdx.y * blockDim.y + threadIdx.y); - - // Declare the fragments - int a_frag[8]; - int b_frag[8]; - int c_frag[8]; - int acc_frag[8]; - - acc_frag[0]=0; - acc_frag[1]=0; - acc_frag[2]=0; - acc_frag[3]=0; - acc_frag[4]=0; - acc_frag[5]=0; - acc_frag[6]=0; - acc_frag[7]=0; - - // Loop over k - for (int i = 0; i < K; i += WMMA_K) { - int aRow = warpM * WMMA_M; - int aCol = i; - - int bRow = i; - int bCol = warpN * WMMA_N; - - // Bounds checking - if (aRow < M && aCol < K && bRow < K && bCol < N) { - // Load the inputs - // vp::load_matrix_sync(a_frag, a + aRow * lda+ aCol , lda); - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.load.a.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" : - "=r"(a_frag[0]), "=r"(a_frag[1]),"=r"(a_frag[2]),"=r"(a_frag[3]), - "=r"(a_frag[4]),"=r"(a_frag[5]),"=r"(a_frag[6]),"=r"(a_frag[7]): - "l"(a+aRow*lda+aCol),"r"(lda) - ); - asm("CPTX_END"); - asm("*/"); - //vp::load_matrix_sync(b_frag, b + bRow * ldb+ bCol , ldb); - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.load.b16.sync.row.m16n16k16.s32 {%0,%1,%2,%3},[%4],%5;" : - "=r"(b_frag[0]),"=r"(b_frag[1]),"=r"(b_frag[2]),"=r"(b_frag[3]): - "l"(b+bRow*ldb/2+bCol/2),"r"(ldb)//NOTE pointer arithematic is happenning over here so be extracareful - ); - asm("CPTX_END"); - asm("*/"); - - // Perform the matrix multiplication - //vp::mma_sync(acc_frag, a_frag, b_frag, acc_frag); - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.mma16.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16, %17, %18, %19}, { %20, %21, %22, %23, %24, %25, %26,%27};" : - "=r"(acc_frag[0]), "=r"(acc_frag[1]),"=r"(acc_frag[2]),"=r"(acc_frag[3]), - "=r"(acc_frag[4]),"=r"(acc_frag[5]),"=r"(acc_frag[6]),"=r"(acc_frag[7]): - "r"(a_frag[0]),"r"(a_frag[1]),"r"(a_frag[2]),"r"(a_frag[3]), - "r"(a_frag[4]),"r"(a_frag[5]),"r"(a_frag[6]),"r"(a_frag[7]), - "r"(b_frag[0]),"r"(b_frag[1]),"r"(b_frag[2]),"r"(b_frag[3]), - "r"(acc_frag[0]),"r"(acc_frag[1]),"r"(acc_frag[2]),"r"(acc_frag[3]), - "r"(acc_frag[4]),"r"(acc_frag[5]),"r"(acc_frag[6]),"r"(acc_frag[7]) - ); - asm("CPTX_END"); - asm("*/"); - - } - } - - // Load in the current value of c, scale it by beta, and add this our result scaled by alpha - int cRow = warpM * WMMA_M; - int cCol = warpN * WMMA_N; - - if (cRow < M && cCol < N) { - //vp::load_matrix_sync(c_frag, c + cRow*ldc + cCol , ldc, wmma::mem_row_major); - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.load.c.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" : - "=r"(c_frag[0]), "=r"(c_frag[1]),"=r"(c_frag[2]),"=r"(c_frag[3]), - "=r"(c_frag[4]),"=r"(c_frag[5]),"=r"(c_frag[6]),"=r"(c_frag[7]): - "l"(c+cRow*ldc+cCol),"r"(ldc) - ); - asm("CPTX_END"); - asm("*/"); - - - for(int i=0; i < 8; i++) { - c_frag[i] = acc_frag[i] + c_frag[i]; - } - - // Store the output - //vp::store_matrix_sync(c + cRow *ldc + cCol , c_frag, ldc, wmma::mem_row_major); - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.store.d.sync.row.m16n16k16.s32 [%0], {%1,%2,%3,%4,%5,%6,%7,%8},%9;" : - :"l"(c+cRow*ldc+cCol), - "r"(c_frag[0]), "r"(c_frag[1]),"r"(c_frag[2]),"r"(c_frag[3]), - "r"(c_frag[4]),"r"(c_frag[5]),"r"(c_frag[6]),"r"(c_frag[7]), - "r"(ldc) - ); - asm("CPTX_END"); - asm("*/"); - } -} - -__global__ void convertFp32ToFp16 (half *out, float *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} -__global__ void convertFp16ToFp32 (float *out, half *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} - -__global__ void convertInt32ToInt4 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n/8) { - out[idx] =(in[8*idx]&0xf)|(in[8*idx+1]&0xf)<<4|(in[8*idx+2]&0xf)<<8|(in[8*idx+3]&0xf)<<12| - (in[8*idx+4]&0xf)<<16|(in[8*idx+5]&0xf)<<20|(in[8*idx+6]&0xf)<<24|(in[8*idx+7]&0xf)<<28; - } -} -__global__ void convertInt32ToInt8 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n/4) { - out[idx] =(in[4*idx]&0xff)|(in[4*idx+1]&0xff)<<8|(in[4*idx+2]&0xff)<<16|(in[4*idx+3]&0xff)<<24; - } -} -__global__ void convertInt32ToInt16 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n/2) { - out[idx] =(in[2*idx]&0xffff)|(in[2*idx+1]&0xffff)<<16; - } -} - -__global__ void convertInt4ToInt32 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - int shft_amt=4*(idx%8); - int shft_mask=0xf<<shft_amt; - if (idx < n) { - out[idx]= (in[idx/8]&shft_mask)>>shft_amt; - } -} -__global__ void convertInt8ToInt32 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - int shft_amt=8*(idx%4); - int shft_mask=0xff<<shft_amt; - if (idx < n) { - out[idx]= (in[idx/4]&shft_mask)>>shft_amt; - } -} -__global__ void convertInt16ToInt32 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - int shft_amt=16*(idx%2); - int shft_mask=0xffff<<shft_amt; - if (idx < n) { - out[idx]= (in[idx/2]&shft_mask)>>shft_amt; - } -} - -int main(int argc, char* argv[]) { - int *a_int32; - int *b_int32; - int *c_int32; - int *d_int32; - - int *a_int4; - int *b_int4; - int *a_int8; - int *b_int8; - int *a_int16; - int *b_int16; - - int *a_host_wmma; - int *b_host_wmma; - int *c_host_wmma; - int *d_host_wmma; - int *d_cal_host_wmma; - - cudaEvent_t startWMMA; - cudaEvent_t stopWMMA; - - srand(time(NULL)); - cudaErrCheck(cudaEventCreate(&startWMMA)); - cudaErrCheck(cudaEventCreate(&stopWMMA)); - - // Use tensor cores - cudaErrCheck(cudaMalloc((void**)&a_int32, MATRIX_M * MATRIX_K * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&b_int32, MATRIX_K * MATRIX_N * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&c_int32, MATRIX_K * MATRIX_N * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&d_int32, MATRIX_K * MATRIX_N * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&a_int4, MATRIX_M * MATRIX_K * sizeof(int)/8)); - cudaErrCheck(cudaMalloc((void**)&b_int4, MATRIX_K * MATRIX_N * sizeof(int)/8)); - cudaErrCheck(cudaMalloc((void**)&a_int8, MATRIX_M * MATRIX_K * sizeof(int)/4)); - cudaErrCheck(cudaMalloc((void**)&b_int8, MATRIX_K * MATRIX_N * sizeof(int)/4)); - cudaErrCheck(cudaMalloc((void**)&a_int16, MATRIX_M * MATRIX_K * sizeof(int)/2)); - cudaErrCheck(cudaMalloc((void**)&b_int16, MATRIX_K * MATRIX_N * sizeof(int)/2)); - - - a_host_wmma = (int *)malloc(MATRIX_M * MATRIX_K * sizeof(int)); - b_host_wmma = (int *)malloc(MATRIX_K * MATRIX_N * sizeof(int)); - c_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int)); - d_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int)); - d_cal_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int)); - - printf("a_int32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_K;n++){ - a_host_wmma[m*MATRIX_K+n]= random()%2; - //a_host_wmma[m*MATRIX_K+n]= m*MATRIX_K+n; - printf("%d ",a_host_wmma[m*MATRIX_K+n]); - } - printf(";\n"); - } - - printf("b_int32\n"); - for(int m=0;m<MATRIX_K;m++){ - for(int n=0;n<MATRIX_N;n++){ - b_host_wmma[m*MATRIX_N+n]= random()%4; - //b_host_wmma[m*MATRIX_N+n]= m*MATRIX_N+n; - printf("%d ",b_host_wmma[m*MATRIX_N+n]); - } - printf(";\n"); - } - - printf("c_int32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - c_host_wmma[m*MATRIX_N+n]= random()%32; - //c_host_wmma[m*MATRIX_N+n]= m*MATRIX_N+n; - d_cal_host_wmma[m*MATRIX_N+n]=0; - printf("%d ",c_host_wmma[m*MATRIX_N+n]); - } - printf(";\n"); - } - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - - - cudaErrCheck(cudaMemcpy(a_int32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(int), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(b_int32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(c_int32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice)); - - #ifdef TEST16 - convertInt32ToInt16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_int16, a_int32, MATRIX_M * MATRIX_K); - convertInt16ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, a_int16, MATRIX_M * MATRIX_K); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost)); - #endif - #ifdef TEST8 - convertInt32ToInt8 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_int8, a_int32, MATRIX_M * MATRIX_K); - convertInt8ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, a_int8, MATRIX_M * MATRIX_K); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost)); - #endif - #ifdef TEST4 - convertInt32ToInt4 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int4, b_int32, MATRIX_M * MATRIX_K); - convertInt4ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, b_int4, MATRIX_M * MATRIX_K); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost)); - #endif - convertInt32ToInt16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int16, b_int32, MATRIX_M * MATRIX_K); - - dim3 gridDim; - dim3 blockDim; - - // blockDim.x must be a multple of warpSize - // 128x4 means we have 16 warps and a block computes a 64x64 output tile - blockDim.x = 64; - blockDim.y = 2; - - gridDim.x = (MATRIX_M + (WMMA_M * blockDim.x / 32 - 1)) / (WMMA_M * blockDim.x / 32); - gridDim.y = (MATRIX_N + WMMA_N * blockDim.y - 1) / (WMMA_N * blockDim.y); - printf("GRID:X=%d,Y=%d\n",gridDim.x,gridDim.y); - printf("BLOCK:X=%d,Y=%d\n",blockDim.x,blockDim.y); - - - printf("Running with wmma...\n"); - cudaErrCheck(cudaEventRecord(startWMMA)); - vp_example <<< gridDim, blockDim >>> (a_int32, b_int16, c_int32, MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - - // Error checking - printf("\nChecking results...\n"); - cudaErrCheck(cudaMemcpy(d_host_wmma, c_int32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - - float wmmaTime; - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma took %fms\n", wmmaTime); - - cudaErrCheck(cudaEventDestroy(startWMMA)); - cudaErrCheck(cudaEventDestroy(stopWMMA)); - - int t=1000000; - while(t-->0); - printf("D_CALCULATED\n"); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%d,",d_cal_host_wmma[m*MATRIX_N+n]); - } - printf("\n"); - } - printf("D_WMMA\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%d,",d_host_wmma[m*MATRIX_N+n]); - } - printf("\n"); - } - int suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])) - { - printf("ERROR:\n"); - suc=0; - } - } - } - if(suc==1) - printf("COMPLETED_SUCCESSFULLY\n"); - - - cudaErrCheck(cudaFree(a_int32)); - cudaErrCheck(cudaFree(b_int32)); - cudaErrCheck(cudaFree(c_int32)); - cudaErrCheck(cudaFree(d_int32)); - cudaErrCheck(cudaFree(a_int8)); - cudaErrCheck(cudaFree(b_int8)); - - free(a_host_wmma); - free(b_host_wmma); - free(c_host_wmma); - free(d_host_wmma); - cudaErrCheck(cudaDeviceReset()); - return 0; -} - - diff --git a/cuda-kernels/v16p_kernel.cu b/cuda-kernels/v16p_kernel.cu deleted file mode 100644 index d84328f..0000000 --- a/cuda-kernels/v16p_kernel.cu +++ /dev/null @@ -1,359 +0,0 @@ -#include <stdio.h> -#include <curand.h> -#include <stdlib.h> - -// Define some error checking macros. -#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); } -void cudaErrCheck_(cudaError_t stat, const char *file, int line) { - if (stat != cudaSuccess) { - fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line); - } -} - -#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); } -void curandErrCheck_(curandStatus_t stat, const char *file, int line) { - if (stat != CURAND_STATUS_SUCCESS) { - fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line); - } -} - -#include <mma.h> -using namespace nvcuda; - -// Must be multiples of 16 for wmma code to work -#define MATRIX_M (16) -#define MATRIX_N (16) -#define MATRIX_K (16) - - -// The only dimensions currently supported by WMMA -const int WMMA_M = 16; -const int WMMA_N = 16; -const int WMMA_K = 16; - -__global__ void v16p_example(int *a_int32, int *b_int4, int *c,int *d_int32, int M, int N, int K) { - - int registers_a[8]; - int registers_b[8]; - int registers_c[8]; - int registers_d[8]; - int register_b; //contains 8 4bit b elements - int idx = blockDim.x * blockIdx.x + threadIdx.x; - - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.load.a.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" : - "=r"(registers_a[0]), "=r"(registers_a[1]),"=r"(registers_a[2]),"=r"(registers_a[3]), - "=r"(registers_a[4]),"=r"(registers_a[5]),"=r"(registers_a[6]),"=r"(registers_a[7]): - "l"(a_int32),"r"(M) - ); - asm("CPTX_END"); - asm("*/"); - - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.load.b16.sync.row.m16n16k16.s32 {%0,%1,%2,%3},[%4],%5;" : - "=r"(registers_b[0]),"=r"(registers_b[1]),"=r"(registers_b[2]),"=r"(registers_b[3]): - "l"(b_int4),"r"(M) - ); - asm("CPTX_END"); - asm("*/"); - - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.load.c.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" : - "=r"(registers_c[0]), "=r"(registers_c[1]),"=r"(registers_c[2]),"=r"(registers_c[3]), - "=r"(registers_c[4]),"=r"(registers_c[5]),"=r"(registers_c[6]),"=r"(registers_c[7]): - "l"(c),"r"(M) - ); - asm("CPTX_END"); - asm("*/"); - //B4 - //asm("/*"); - //asm("CPTX_BEGIN"); - //asm("vp.mma.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16}, {%17, %18, %19, %20, %21, %22, %23, %24};" : - //"=r"(registers_d[0]), "=r"(registers_d[1]),"=r"(registers_d[2]),"=r"(registers_d[3]), - //"=r"(registers_d[4]),"=r"(registers_d[5]),"=r"(registers_d[6]),"=r"(registers_d[7]): - //"r"(registers_a[0]),"r"(registers_a[1]),"r"(registers_a[2]),"r"(registers_a[3]), - //"r"(registers_a[4]),"r"(registers_a[5]),"r"(registers_a[6]),"r"(registers_a[7]), - //"r"(registers_b[0]), - //"r"(registers_c[0]),"r"(registers_c[1]),"r"(registers_c[2]),"r"(registers_c[3]), - //"r"(registers_c[4]),"r"(registers_c[5]),"r"(registers_c[6]),"r"(registers_c[7]) - //); - //asm("CPTX_END"); - //asm("*/"); - - //B8 - //asm("/*"); - //asm("CPTX_BEGIN"); - //asm("vp.mma.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16, %17}, {%18, %19, %20, %21, %22, %23, %24, %25};" : - //"=r"(registers_d[0]), "=r"(registers_d[1]),"=r"(registers_d[2]),"=r"(registers_d[3]), - //"=r"(registers_d[4]),"=r"(registers_d[5]),"=r"(registers_d[6]),"=r"(registers_d[7]): - //"r"(registers_a[0]),"r"(registers_a[1]),"r"(registers_a[2]),"r"(registers_a[3]), - //"r"(registers_a[4]),"r"(registers_a[5]),"r"(registers_a[6]),"r"(registers_a[7]), - //"r"(registers_b[0]),"r"(registers_b[1]), - //"r"(registers_c[0]),"r"(registers_c[1]),"r"(registers_c[2]),"r"(registers_c[3]), - //"r"(registers_c[4]),"r"(registers_c[5]),"r"(registers_c[6]),"r"(registers_c[7]) - //); - //asm("CPTX_END"); - //asm("*/"); - - //B16 - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.mma16.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16, %17, %18, %19}, { %20, %21, %22, %23, %24, %25, %26, %27};" : - "=r"(registers_d[0]), "=r"(registers_d[1]),"=r"(registers_d[2]),"=r"(registers_d[3]), - "=r"(registers_d[4]),"=r"(registers_d[5]),"=r"(registers_d[6]),"=r"(registers_d[7]): - "r"(registers_a[0]),"r"(registers_a[1]),"r"(registers_a[2]),"r"(registers_a[3]), - "r"(registers_a[4]),"r"(registers_a[5]),"r"(registers_a[6]),"r"(registers_a[7]), - "r"(registers_b[0]),"r"(registers_b[1]),"r"(registers_b[2]),"r"(registers_b[3]), - "r"(registers_c[0]),"r"(registers_c[1]),"r"(registers_c[2]),"r"(registers_c[3]), - "r"(registers_c[4]),"r"(registers_c[5]),"r"(registers_c[6]),"r"(registers_c[7]) - ); - asm("CPTX_END"); - asm("*/"); - - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.store.d.sync.row.m16n16k16.s32 [%0], {%1,%2,%3,%4,%5,%6,%7,%8},%9;" : - :"l"(d_int32) - "r"(registers_d[0]), "r"(registers_d[1]),"r"(registers_d[2]),"r"(registers_d[3]), - "r"(registers_d[4]),"r"(registers_d[5]),"r"(registers_d[6]),"r"(registers_d[7]), - "r"(M) - ); - asm("CPTX_END"); - asm("*/"); - //d_int32[0]=registers_d[0]; -} - -__global__ void convertFp32ToFp16 (half *out, float *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} -__global__ void convertFp16ToFp32 (float *out, half *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} - -__global__ void convertInt32ToInt4 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n/8) { - out[idx] =(in[8*idx]&0xf)|(in[8*idx+1]&0xf)<<4|(in[8*idx+2]&0xf)<<8|(in[8*idx+3]&0xf)<<12| - (in[8*idx+4]&0xf)<<16|(in[8*idx+5]&0xf)<<20|(in[8*idx+6]&0xf)<<24|(in[8*idx+7]&0xf)<<28; - } -} -__global__ void convertInt32ToInt8 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n/4) { - out[idx] =(in[4*idx]&0xff)|(in[4*idx+1]&0xff)<<8|(in[4*idx+2]&0xff)<<16|(in[4*idx+3]&0xff)<<24; - } -} -__global__ void convertInt32ToInt16 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n/2) { - out[idx] =(in[2*idx]&0xffff)|(in[2*idx+1]&0xffff)<<16; - } -} - -__global__ void convertInt4ToInt32 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - int shft_amt=4*(idx%8); - int shft_mask=0xf<<shft_amt; - if (idx < n) { - out[idx]= (in[idx/8]&shft_mask)>>shft_amt; - } -} -__global__ void convertInt8ToInt32 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - int shft_amt=8*(idx%4); - int shft_mask=0xff<<shft_amt; - if (idx < n) { - out[idx]= (in[idx/4]&shft_mask)>>shft_amt; - } -} -__global__ void convertInt16ToInt32 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - int shft_amt=16*(idx%2); - int shft_mask=0xffff<<shft_amt; - if (idx < n) { - out[idx]= (in[idx/2]&shft_mask)>>shft_amt; - } -} - -int main(int argc, char* argv[]) { - int *a_int32; - int *b_int32; - int *c_int32; - int *d_int32; - - int *a_int4; - int *b_int4; - int *a_int8; - int *b_int8; - int *a_int16; - int *b_int16; - - int *a_host_wmma; - int *b_host_wmma; - int *c_host_wmma; - int *d_host_wmma; - int *d_cal_host_wmma; - - cudaEvent_t startWMMA; - cudaEvent_t stopWMMA; - - srand(time(NULL)); - cudaErrCheck(cudaEventCreate(&startWMMA)); - cudaErrCheck(cudaEventCreate(&stopWMMA)); - - // Use tensor cores - cudaErrCheck(cudaMalloc((void**)&a_int32, MATRIX_M * MATRIX_K * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&b_int32, MATRIX_K * MATRIX_N * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&c_int32, MATRIX_K * MATRIX_N * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&d_int32, MATRIX_K * MATRIX_N * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&a_int4, MATRIX_M * MATRIX_K * sizeof(int)/8)); - cudaErrCheck(cudaMalloc((void**)&b_int4, MATRIX_K * MATRIX_N * sizeof(int)/8)); - cudaErrCheck(cudaMalloc((void**)&a_int8, MATRIX_M * MATRIX_K * sizeof(int)/4)); - cudaErrCheck(cudaMalloc((void**)&b_int8, MATRIX_K * MATRIX_N * sizeof(int)/4)); - cudaErrCheck(cudaMalloc((void**)&a_int16, MATRIX_M * MATRIX_K * sizeof(int)/2)); - cudaErrCheck(cudaMalloc((void**)&b_int16, MATRIX_K * MATRIX_N * sizeof(int)/2)); - - - a_host_wmma = (int *)malloc(MATRIX_M * MATRIX_K * sizeof(int)); - b_host_wmma = (int *)malloc(MATRIX_K * MATRIX_N * sizeof(int)); - c_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int)); - d_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int)); - d_cal_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int)); - - printf("a_int32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_K;n++){ - a_host_wmma[m*MATRIX_K+n]= random()%5; - printf("%d ",a_host_wmma[m*MATRIX_K+n]); - } - printf(";\n"); - } - - printf("b_int32\n"); - for(int m=0;m<MATRIX_K;m++){ - for(int n=0;n<MATRIX_N;n++){ - b_host_wmma[m*MATRIX_N+n]=random()%32; - printf("%d ",b_host_wmma[m*MATRIX_N+n]); - } - printf(";\n"); - } - - printf("c_int32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - c_host_wmma[m*MATRIX_N+n]=random()%32; - d_cal_host_wmma[m*MATRIX_N+n]=0; - printf("%d ",c_host_wmma[m*MATRIX_N+n]); - } - printf(";\n"); - } - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - - - cudaErrCheck(cudaMemcpy(a_int32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(int), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(b_int32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(c_int32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice)); - #ifdef TEST16 - convertInt32ToInt16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int16, b_int32, MATRIX_M * MATRIX_K); - convertInt16ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, b_int16, MATRIX_M * MATRIX_K); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost)); - #endif - #ifdef TEST8 - convertInt32ToInt8 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int8, b_int32, MATRIX_M * MATRIX_K); - convertInt8ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, b_int8, MATRIX_M * MATRIX_K); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost)); - #endif - #ifdef TEST4 - convertInt32ToInt4 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int4, b_int32, MATRIX_M * MATRIX_K); - convertInt4ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, b_int4, MATRIX_M * MATRIX_K); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost)); - #endif - convertInt32ToInt16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int16, b_int32, MATRIX_M * MATRIX_K); - - //convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N); - //convertFp32ToFp16 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (c_fp16, c_fp32, MATRIX_K * MATRIX_N); - - -//AAMIR printf("\nM = %d, N = %d, K = %d. \n", MATRIX_M, MATRIX_N, MATRIX_K); -//AAMIR -//AAMIR printf("Running with wmma...\n"); - cudaErrCheck(cudaEventRecord(startWMMA)); - v16p_example <<< 1, 32>>> (a_int32, b_int16, c_int32, d_int32, MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - - - // Error checking - printf("\nChecking results...\n"); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - - float wmmaTime; - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma took %fms\n", wmmaTime); - - cudaErrCheck(cudaEventDestroy(startWMMA)); - cudaErrCheck(cudaEventDestroy(stopWMMA)); - - int t=2000000; - while(t-->0); - printf("D_CALCULATED\n"); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%d,",d_cal_host_wmma[m*MATRIX_N+n]); - } - printf("\n"); - } - printf("D_WMMA\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%d,",d_host_wmma[m*MATRIX_N+n]); - } - printf("\n"); - } - int suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])) - { - printf("ERROR:\n"); - suc=0; - } - } - } - if(suc==1) - printf("COMPLETED_SUCCESSFULLY\n"); - - - cudaErrCheck(cudaFree(a_int32)); - cudaErrCheck(cudaFree(b_int32)); - cudaErrCheck(cudaFree(c_int32)); - cudaErrCheck(cudaFree(d_int32)); - cudaErrCheck(cudaFree(a_int8)); - cudaErrCheck(cudaFree(b_int8)); - - free(a_host_wmma); - free(b_host_wmma); - free(c_host_wmma); - free(d_host_wmma); - cudaErrCheck(cudaDeviceReset()); - return 0; -} - - diff --git a/cuda-kernels/v4p_genericMatrixMultiply.cu b/cuda-kernels/v4p_genericMatrixMultiply.cu deleted file mode 100644 index 42283c4..0000000 --- a/cuda-kernels/v4p_genericMatrixMultiply.cu +++ /dev/null @@ -1,387 +0,0 @@ -#include <stdio.h> -#include <curand.h> -#include<stdlib.h> - -// Define some error checking macros. -#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); } -void cudaErrCheck_(cudaError_t stat, const char *file, int line) { - if (stat != cudaSuccess) { - fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line); - } -} - -#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); } -void curandErrCheck_(curandStatus_t stat, const char *file, int line) { - if (stat != CURAND_STATUS_SUCCESS) { - fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line); - } -} - -#include <mma.h> -using namespace nvcuda; - -// Must be multiples of 16 for wmma code to work -#define MATRIX_M (SIZE) -#define MATRIX_N (SIZE) -#define MATRIX_K (SIZE) - - -// The only dimensions currently supported by WMMA -const int WMMA_M = 16; -const int WMMA_N = 16; -const int WMMA_K = 16; - - - -__global__ void vp_example(int *a, int *b, int *c, int M, int N, int K ) { - // Leading dimensions. Packed with no transpositions. - int lda = M; - int ldb = K; - int ldc = M; - - // Tile using a 2D grid - int warpM = (blockIdx.x * blockDim.x + threadIdx.x) / warpSize; - int warpN = (blockIdx.y * blockDim.y + threadIdx.y); - - // Declare the fragments - int a_frag[8]; - int b_frag[8]; - int c_frag[8]; - int acc_frag[8]; - - acc_frag[0]=0; - acc_frag[1]=0; - acc_frag[2]=0; - acc_frag[3]=0; - acc_frag[4]=0; - acc_frag[5]=0; - acc_frag[6]=0; - acc_frag[7]=0; - - // Loop over k - for (int i = 0; i < K; i += WMMA_K) { - int aRow = warpM * WMMA_M; - int aCol = i; - - int bRow = i; - int bCol = warpN * WMMA_N; - - // Bounds checking - if (aRow < M && aCol < K && bRow < K && bCol < N) { - // Load the inputs - // vp::load_matrix_sync(a_frag, a + aRow * lda+ aCol , lda); - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.load.a.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" : - "=r"(a_frag[0]), "=r"(a_frag[1]),"=r"(a_frag[2]),"=r"(a_frag[3]), - "=r"(a_frag[4]),"=r"(a_frag[5]),"=r"(a_frag[6]),"=r"(a_frag[7]): - "l"(a+aRow*lda+aCol),"r"(lda) - ); - asm("CPTX_END"); - asm("*/"); - //vp::load_matrix_sync(b_frag, b + bRow * ldb+ bCol , ldb); - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.load.b4.sync.row.m16n16k16.s32 {%0},[%1],%2;" : - "=r"(b_frag[0]): - "l"(b+bRow*ldb/8+bCol/8),"r"(ldb) - ); - asm("CPTX_END"); - asm("*/"); - - // Perform the matrix multiplication - //vp::mma_sync(acc_frag, a_frag, b_frag, acc_frag); - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.mma4.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16}, {%17, %18, %19, %20, %21, %22, %23, %24};" : - "=r"(acc_frag[0]), "=r"(acc_frag[1]),"=r"(acc_frag[2]),"=r"(acc_frag[3]), - "=r"(acc_frag[4]),"=r"(acc_frag[5]),"=r"(acc_frag[6]),"=r"(acc_frag[7]): - "r"(a_frag[0]),"r"(a_frag[1]),"r"(a_frag[2]),"r"(a_frag[3]), - "r"(a_frag[4]),"r"(a_frag[5]),"r"(a_frag[6]),"r"(a_frag[7]), - "r"(b_frag[0]), - "r"(acc_frag[0]),"r"(acc_frag[1]),"r"(acc_frag[2]),"r"(acc_frag[3]), - "r"(acc_frag[4]),"r"(acc_frag[5]),"r"(acc_frag[6]),"r"(acc_frag[7]) - ); - asm("CPTX_END"); - asm("*/"); - - } - } - - // Load in the current value of c, scale it by beta, and add this our result scaled by alpha - int cRow = warpM * WMMA_M; - int cCol = warpN * WMMA_N; - - if (cRow < M && cCol < N) { - //vp::load_matrix_sync(c_frag, c + cRow*ldc + cCol , ldc, wmma::mem_row_major); - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.load.c.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" : - "=r"(c_frag[0]), "=r"(c_frag[1]),"=r"(c_frag[2]),"=r"(c_frag[3]), - "=r"(c_frag[4]),"=r"(c_frag[5]),"=r"(c_frag[6]),"=r"(c_frag[7]): - "l"(c+cRow*ldc+cCol),"r"(ldc) - ); - asm("CPTX_END"); - asm("*/"); - - - for(int i=0; i < 8; i++) { - c_frag[i] = acc_frag[i] + c_frag[i]; - } - - // Store the output - //vp::store_matrix_sync(c + cRow *ldc + cCol , c_frag, ldc, wmma::mem_row_major); - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.store.d.sync.row.m16n16k16.s32 [%0], {%1,%2,%3,%4,%5,%6,%7,%8},%9;" : - :"l"(c+cRow*ldc+cCol), - "r"(c_frag[0]), "r"(c_frag[1]),"r"(c_frag[2]),"r"(c_frag[3]), - "r"(c_frag[4]),"r"(c_frag[5]),"r"(c_frag[6]),"r"(c_frag[7]), - "r"(ldc) - ); - asm("CPTX_END"); - asm("*/"); - } -} - -__global__ void convertFp32ToFp16 (half *out, float *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} -__global__ void convertFp16ToFp32 (float *out, half *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} - -__global__ void convertInt32ToInt4 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n/8) { - out[idx] =(in[8*idx]&0xf)|(in[8*idx+1]&0xf)<<4|(in[8*idx+2]&0xf)<<8|(in[8*idx+3]&0xf)<<12| - (in[8*idx+4]&0xf)<<16|(in[8*idx+5]&0xf)<<20|(in[8*idx+6]&0xf)<<24|(in[8*idx+7]&0xf)<<28; - } -} -__global__ void convertInt32ToInt8 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n/4) { - out[idx] =(in[4*idx]&0xff)|(in[4*idx+1]&0xff)<<8|(in[4*idx+2]&0xff)<<16|(in[4*idx+3]&0xff)<<24; - } -} -__global__ void convertInt32ToInt16 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n/2) { - out[idx] =(in[2*idx]&0xffff)|(in[2*idx+1]&0xffff)<<16; - } -} - -__global__ void convertInt4ToInt32 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - int shft_amt=4*(idx%8); - int shft_mask=0xf<<shft_amt; - if (idx < n) { - out[idx]= (in[idx/8]&shft_mask)>>shft_amt; - } -} -__global__ void convertInt8ToInt32 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - int shft_amt=8*(idx%4); - int shft_mask=0xff<<shft_amt; - if (idx < n) { - out[idx]= (in[idx/4]&shft_mask)>>shft_amt; - } -} -__global__ void convertInt16ToInt32 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - int shft_amt=16*(idx%2); - int shft_mask=0xffff<<shft_amt; - if (idx < n) { - out[idx]= (in[idx/2]&shft_mask)>>shft_amt; - } -} - -int main(int argc, char* argv[]) { - int *a_int32; - int *b_int32; - int *c_int32; - int *d_int32; - - int *a_int4; - int *b_int4; - int *a_int8; - int *b_int8; - int *a_int16; - int *b_int16; - - int *a_host_wmma; - int *b_host_wmma; - int *c_host_wmma; - int *d_host_wmma; - int *d_cal_host_wmma; - - cudaEvent_t startWMMA; - cudaEvent_t stopWMMA; - - - srand (time(NULL)); - cudaErrCheck(cudaEventCreate(&startWMMA)); - cudaErrCheck(cudaEventCreate(&stopWMMA)); - - // Use tensor cores - cudaErrCheck(cudaMalloc((void**)&a_int32, MATRIX_M * MATRIX_K * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&b_int32, MATRIX_K * MATRIX_N * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&c_int32, MATRIX_K * MATRIX_N * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&d_int32, MATRIX_K * MATRIX_N * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&a_int4, MATRIX_M * MATRIX_K * sizeof(int)/8)); - cudaErrCheck(cudaMalloc((void**)&b_int4, MATRIX_K * MATRIX_N * sizeof(int)/8)); - cudaErrCheck(cudaMalloc((void**)&a_int8, MATRIX_M * MATRIX_K * sizeof(int)/4)); - cudaErrCheck(cudaMalloc((void**)&b_int8, MATRIX_K * MATRIX_N * sizeof(int)/4)); - cudaErrCheck(cudaMalloc((void**)&a_int16, MATRIX_M * MATRIX_K * sizeof(int)/2)); - cudaErrCheck(cudaMalloc((void**)&b_int16, MATRIX_K * MATRIX_N * sizeof(int)/2)); - - - a_host_wmma = (int *)malloc(MATRIX_M * MATRIX_K * sizeof(int)); - b_host_wmma = (int *)malloc(MATRIX_K * MATRIX_N * sizeof(int)); - c_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int)); - d_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int)); - d_cal_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int)); - - printf("a_int32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_K;n++){ - a_host_wmma[m*MATRIX_K+n]= random()%4; - //a_host_wmma[m*MATRIX_K+n]=m*MATRIX_K+n; - printf("%d ",a_host_wmma[m*MATRIX_K+n]); - } - printf(";\n"); - } - - printf("b_int32\n"); - for(int m=0;m<MATRIX_K;m++){ - for(int n=0;n<MATRIX_N;n++){ - b_host_wmma[m*MATRIX_N+n]=random()%2; - printf("%d ",b_host_wmma[m*MATRIX_N+n]); - } - printf(";\n"); - } - - printf("c_int32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - c_host_wmma[m*MATRIX_N+n]= random()%64; - d_cal_host_wmma[m*MATRIX_N+n]=0; - printf("%d ",c_host_wmma[m*MATRIX_N+n]); - } - printf(";\n"); - } - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - - - cudaErrCheck(cudaMemcpy(a_int32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(int), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(b_int32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(c_int32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice)); - - #ifdef TEST16 - convertInt32ToInt16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_int16, a_int32, MATRIX_M * MATRIX_K); - convertInt16ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, a_int16, MATRIX_M * MATRIX_K); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost)); - #endif - #ifdef TEST8 - convertInt32ToInt8 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_int8, a_int32, MATRIX_M * MATRIX_K); - convertInt8ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, a_int8, MATRIX_M * MATRIX_K); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost)); - #endif - #ifdef TEST4 - convertInt32ToInt4 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int4, b_int32, MATRIX_M * MATRIX_K); - convertInt4ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, b_int4, MATRIX_M * MATRIX_K); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost)); - #endif - convertInt32ToInt4 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int4, b_int32, MATRIX_M * MATRIX_K); - - dim3 gridDim; - dim3 blockDim; - - // blockDim.x must be a multple of warpSize - // 128x4 means we have 16 warps and a block computes a 64x64 output tile - blockDim.x = 64; - blockDim.y = 2; - - gridDim.x = (MATRIX_M + (WMMA_M * blockDim.x / 32 - 1)) / (WMMA_M * blockDim.x / 32); - gridDim.y = (MATRIX_N + WMMA_N * blockDim.y - 1) / (WMMA_N * blockDim.y); - printf("GRID:X=%d,Y=%d\n",gridDim.x,gridDim.y); - printf("BLOCK:X=%d,Y=%d\n",blockDim.x,blockDim.y); - - - printf("Running with wmma...\n"); - cudaErrCheck(cudaEventRecord(startWMMA)); - vp_example <<< gridDim, blockDim >>> (a_int32, b_int4, c_int32, MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - - // Error checking - printf("\nChecking results...\n"); - cudaErrCheck(cudaMemcpy(d_host_wmma, c_int32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - - float wmmaTime; - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma took %fms\n", wmmaTime); - - cudaErrCheck(cudaEventDestroy(startWMMA)); - cudaErrCheck(cudaEventDestroy(stopWMMA)); - - int t=1000000; - while(t-->0); - printf("D_CALCULATED\n"); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%d,",d_cal_host_wmma[m*MATRIX_N+n]); - } - printf("\n"); - } - printf("D_WMMA\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%d,",d_host_wmma[m*MATRIX_N+n]); - } - printf("\n"); - } - int suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])) - { - printf("ERROR:\n"); - suc=0; - } - } - } - if(suc==1) - printf("COMPLETED_SUCCESSFULLY\n"); - - - cudaErrCheck(cudaFree(a_int32)); - cudaErrCheck(cudaFree(b_int32)); - cudaErrCheck(cudaFree(c_int32)); - cudaErrCheck(cudaFree(d_int32)); - cudaErrCheck(cudaFree(a_int8)); - cudaErrCheck(cudaFree(b_int8)); - - free(a_host_wmma); - free(b_host_wmma); - free(c_host_wmma); - free(d_host_wmma); - cudaErrCheck(cudaDeviceReset()); - return 0; -} - - diff --git a/cuda-kernels/v4p_kernel.cu b/cuda-kernels/v4p_kernel.cu deleted file mode 100644 index 053c07b..0000000 --- a/cuda-kernels/v4p_kernel.cu +++ /dev/null @@ -1,359 +0,0 @@ -#include <stdio.h> -#include <stdlib.h> -#include <curand.h> - -// Define some error checking macros. -#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); } -void cudaErrCheck_(cudaError_t stat, const char *file, int line) { - if (stat != cudaSuccess) { - fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line); - } -} - -#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); } -void curandErrCheck_(curandStatus_t stat, const char *file, int line) { - if (stat != CURAND_STATUS_SUCCESS) { - fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line); - } -} - -#include <mma.h> -using namespace nvcuda; - -// Must be multiples of 16 for wmma code to work -#define MATRIX_M (16) -#define MATRIX_N (16) -#define MATRIX_K (16) - - -// The only dimensions currently supported by WMMA -const int WMMA_M = 16; -const int WMMA_N = 16; -const int WMMA_K = 16; - -__global__ void v4p_example(int *a_int32, int *b_int4, int *c,int *d_int32, int M, int N, int K) { - - int registers_a[8]; - int registers_b[8]; - int registers_c[8]; - int registers_d[8]; - int register_b; //contains 8 4bit b elements - int idx = blockDim.x * blockIdx.x + threadIdx.x; - - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.load.a.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" : - "=r"(registers_a[0]), "=r"(registers_a[1]),"=r"(registers_a[2]),"=r"(registers_a[3]), - "=r"(registers_a[4]),"=r"(registers_a[5]),"=r"(registers_a[6]),"=r"(registers_a[7]): - "l"(a_int32),"r"(M) - ); - asm("CPTX_END"); - asm("*/"); - - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.load.b4.sync.row.m16n16k16.s32 {%0},[%1],%2;" : - "=r"(registers_b[0]): - "l"(b_int4),"r"(M) - ); - asm("CPTX_END"); - asm("*/"); - - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.load.c.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" : - "=r"(registers_c[0]), "=r"(registers_c[1]),"=r"(registers_c[2]),"=r"(registers_c[3]), - "=r"(registers_c[4]),"=r"(registers_c[5]),"=r"(registers_c[6]),"=r"(registers_c[7]): - "l"(c),"r"(M) - ); - asm("CPTX_END"); - asm("*/"); - //B4 - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.mma4.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16}, {%17, %18, %19, %20, %21, %22, %23, %24};" : - "=r"(registers_d[0]), "=r"(registers_d[1]),"=r"(registers_d[2]),"=r"(registers_d[3]), - "=r"(registers_d[4]),"=r"(registers_d[5]),"=r"(registers_d[6]),"=r"(registers_d[7]): - "r"(registers_a[0]),"r"(registers_a[1]),"r"(registers_a[2]),"r"(registers_a[3]), - "r"(registers_a[4]),"r"(registers_a[5]),"r"(registers_a[6]),"r"(registers_a[7]), - "r"(registers_b[0]), - "r"(registers_c[0]),"r"(registers_c[1]),"r"(registers_c[2]),"r"(registers_c[3]), - "r"(registers_c[4]),"r"(registers_c[5]),"r"(registers_c[6]),"r"(registers_c[7]) - ); - asm("CPTX_END"); - asm("*/"); - - //B8 - //asm("/*"); - //asm("CPTX_BEGIN"); - //asm("vp.mma.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16, %17}, {%18, %19, %20, %21, %22, %23, %24, %25};" : - //"=r"(registers_d[0]), "=r"(registers_d[1]),"=r"(registers_d[2]),"=r"(registers_d[3]), - //"=r"(registers_d[4]),"=r"(registers_d[5]),"=r"(registers_d[6]),"=r"(registers_d[7]): - //"r"(registers_a[0]),"r"(registers_a[1]),"r"(registers_a[2]),"r"(registers_a[3]), - //"r"(registers_a[4]),"r"(registers_a[5]),"r"(registers_a[6]),"r"(registers_a[7]), - //"r"(registers_b[0]),"r"(registers_b[1]), - //"r"(registers_c[0]),"r"(registers_c[1]),"r"(registers_c[2]),"r"(registers_c[3]), - //"r"(registers_c[4]),"r"(registers_c[5]),"r"(registers_c[6]),"r"(registers_c[7]) - //); - //asm("CPTX_END"); - //asm("*/"); - - //B16 - //asm("/*"); - //asm("CPTX_BEGIN"); - //asm("vp.mma.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16, %17, %18, %19}, { %20, %21, %22, %23, %24, %25, %26, %27};" : - //"=r"(registers_d[0]), "=r"(registers_d[1]),"=r"(registers_d[2]),"=r"(registers_d[3]), - //"=r"(registers_d[4]),"=r"(registers_d[5]),"=r"(registers_d[6]),"=r"(registers_d[7]): - //"r"(registers_a[0]),"r"(registers_a[1]),"r"(registers_a[2]),"r"(registers_a[3]), - //"r"(registers_a[4]),"r"(registers_a[5]),"r"(registers_a[6]),"r"(registers_a[7]), - //"r"(registers_b[0]),"r"(registers_b[1]),"r"(registers_b[2]),"r"(registers_b[3]), - //"r"(registers_c[0]),"r"(registers_c[1]),"r"(registers_c[2]),"r"(registers_c[3]), - //"r"(registers_c[4]),"r"(registers_c[5]),"r"(registers_c[6]),"r"(registers_c[7]) - //); - //asm("CPTX_END"); - //asm("*/"); - - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.store.d.sync.row.m16n16k16.s32 [%0], {%1,%2,%3,%4,%5,%6,%7,%8},%9;" : - :"l"(d_int32) - "r"(registers_d[0]), "r"(registers_d[1]),"r"(registers_d[2]),"r"(registers_d[3]), - "r"(registers_d[4]),"r"(registers_d[5]),"r"(registers_d[6]),"r"(registers_d[7]), - "r"(M) - ); - asm("CPTX_END"); - asm("*/"); - //d_int32[0]=registers_d[0]; -} - -__global__ void convertFp32ToFp16 (half *out, float *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} -__global__ void convertFp16ToFp32 (float *out, half *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} - -__global__ void convertInt32ToInt4 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n/8) { - out[idx] =(in[8*idx]&0xf)|(in[8*idx+1]&0xf)<<4|(in[8*idx+2]&0xf)<<8|(in[8*idx+3]&0xf)<<12| - (in[8*idx+4]&0xf)<<16|(in[8*idx+5]&0xf)<<20|(in[8*idx+6]&0xf)<<24|(in[8*idx+7]&0xf)<<28; - } -} -__global__ void convertInt32ToInt8 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n/4) { - out[idx] =(in[4*idx]&0xff)|(in[4*idx+1]&0xff)<<8|(in[4*idx+2]&0xff)<<16|(in[4*idx+3]&0xff)<<24; - } -} -__global__ void convertInt32ToInt16 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n/2) { - out[idx] =(in[2*idx]&0xffff)|(in[2*idx+1]&0xffff)<<16; - } -} - -__global__ void convertInt4ToInt32 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - int shft_amt=4*(idx%8); - int shft_mask=0xf<<shft_amt; - if (idx < n) { - out[idx]= (in[idx/8]&shft_mask)>>shft_amt; - } -} -__global__ void convertInt8ToInt32 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - int shft_amt=8*(idx%4); - int shft_mask=0xff<<shft_amt; - if (idx < n) { - out[idx]= (in[idx/4]&shft_mask)>>shft_amt; - } -} -__global__ void convertInt16ToInt32 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - int shft_amt=16*(idx%2); - int shft_mask=0xffff<<shft_amt; - if (idx < n) { - out[idx]= (in[idx/2]&shft_mask)>>shft_amt; - } -} - -int main(int argc, char* argv[]) { - int *a_int32; - int *b_int32; - int *c_int32; - int *d_int32; - - int *a_int4; - int *b_int4; - int *a_int8; - int *b_int8; - int *a_int16; - int *b_int16; - - int *a_host_wmma; - int *b_host_wmma; - int *c_host_wmma; - int *d_host_wmma; - int *d_cal_host_wmma; - - cudaEvent_t startWMMA; - cudaEvent_t stopWMMA; - - srand (time(NULL)); - cudaErrCheck(cudaEventCreate(&startWMMA)); - cudaErrCheck(cudaEventCreate(&stopWMMA)); - - // Use tensor cores - cudaErrCheck(cudaMalloc((void**)&a_int32, MATRIX_M * MATRIX_K * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&b_int32, MATRIX_K * MATRIX_N * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&c_int32, MATRIX_K * MATRIX_N * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&d_int32, MATRIX_K * MATRIX_N * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&a_int4, MATRIX_M * MATRIX_K * sizeof(int)/8)); - cudaErrCheck(cudaMalloc((void**)&b_int4, MATRIX_K * MATRIX_N * sizeof(int)/8)); - cudaErrCheck(cudaMalloc((void**)&a_int8, MATRIX_M * MATRIX_K * sizeof(int)/4)); - cudaErrCheck(cudaMalloc((void**)&b_int8, MATRIX_K * MATRIX_N * sizeof(int)/4)); - cudaErrCheck(cudaMalloc((void**)&a_int16, MATRIX_M * MATRIX_K * sizeof(int)/2)); - cudaErrCheck(cudaMalloc((void**)&b_int16, MATRIX_K * MATRIX_N * sizeof(int)/2)); - - - a_host_wmma = (int *)malloc(MATRIX_M * MATRIX_K * sizeof(int)); - b_host_wmma = (int *)malloc(MATRIX_K * MATRIX_N * sizeof(int)); - c_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int)); - d_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int)); - d_cal_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int)); - - printf("a_int32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_K;n++){ - a_host_wmma[m*MATRIX_K+n]=random()%64; - printf("%d ",a_host_wmma[m*MATRIX_K+n]); - } - printf(";\n"); - } - - printf("b_int32\n"); - for(int m=0;m<MATRIX_K;m++){ - for(int n=0;n<MATRIX_N;n++){ - b_host_wmma[m*MATRIX_N+n]=random()%16; - printf("%d ",b_host_wmma[m*MATRIX_N+n]); - } - printf(";\n"); - } - - printf("c_int32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - c_host_wmma[m*MATRIX_N+n]= random()%64; - d_cal_host_wmma[m*MATRIX_N+n]=0; - printf("%d ",c_host_wmma[m*MATRIX_N+n]); - } - printf(";\n"); - } - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - - - cudaErrCheck(cudaMemcpy(a_int32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(int), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(b_int32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(c_int32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice)); - - #ifdef TEST16 - convertInt32ToInt16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_int16, a_int32, MATRIX_M * MATRIX_K); - convertInt16ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, a_int16, MATRIX_M * MATRIX_K); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost)); - #endif - #ifdef TEST8 - convertInt32ToInt8 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_int8, a_int32, MATRIX_M * MATRIX_K); - convertInt8ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, a_int8, MATRIX_M * MATRIX_K); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost)); - #endif - #ifdef TEST4 - convertInt32ToInt4 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int4, b_int32, MATRIX_M * MATRIX_K); - convertInt4ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, b_int4, MATRIX_M * MATRIX_K); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost)); - #endif - convertInt32ToInt4 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int4, b_int32, MATRIX_M * MATRIX_K); - //convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N); - //convertFp32ToFp16 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (c_fp16, c_fp32, MATRIX_K * MATRIX_N); - - -//AAMIR printf("\nM = %d, N = %d, K = %d. \n", MATRIX_M, MATRIX_N, MATRIX_K); -//AAMIR -//AAMIR printf("Running with wmma...\n"); - cudaErrCheck(cudaEventRecord(startWMMA)); - v4p_example <<< 1, 32>>> (a_int32, b_int4, c_int32, d_int32, MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - - - // Error checking - printf("\nChecking results...\n"); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - - float wmmaTime; - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma took %fms\n", wmmaTime); - - cudaErrCheck(cudaEventDestroy(startWMMA)); - cudaErrCheck(cudaEventDestroy(stopWMMA)); - - int t=200000; - while(t-->0); - printf("D_CALCULATED\n"); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%d,",d_cal_host_wmma[m*MATRIX_N+n]); - } - printf("\n"); - } - printf("D_WMMA\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%d,",d_host_wmma[m*MATRIX_N+n]); - } - printf("\n"); - } - int suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])) - { - printf("ERROR:\n"); - suc=0; - } - } - } - if(suc==1) - printf("COMPLETED_SUCCESSFULLY\n"); - - - cudaErrCheck(cudaFree(a_int32)); - cudaErrCheck(cudaFree(b_int32)); - cudaErrCheck(cudaFree(c_int32)); - cudaErrCheck(cudaFree(d_int32)); - cudaErrCheck(cudaFree(a_int8)); - cudaErrCheck(cudaFree(b_int8)); - - free(a_host_wmma); - free(b_host_wmma); - free(c_host_wmma); - free(d_host_wmma); - cudaErrCheck(cudaDeviceReset()); - return 0; -} - - diff --git a/cuda-kernels/v8p_genericMatrixMultiply.cu b/cuda-kernels/v8p_genericMatrixMultiply.cu deleted file mode 100644 index d96b07c..0000000 --- a/cuda-kernels/v8p_genericMatrixMultiply.cu +++ /dev/null @@ -1,385 +0,0 @@ -#include <stdio.h> -#include <curand.h> -#include <stdlib.h> - -// Define some error checking macros. -#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); } -void cudaErrCheck_(cudaError_t stat, const char *file, int line) { - if (stat != cudaSuccess) { - fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line); - } -} - -#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); } -void curandErrCheck_(curandStatus_t stat, const char *file, int line) { - if (stat != CURAND_STATUS_SUCCESS) { - fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line); - } -} - -#include <mma.h> -using namespace nvcuda; - -// Must be multiples of 16 for wmma code to work -#define MATRIX_M (SIZE) -#define MATRIX_N (SIZE) -#define MATRIX_K (SIZE) - - -// The only dimensions currently supported by WMMA -const int WMMA_M = 16; -const int WMMA_N = 16; -const int WMMA_K = 16; - - - -__global__ void vp_example(int *a, int *b, int *c, int M, int N, int K ) { - // Leading dimensions. Packed with no transpositions. - int lda = M; - int ldb = K; - int ldc = M; - - // Tile using a 2D grid - int warpM = (blockIdx.x * blockDim.x + threadIdx.x) / warpSize; - int warpN = (blockIdx.y * blockDim.y + threadIdx.y); - - // Declare the fragments - int a_frag[8]; - int b_frag[8]; - int c_frag[8]; - int acc_frag[8]; - - acc_frag[0]=0; - acc_frag[1]=0; - acc_frag[2]=0; - acc_frag[3]=0; - acc_frag[4]=0; - acc_frag[5]=0; - acc_frag[6]=0; - acc_frag[7]=0; - - // Loop over k - for (int i = 0; i < K; i += WMMA_K) { - int aRow = warpM * WMMA_M; - int aCol = i; - - int bRow = i; - int bCol = warpN * WMMA_N; - - // Bounds checking - if (aRow < M && aCol < K && bRow < K && bCol < N) { - // Load the inputs - // vp::load_matrix_sync(a_frag, a + aRow * lda+ aCol , lda); - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.load.a.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" : - "=r"(a_frag[0]), "=r"(a_frag[1]),"=r"(a_frag[2]),"=r"(a_frag[3]), - "=r"(a_frag[4]),"=r"(a_frag[5]),"=r"(a_frag[6]),"=r"(a_frag[7]): - "l"(a+aRow*lda+aCol),"r"(lda) - ); - asm("CPTX_END"); - asm("*/"); - //vp::load_matrix_sync(b_frag, b + bRow * ldb+ bCol , ldb); - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.load.b8.sync.row.m16n16k16.s32 {%0,%1},[%2],%3;" : - "=r"(b_frag[0]),"=r"(b_frag[1]): - "l"(b+bRow*ldb/4+bCol/4),"r"(ldb) - ); - asm("CPTX_END"); - asm("*/"); - - // Perform the matrix multiplication - //vp::mma_sync(acc_frag, a_frag, b_frag, acc_frag); - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.mma8.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16, %17}, {%18, %19, %20, %21, %22, %23, %24, %25};" : - "=r"(acc_frag[0]), "=r"(acc_frag[1]),"=r"(acc_frag[2]),"=r"(acc_frag[3]), - "=r"(acc_frag[4]),"=r"(acc_frag[5]),"=r"(acc_frag[6]),"=r"(acc_frag[7]): - "r"(a_frag[0]),"r"(a_frag[1]),"r"(a_frag[2]),"r"(a_frag[3]), - "r"(a_frag[4]),"r"(a_frag[5]),"r"(a_frag[6]),"r"(a_frag[7]), - "r"(b_frag[0]),"r"(b_frag[1]), - "r"(acc_frag[0]),"r"(acc_frag[1]),"r"(acc_frag[2]),"r"(acc_frag[3]), - "r"(acc_frag[4]),"r"(acc_frag[5]),"r"(acc_frag[6]),"r"(acc_frag[7]) - ); - asm("CPTX_END"); - asm("*/"); - - } - } - - // Load in the current value of c, scale it by beta, and add this our result scaled by alpha - int cRow = warpM * WMMA_M; - int cCol = warpN * WMMA_N; - - if (cRow < M && cCol < N) { - //vp::load_matrix_sync(c_frag, c + cRow*ldc + cCol , ldc, wmma::mem_row_major); - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.load.c.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" : - "=r"(c_frag[0]), "=r"(c_frag[1]),"=r"(c_frag[2]),"=r"(c_frag[3]), - "=r"(c_frag[4]),"=r"(c_frag[5]),"=r"(c_frag[6]),"=r"(c_frag[7]): - "l"(c+cRow*ldc+cCol),"r"(ldc) - ); - asm("CPTX_END"); - asm("*/"); - - - for(int i=0; i < 8; i++) { - c_frag[i] = acc_frag[i] + c_frag[i]; - } - - // Store the output - //vp::store_matrix_sync(c + cRow *ldc + cCol , c_frag, ldc, wmma::mem_row_major); - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.store.d.sync.row.m16n16k16.s32 [%0], {%1,%2,%3,%4,%5,%6,%7,%8},%9;" : - :"l"(c+cRow*ldc+cCol), - "r"(c_frag[0]), "r"(c_frag[1]),"r"(c_frag[2]),"r"(c_frag[3]), - "r"(c_frag[4]),"r"(c_frag[5]),"r"(c_frag[6]),"r"(c_frag[7]), - "r"(ldc) - ); - asm("CPTX_END"); - asm("*/"); - } -} - -__global__ void convertFp32ToFp16 (half *out, float *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} -__global__ void convertFp16ToFp32 (float *out, half *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} - -__global__ void convertInt32ToInt4 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n/8) { - out[idx] =(in[8*idx]&0xf)|(in[8*idx+1]&0xf)<<4|(in[8*idx+2]&0xf)<<8|(in[8*idx+3]&0xf)<<12| - (in[8*idx+4]&0xf)<<16|(in[8*idx+5]&0xf)<<20|(in[8*idx+6]&0xf)<<24|(in[8*idx+7]&0xf)<<28; - } -} -__global__ void convertInt32ToInt8 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n/4) { - out[idx] =(in[4*idx]&0xff)|(in[4*idx+1]&0xff)<<8|(in[4*idx+2]&0xff)<<16|(in[4*idx+3]&0xff)<<24; - } -} -__global__ void convertInt32ToInt16 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n/2) { - out[idx] =(in[2*idx]&0xffff)|(in[2*idx+1]&0xffff)<<16; - } -} - -__global__ void convertInt4ToInt32 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - int shft_amt=4*(idx%8); - int shft_mask=0xf<<shft_amt; - if (idx < n) { - out[idx]= (in[idx/8]&shft_mask)>>shft_amt; - } -} -__global__ void convertInt8ToInt32 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - int shft_amt=8*(idx%4); - int shft_mask=0xff<<shft_amt; - if (idx < n) { - out[idx]= (in[idx/4]&shft_mask)>>shft_amt; - } -} -__global__ void convertInt16ToInt32 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - int shft_amt=16*(idx%2); - int shft_mask=0xffff<<shft_amt; - if (idx < n) { - out[idx]= (in[idx/2]&shft_mask)>>shft_amt; - } -} - -int main(int argc, char* argv[]) { - int *a_int32; - int *b_int32; - int *c_int32; - int *d_int32; - - int *a_int4; - int *b_int4; - int *a_int8; - int *b_int8; - int *a_int16; - int *b_int16; - - int *a_host_wmma; - int *b_host_wmma; - int *c_host_wmma; - int *d_host_wmma; - int *d_cal_host_wmma; - - cudaEvent_t startWMMA; - cudaEvent_t stopWMMA; - - srand(time(NULL)); - cudaErrCheck(cudaEventCreate(&startWMMA)); - cudaErrCheck(cudaEventCreate(&stopWMMA)); - - // Use tensor cores - cudaErrCheck(cudaMalloc((void**)&a_int32, MATRIX_M * MATRIX_K * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&b_int32, MATRIX_K * MATRIX_N * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&c_int32, MATRIX_K * MATRIX_N * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&d_int32, MATRIX_K * MATRIX_N * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&a_int4, MATRIX_M * MATRIX_K * sizeof(int)/8)); - cudaErrCheck(cudaMalloc((void**)&b_int4, MATRIX_K * MATRIX_N * sizeof(int)/8)); - cudaErrCheck(cudaMalloc((void**)&a_int8, MATRIX_M * MATRIX_K * sizeof(int)/4)); - cudaErrCheck(cudaMalloc((void**)&b_int8, MATRIX_K * MATRIX_N * sizeof(int)/4)); - cudaErrCheck(cudaMalloc((void**)&a_int16, MATRIX_M * MATRIX_K * sizeof(int)/2)); - cudaErrCheck(cudaMalloc((void**)&b_int16, MATRIX_K * MATRIX_N * sizeof(int)/2)); - - - a_host_wmma = (int *)malloc(MATRIX_M * MATRIX_K * sizeof(int)); - b_host_wmma = (int *)malloc(MATRIX_K * MATRIX_N * sizeof(int)); - c_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int)); - d_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int)); - d_cal_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int)); - - printf("a_int32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_K;n++){ - a_host_wmma[m*MATRIX_K+n]=random()%5; - printf("%d ",a_host_wmma[m*MATRIX_K+n]); - } - printf(";\n"); - } - - printf("b_int32\n"); - for(int m=0;m<MATRIX_K;m++){ - for(int n=0;n<MATRIX_N;n++){ - b_host_wmma[m*MATRIX_N+n]=random()%32; - printf("%d ",b_host_wmma[m*MATRIX_N+n]); - } - printf(";\n"); - } - - printf("c_int32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - c_host_wmma[m*MATRIX_N+n]=random()%32; - d_cal_host_wmma[m*MATRIX_N+n]=0; - printf("%d ",c_host_wmma[m*MATRIX_N+n]); - } - printf(";\n"); - } - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - - - cudaErrCheck(cudaMemcpy(a_int32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(int), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(b_int32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(c_int32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice)); - - #ifdef TEST16 - convertInt32ToInt16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_int16, a_int32, MATRIX_M * MATRIX_K); - convertInt16ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, a_int16, MATRIX_M * MATRIX_K); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost)); - #endif - #ifdef TEST8 - convertInt32ToInt8 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_int8, a_int32, MATRIX_M * MATRIX_K); - convertInt8ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, a_int8, MATRIX_M * MATRIX_K); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost)); - #endif - #ifdef TEST4 - convertInt32ToInt4 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int4, b_int32, MATRIX_M * MATRIX_K); - convertInt4ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, b_int4, MATRIX_M * MATRIX_K); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost)); - #endif - convertInt32ToInt8 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int8, b_int32, MATRIX_M * MATRIX_K); - - dim3 gridDim; - dim3 blockDim; - - // blockDim.x must be a multple of warpSize - // 128x4 means we have 16 warps and a block computes a 64x64 output tile - blockDim.x = 64; - blockDim.y = 2; - - gridDim.x = (MATRIX_M + (WMMA_M * blockDim.x / 32 - 1)) / (WMMA_M * blockDim.x / 32); - gridDim.y = (MATRIX_N + WMMA_N * blockDim.y - 1) / (WMMA_N * blockDim.y); - printf("GRID:X=%d,Y=%d\n",gridDim.x,gridDim.y); - printf("BLOCK:X=%d,Y=%d\n",blockDim.x,blockDim.y); - - - printf("Running with wmma...\n"); - cudaErrCheck(cudaEventRecord(startWMMA)); - vp_example <<< gridDim, blockDim >>> (a_int32, b_int8, c_int32, MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - - // Error checking - printf("\nChecking results...\n"); - cudaErrCheck(cudaMemcpy(d_host_wmma, c_int32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - - float wmmaTime; - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma took %fms\n", wmmaTime); - - cudaErrCheck(cudaEventDestroy(startWMMA)); - cudaErrCheck(cudaEventDestroy(stopWMMA)); - - int t=1000000; - while(t-->0); - printf("D_CALCULATED\n"); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%d,",d_cal_host_wmma[m*MATRIX_N+n]); - } - printf("\n"); - } - printf("D_WMMA\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%d,",d_host_wmma[m*MATRIX_N+n]); - } - printf("\n"); - } - int suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])) - { - printf("ERROR:\n"); - suc=0; - } - } - } - if(suc==1) - printf("COMPLETED_SUCCESSFULLY\n"); - - - cudaErrCheck(cudaFree(a_int32)); - cudaErrCheck(cudaFree(b_int32)); - cudaErrCheck(cudaFree(c_int32)); - cudaErrCheck(cudaFree(d_int32)); - cudaErrCheck(cudaFree(a_int8)); - cudaErrCheck(cudaFree(b_int8)); - - free(a_host_wmma); - free(b_host_wmma); - free(c_host_wmma); - free(d_host_wmma); - cudaErrCheck(cudaDeviceReset()); - return 0; -} - - diff --git a/cuda-kernels/v8p_kernel.cu b/cuda-kernels/v8p_kernel.cu deleted file mode 100644 index 9bfcea7..0000000 --- a/cuda-kernels/v8p_kernel.cu +++ /dev/null @@ -1,359 +0,0 @@ -#include <stdio.h> -#include <curand.h> -#include<stdlib.h> - -// Define some error checking macros. -#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); } -void cudaErrCheck_(cudaError_t stat, const char *file, int line) { - if (stat != cudaSuccess) { - fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line); - } -} - -#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); } -void curandErrCheck_(curandStatus_t stat, const char *file, int line) { - if (stat != CURAND_STATUS_SUCCESS) { - fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line); - } -} - -#include <mma.h> -using namespace nvcuda; - -// Must be multiples of 16 for wmma code to work -#define MATRIX_M (16) -#define MATRIX_N (16) -#define MATRIX_K (16) - - -// The only dimensions currently supported by WMMA -const int WMMA_M = 16; -const int WMMA_N = 16; -const int WMMA_K = 16; - -__global__ void v4p_example(int *a_int32, int *b_int4, int *c,int *d_int32, int M, int N, int K) { - - int registers_a[8]; - int registers_b[8]; - int registers_c[8]; - int registers_d[8]; - int register_b; //contains 8 4bit b elements - int idx = blockDim.x * blockIdx.x + threadIdx.x; - - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.load.a.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" : - "=r"(registers_a[0]), "=r"(registers_a[1]),"=r"(registers_a[2]),"=r"(registers_a[3]), - "=r"(registers_a[4]),"=r"(registers_a[5]),"=r"(registers_a[6]),"=r"(registers_a[7]): - "l"(a_int32),"r"(M) - ); - asm("CPTX_END"); - asm("*/"); - - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.load.b8.sync.row.m16n16k16.s32 {%0,%1},[%2],%3;" : - "=r"(registers_b[0]),"=r"(registers_b[1]): - "l"(b_int4),"r"(M) - ); - asm("CPTX_END"); - asm("*/"); - - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.load.c.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" : - "=r"(registers_c[0]), "=r"(registers_c[1]),"=r"(registers_c[2]),"=r"(registers_c[3]), - "=r"(registers_c[4]),"=r"(registers_c[5]),"=r"(registers_c[6]),"=r"(registers_c[7]): - "l"(c),"r"(M) - ); - asm("CPTX_END"); - asm("*/"); - //B4 - //asm("/*"); - //asm("CPTX_BEGIN"); - //asm("vp.mma.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16}, {%17, %18, %19, %20, %21, %22, %23, %24};" : - //"=r"(registers_d[0]), "=r"(registers_d[1]),"=r"(registers_d[2]),"=r"(registers_d[3]), - //"=r"(registers_d[4]),"=r"(registers_d[5]),"=r"(registers_d[6]),"=r"(registers_d[7]): - //"r"(registers_a[0]),"r"(registers_a[1]),"r"(registers_a[2]),"r"(registers_a[3]), - //"r"(registers_a[4]),"r"(registers_a[5]),"r"(registers_a[6]),"r"(registers_a[7]), - //"r"(registers_b[0]), - //"r"(registers_c[0]),"r"(registers_c[1]),"r"(registers_c[2]),"r"(registers_c[3]), - //"r"(registers_c[4]),"r"(registers_c[5]),"r"(registers_c[6]),"r"(registers_c[7]) - //); - //asm("CPTX_END"); - //asm("*/"); - - //B8 - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.mma8.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16, %17}, {%18, %19, %20, %21, %22, %23, %24, %25};" : - "=r"(registers_d[0]), "=r"(registers_d[1]),"=r"(registers_d[2]),"=r"(registers_d[3]), - "=r"(registers_d[4]),"=r"(registers_d[5]),"=r"(registers_d[6]),"=r"(registers_d[7]): - "r"(registers_a[0]),"r"(registers_a[1]),"r"(registers_a[2]),"r"(registers_a[3]), - "r"(registers_a[4]),"r"(registers_a[5]),"r"(registers_a[6]),"r"(registers_a[7]), - "r"(registers_b[0]),"r"(registers_b[1]), - "r"(registers_c[0]),"r"(registers_c[1]),"r"(registers_c[2]),"r"(registers_c[3]), - "r"(registers_c[4]),"r"(registers_c[5]),"r"(registers_c[6]),"r"(registers_c[7]) - ); - asm("CPTX_END"); - asm("*/"); - - //B16 - //asm("/*"); - //asm("CPTX_BEGIN"); - //asm("vp.mma.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16, %17, %18, %19}, { %20, %21, %22, %23, %24, %25, %26, %27};" : - //"=r"(registers_d[0]), "=r"(registers_d[1]),"=r"(registers_d[2]),"=r"(registers_d[3]), - //"=r"(registers_d[4]),"=r"(registers_d[5]),"=r"(registers_d[6]),"=r"(registers_d[7]): - //"r"(registers_a[0]),"r"(registers_a[1]),"r"(registers_a[2]),"r"(registers_a[3]), - //"r"(registers_a[4]),"r"(registers_a[5]),"r"(registers_a[6]),"r"(registers_a[7]), - //"r"(registers_b[0]),"r"(registers_b[1]),"r"(registers_b[2]),"r"(registers_b[3]), - //"r"(registers_c[0]),"r"(registers_c[1]),"r"(registers_c[2]),"r"(registers_c[3]), - //"r"(registers_c[4]),"r"(registers_c[5]),"r"(registers_c[6]),"r"(registers_c[7]) - //); - //asm("CPTX_END"); - //asm("*/"); - - asm("/*"); - asm("CPTX_BEGIN"); - asm("vp.store.d.sync.row.m16n16k16.s32 [%0], {%1,%2,%3,%4,%5,%6,%7,%8},%9;" : - :"l"(d_int32) - "r"(registers_d[0]), "r"(registers_d[1]),"r"(registers_d[2]),"r"(registers_d[3]), - "r"(registers_d[4]),"r"(registers_d[5]),"r"(registers_d[6]),"r"(registers_d[7]), - "r"(M) - ); - asm("CPTX_END"); - asm("*/"); - //d_int32[0]=registers_d[0]; -} - -__global__ void convertFp32ToFp16 (half *out, float *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} -__global__ void convertFp16ToFp32 (float *out, half *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n) { - out[idx] = in[idx]; - } -} - -__global__ void convertInt32ToInt4 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n/8) { - out[idx] =(in[8*idx]&0xf)|(in[8*idx+1]&0xf)<<4|(in[8*idx+2]&0xf)<<8|(in[8*idx+3]&0xf)<<12| - (in[8*idx+4]&0xf)<<16|(in[8*idx+5]&0xf)<<20|(in[8*idx+6]&0xf)<<24|(in[8*idx+7]&0xf)<<28; - } -} -__global__ void convertInt32ToInt8 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n/4) { - out[idx] =(in[4*idx]&0xff)|(in[4*idx+1]&0xff)<<8|(in[4*idx+2]&0xff)<<16|(in[4*idx+3]&0xff)<<24; - } -} -__global__ void convertInt32ToInt16 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - if (idx < n/2) { - out[idx] =(in[2*idx]&0xffff)|(in[2*idx+1]&0xffff)<<16; - } -} - -__global__ void convertInt4ToInt32 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - int shft_amt=4*(idx%8); - int shft_mask=0xf<<shft_amt; - if (idx < n) { - out[idx]= (in[idx/8]&shft_mask)>>shft_amt; - } -} -__global__ void convertInt8ToInt32 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - int shft_amt=8*(idx%4); - int shft_mask=0xff<<shft_amt; - if (idx < n) { - out[idx]= (in[idx/4]&shft_mask)>>shft_amt; - } -} -__global__ void convertInt16ToInt32 (int *out, int *in, int n) { - int idx = blockDim.x * blockIdx.x + threadIdx.x; - int shft_amt=16*(idx%2); - int shft_mask=0xffff<<shft_amt; - if (idx < n) { - out[idx]= (in[idx/2]&shft_mask)>>shft_amt; - } -} - -int main(int argc, char* argv[]) { - int *a_int32; - int *b_int32; - int *c_int32; - int *d_int32; - - int *a_int4; - int *b_int4; - int *a_int8; - int *b_int8; - int *a_int16; - int *b_int16; - - int *a_host_wmma; - int *b_host_wmma; - int *c_host_wmma; - int *d_host_wmma; - int *d_cal_host_wmma; - - cudaEvent_t startWMMA; - cudaEvent_t stopWMMA; - srand(time(NULL)); - - cudaErrCheck(cudaEventCreate(&startWMMA)); - cudaErrCheck(cudaEventCreate(&stopWMMA)); - - // Use tensor cores - cudaErrCheck(cudaMalloc((void**)&a_int32, MATRIX_M * MATRIX_K * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&b_int32, MATRIX_K * MATRIX_N * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&c_int32, MATRIX_K * MATRIX_N * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&d_int32, MATRIX_K * MATRIX_N * sizeof(int))); - cudaErrCheck(cudaMalloc((void**)&a_int4, MATRIX_M * MATRIX_K * sizeof(int)/8)); - cudaErrCheck(cudaMalloc((void**)&b_int4, MATRIX_K * MATRIX_N * sizeof(int)/8)); - cudaErrCheck(cudaMalloc((void**)&a_int8, MATRIX_M * MATRIX_K * sizeof(int)/4)); - cudaErrCheck(cudaMalloc((void**)&b_int8, MATRIX_K * MATRIX_N * sizeof(int)/4)); - cudaErrCheck(cudaMalloc((void**)&a_int16, MATRIX_M * MATRIX_K * sizeof(int)/2)); - cudaErrCheck(cudaMalloc((void**)&b_int16, MATRIX_K * MATRIX_N * sizeof(int)/2)); - - - a_host_wmma = (int *)malloc(MATRIX_M * MATRIX_K * sizeof(int)); - b_host_wmma = (int *)malloc(MATRIX_K * MATRIX_N * sizeof(int)); - c_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int)); - d_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int)); - d_cal_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int)); - - printf("a_int32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_K;n++){ - a_host_wmma[m*MATRIX_K+n]=random()%10; - printf("%d ",a_host_wmma[m*MATRIX_K+n]); - } - printf(";\n"); - } - - printf("b_int32\n"); - for(int m=0;m<MATRIX_K;m++){ - for(int n=0;n<MATRIX_N;n++){ - b_host_wmma[m*MATRIX_N+n]=random()%5; - printf("%d ",b_host_wmma[m*MATRIX_N+n]); - } - printf(";\n"); - } - - printf("c_int32\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - c_host_wmma[m*MATRIX_N+n]=random()%64; - d_cal_host_wmma[m*MATRIX_N+n]=0; - printf("%d ",c_host_wmma[m*MATRIX_N+n]); - } - printf(";\n"); - } - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - for(int k=0;k<MATRIX_K;k++){ - d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n]; - } - d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n]; - } - } - - - cudaErrCheck(cudaMemcpy(a_int32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(int), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(b_int32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice)); - cudaErrCheck(cudaMemcpy(c_int32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice)); - - #ifdef TEST16 - convertInt32ToInt16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_int16, a_int32, MATRIX_M * MATRIX_K); - convertInt16ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, a_int16, MATRIX_M * MATRIX_K); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost)); - #endif - #ifdef TEST8 - convertInt32ToInt8 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_int8, a_int32, MATRIX_M * MATRIX_K); - convertInt8ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, a_int8, MATRIX_M * MATRIX_K); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost)); - #endif - #ifdef TEST4 - convertInt32ToInt4 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int4, b_int32, MATRIX_M * MATRIX_K); - convertInt4ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, b_int4, MATRIX_M * MATRIX_K); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost)); - #endif - convertInt32ToInt8 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int8, b_int32, MATRIX_M * MATRIX_K); - //convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N); - //convertFp32ToFp16 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (c_fp16, c_fp32, MATRIX_K * MATRIX_N); - - -//AAMIR printf("\nM = %d, N = %d, K = %d. \n", MATRIX_M, MATRIX_N, MATRIX_K); -//AAMIR -//AAMIR printf("Running with wmma...\n"); - cudaErrCheck(cudaEventRecord(startWMMA)); - v4p_example <<< 1, 32>>> (a_int32, b_int8, c_int32, d_int32, MATRIX_M, MATRIX_N, MATRIX_K); - cudaErrCheck(cudaEventRecord(stopWMMA)); - cudaErrCheck(cudaEventSynchronize(stopWMMA)); - - - // Error checking - printf("\nChecking results...\n"); - cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost)); - - float wmmaTime; - cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA)); - printf("wmma took %fms\n", wmmaTime); - - cudaErrCheck(cudaEventDestroy(startWMMA)); - cudaErrCheck(cudaEventDestroy(stopWMMA)); - - int t=2000000; - while(t-->0); - printf("D_CALCULATED\n"); - - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%d,",d_cal_host_wmma[m*MATRIX_N+n]); - } - printf("\n"); - } - printf("D_WMMA\n"); - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - printf("%d,",d_host_wmma[m*MATRIX_N+n]); - } - printf("\n"); - } - int suc=1; - for(int m=0;m<MATRIX_M;m++){ - for(int n=0;n<MATRIX_N;n++){ - if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])) - { - printf("ERROR:\n"); - suc=0; - } - } - } - if(suc==1) - printf("COMPLETED_SUCCESSFULLY\n"); - - - cudaErrCheck(cudaFree(a_int32)); - cudaErrCheck(cudaFree(b_int32)); - cudaErrCheck(cudaFree(c_int32)); - cudaErrCheck(cudaFree(d_int32)); - cudaErrCheck(cudaFree(a_int8)); - cudaErrCheck(cudaFree(b_int8)); - - free(a_host_wmma); - free(b_host_wmma); - free(c_host_wmma); - free(d_host_wmma); - cudaErrCheck(cudaDeviceReset()); - return 0; -} - - |
