aboutsummaryrefslogtreecommitdiff
path: root/cuda-kernels
diff options
context:
space:
mode:
Diffstat (limited to 'cuda-kernels')
-rwxr-xr-xcuda-kernels/Makefile11
-rw-r--r--cuda-kernels/TensorCoreMatrixCArrangement.xlsxbin76737 -> 0 bytes
-rw-r--r--cuda-kernels/VPlog/parsing_script.py140
-rwxr-xr-xcuda-kernels/config_fermi_islip.icnt70
-rw-r--r--cuda-kernels/genericMatrixMultiply.cu288
-rw-r--r--cuda-kernels/genericMatrixMultiplyRow.cu289
-rwxr-xr-xcuda-kernels/gpgpusim.config151
-rwxr-xr-xcuda-kernels/gpuwattch_gtx1080Ti.xml538
-rwxr-xr-xcuda-kernels/scripts139
-rw-r--r--cuda-kernels/tensor_core.cu245
-rw-r--r--cuda-kernels/tensor_core_ptx171
-rw-r--r--cuda-kernels/tensorcore_layout_fp16_fp16.cu892
-rw-r--r--cuda-kernels/tensorcore_layout_fp16_fp32.cu892
-rw-r--r--cuda-kernels/tensorcore_layout_fp32_fp32.cu876
-rw-r--r--cuda-kernels/tensorcore_type16_16.cu217
-rw-r--r--cuda-kernels/tensorcore_type16_32.cu207
-rw-r--r--cuda-kernels/tensorcore_type32_16.cu218
-rw-r--r--cuda-kernels/tensorcore_type32_32.cu217
-rw-r--r--cuda-kernels/v16p_genericMatrixMultiply.cu388
-rw-r--r--cuda-kernels/v16p_kernel.cu359
-rw-r--r--cuda-kernels/v4p_genericMatrixMultiply.cu387
-rw-r--r--cuda-kernels/v4p_kernel.cu359
-rw-r--r--cuda-kernels/v8p_genericMatrixMultiply.cu385
-rw-r--r--cuda-kernels/v8p_kernel.cu359
24 files changed, 0 insertions, 7798 deletions
diff --git a/cuda-kernels/Makefile b/cuda-kernels/Makefile
deleted file mode 100755
index b33519f..0000000
--- a/cuda-kernels/Makefile
+++ /dev/null
@@ -1,11 +0,0 @@
-all: tensorcore_type32_32.cu
- nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o tensor_core tensorcore_type32_32.cu
-# nvcc -arch=sm_70 -lcudart -g -o tensor_core tensor_core.cu
-
-.PHONY:
-clean:
- rm _cuob*
- rm gpgpusim_power*
- rm gpgpu_inst_stats.txt
- rm gpgpusim_visualizer*
-# nvcc -arch=sm_70 --gpu-architecture=compute_50 --gpu-code=compute_50 -lcudart -g -o tensor_core tensor_core.cu
diff --git a/cuda-kernels/TensorCoreMatrixCArrangement.xlsx b/cuda-kernels/TensorCoreMatrixCArrangement.xlsx
deleted file mode 100644
index 785ecc3..0000000
--- a/cuda-kernels/TensorCoreMatrixCArrangement.xlsx
+++ /dev/null
Binary files differ
diff --git a/cuda-kernels/VPlog/parsing_script.py b/cuda-kernels/VPlog/parsing_script.py
deleted file mode 100644
index 627c216..0000000
--- a/cuda-kernels/VPlog/parsing_script.py
+++ /dev/null
@@ -1,140 +0,0 @@
-import re
-import time
-from time import strftime
-
-def main():
-# time_now = str(strftime("%Y-%m-%d %H-%M-%S", time.localtime()))
-# file = "\\" + "Parser Output " + time_now + ".txt"
-
- regexlist=[]
- regexlist.append('gpu_sim_cycle.*')
- regexlist.append('gpu_ipc.*')
- regexlist.append('gpu_tot_issued_cta.*')
- regexlist.append('L1I_total_cache_accesses.*' )
- regexlist.append('L1I_total_cache_misses.*')
- regexlist.append('L1C_total_cache_accesses.*')
- regexlist.append('L1C_total_cache_misses.*')
- regexlist.append('Total_core_cache_stats_breakdown\[CONST_ACC_R\]\[HIT\].*')
- regexlist.append('Total_core_cache_stats_breakdown\[CONST_ACC_R\]\[MISS\].*')
- regexlist.append('Total_core_cache_stats_breakdown\[INST_ACC_R\]\[HIT\].*')
- regexlist.append('Total_core_cache_stats_breakdown\[INST_ACC_R\]\[MISS\].*')
- regexlist.append('gpgpu_n_tot_thrd_icount.*')
- regexlist.append('gpgpu_n_tot_w_icount.*')
- regexlist.append('gpgpu_n_stall_shd_mem.*')
- regexlist.append('gpgpu_n_mem_read_global.*')
- regexlist.append('gpgpu_n_mem_write_global.*')
- regexlist.append('gpgpu_n_mem_const.*')
- regexlist.append('gpgpu_n_load_insn.*')
- regexlist.append('gpgpu_n_store_insn.*')
- regexlist.append('gpgpu_n_param_mem_insn.*')
- regexlist.append('traffic_breakdown_coretomem\[CONST_ACC_R\].*')
- regexlist.append('traffic_breakdown_coretomem\[GLOBAL_ACC_R\].*')
- regexlist.append('traffic_breakdown_coretomem\[GLOBAL_ACC_W\].*')
- regexlist.append('traffic_breakdown_coretomem\[INST_ACC_R\].*')
- regexlist.append('traffic_breakdown_memtocore\[CONST_ACC_R\].*')
- regexlist.append('traffic_breakdown_memtocore\[GLOBAL_ACC_R\].*')
- regexlist.append('traffic_breakdown_memtocore\[GLOBAL_ACC_W\].*')
- regexlist.append('traffic_breakdown_memtocore\[INST_ACC_R\].*')
- regexlist.append('L2_total_cache_accesses.*')
- regexlist.append('L2_total_cache_misses.*')
- regexlist.append('L2_cache_stats_breakdown\[GLOBAL_ACC_R\]\[HIT\].*')
- regexlist.append('L2_cache_stats_breakdown\[GLOBAL_ACC_R\]\[MISS\].*')
- regexlist.append('L2_cache_stats_breakdown\[CONST_ACC_R\]\[HIT\].*')
- regexlist.append('L2_cache_stats_breakdown\[CONST_ACC_R\]\[MISS\].*')
- regexlist.append('L2_cache_stats_breakdown\[GLOBAL_ACC_W\]\[HIT\].*')
- regexlist.append('L2_cache_stats_breakdown\[GLOBAL_ACC_W\]\[MISS\].*')
- regexlist.append('L2_cache_stats_breakdown\[INST_ACC_R\]\[MISS\].*')
-
- #VP4
- log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp4_16_summary"
- export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp4_16_parsed"
- for regex in regexlist:
- parseData(log_file_path, export_file, regex, read_line=True)
- log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp4_32_summary"
- export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp4_32_parsed"
- for regex in regexlist:
- parseData(log_file_path, export_file, regex, read_line=True)
- log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp4_64_summary"
- export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp4_64_parsed"
- for regex in regexlist:
- parseData(log_file_path, export_file, regex, read_line=True)
- log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp4_128_summary"
- export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp4_128_parsed"
- for regex in regexlist:
- parseData(log_file_path, export_file, regex, read_line=True)
- log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp4_256_summary"
- export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp4_256_parsed"
- for regex in regexlist:
- parseData(log_file_path, export_file, regex, read_line=True)
-
-
- #VP8
- log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp8_16_summary"
- export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp8_16_parsed"
- for regex in regexlist:
- parseData(log_file_path, export_file, regex, read_line=True)
- log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp8_32_summary"
- export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp8_32_parsed"
- for regex in regexlist:
- parseData(log_file_path, export_file, regex, read_line=True)
- log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp8_64_summary"
- export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp8_64_parsed"
- for regex in regexlist:
- parseData(log_file_path, export_file, regex, read_line=True)
- log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp8_128_summary"
- export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp8_128_parsed"
- for regex in regexlist:
- parseData(log_file_path, export_file, regex, read_line=True)
- log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp8_256_summary"
- export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp8_256_parsed"
- for regex in regexlist:
- parseData(log_file_path, export_file, regex, read_line=True)
-
- #VP16
- log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp16_16_summary"
- export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp16_16_parsed"
- for regex in regexlist:
- parseData(log_file_path, export_file, regex, read_line=True)
- log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp16_32_summary"
- export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp16_32_parsed"
- for regex in regexlist:
- parseData(log_file_path, export_file, regex, read_line=True)
- log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp16_64_summary"
- export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp16_64_parsed"
- for regex in regexlist:
- parseData(log_file_path, export_file, regex, read_line=True)
- log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp16_128_summary"
- export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp16_128_parsed"
- for regex in regexlist:
- parseData(log_file_path, export_file, regex, read_line=True)
- log_file_path = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp16_256_summary"
- export_file = r"/home/araihan/negar-gpgpusim-tensorcore/cuda-kernels/VPlog/vp16_256_parsed"
- for regex in regexlist:
- parseData(log_file_path, export_file, regex, read_line=True)
-
-def parseData(log_file_path, export_file, regex, read_line=True):
- with open(log_file_path, "r") as file:
- match_list = []
- if read_line == True:
- for line in file:
- for match in re.finditer(regex, line, re.S):
- match_text = match.group()
- match_text = re.sub('^.*=','',match_text.rstrip())
- match_list.append(match_text+'\n')
- print match_text
- else:
- data = file.read()
- for match in re.finditer(regex, data, re.S):
- match_text = match.group();
- match_list.append(match_text)
- file.close()
-
- with open(export_file, "a+") as file:
- match_list_clean = list(set(match_list))
- for item in xrange(0, len(match_list_clean)):
- print match_list_clean[item]
- file.write(match_list_clean[item] )#+ "\n")
- file.close()
-
-if __name__ == '__main__':
- main()
diff --git a/cuda-kernels/config_fermi_islip.icnt b/cuda-kernels/config_fermi_islip.icnt
deleted file mode 100755
index 3b8b496..0000000
--- a/cuda-kernels/config_fermi_islip.icnt
+++ /dev/null
@@ -1,70 +0,0 @@
-//21*1 fly with 32 flits per packet under gpgpusim injection mode
-use_map = 0;
-flit_size = 32;
-
-// currently we do not use this, see subnets below
-network_count = 2;
-
-// Topology
-topology = fly;
-k = 102;
-n = 1;
-
-// Routing
-
-routing_function = dest_tag;
-
-// Flow control
-
-num_vcs = 1;
-vc_buf_size = 8;
-
-wait_for_tail_credit = 0;
-
-// Router architecture
-
-vc_allocator = islip; //separable_input_first;
-sw_allocator = islip; //separable_input_first;
-alloc_iters = 1;
-
-credit_delay = 0;
-routing_delay = 0;
-vc_alloc_delay = 1;
-sw_alloc_delay = 1;
-
-input_speedup = 2;
-output_speedup = 1;
-internal_speedup = 1.0;
-
-// Traffic, GPGPU-Sim does not use this
-
-traffic = uniform;
-packet_size ={{1,2,3,4},{10,20}};
-packet_size_rate={{1,1,1,1},{2,1}};
-
-// Simulation - Don't change
-
-sim_type = gpgpusim;
-//sim_type = latency;
-injection_rate = 0.1;
-
-subnets = 2;
-
-// Always use read and write no matter following line
-//use_read_write = 1;
-
-
-read_request_subnet = 0;
-read_reply_subnet = 1;
-write_request_subnet = 0;
-write_reply_subnet = 1;
-
-read_request_begin_vc = 0;
-read_request_end_vc = 0;
-write_request_begin_vc = 0;
-write_request_end_vc = 0;
-read_reply_begin_vc = 0;
-read_reply_end_vc = 0;
-write_reply_begin_vc = 0;
-write_reply_end_vc = 0;
-
diff --git a/cuda-kernels/genericMatrixMultiply.cu b/cuda-kernels/genericMatrixMultiply.cu
deleted file mode 100644
index 8b96483..0000000
--- a/cuda-kernels/genericMatrixMultiply.cu
+++ /dev/null
@@ -1,288 +0,0 @@
-/* Copyright (c) 1993-2017, NVIDIA CORPORATION. All rights reserved.
- *
- * Redistribution and use in source and binary forms, with or without
- * modification, are permitted provided that the following conditions
- * are met:
- * * Redistributions of source code must retain the above copyright
- * notice, this list of conditions and the following disclaimer.
- * * Redistributions in binary form must reproduce the above copyright
- * notice, this list of conditions and the following disclaimer in the
- * documentation and/or other materials provided with the distribution.
- * * Neither the name of NVIDIA CORPORATION nor the names of its
- * contributors may be used to endorse or promote products derived
- * from this software without specific prior written permission.
- *
- * THIS SOFTWARE IS PROVIDED BY THE COPYRIGHT HOLDERS ``AS IS'' AND ANY
- * EXPRESS OR IMPLIED WARRANTIES, INCLUDING, BUT NOT LIMITED TO, THE
- * IMPLIED WARRANTIES OF MERCHANTABILITY AND FITNESS FOR A PARTICULAR
- * PURPOSE ARE DISCLAIMED. IN NO EVENT SHALL THE COPYRIGHT OWNER OR
- * CONTRIBUTORS BE LIABLE FOR ANY DIRECT, INDIRECT, INCIDENTAL, SPECIAL,
- * EXEMPLARY, OR CONSEQUENTIAL DAMAGES (INCLUDING, BUT NOT LIMITED TO,
- * PROCUREMENT OF SUBSTITUTE GOODS OR SERVICES; LOSS OF USE, DATA, OR
- * PROFITS; OR BUSINESS INTERRUPTION) HOWEVER CAUSED AND ON ANY THEORY
- * OF LIABILITY, WHETHER IN CONTRACT, STRICT LIABILITY, OR TORT
- * (INCLUDING NEGLIGENCE OR OTHERWISE) ARISING IN ANY WAY OUT OF THE USE
- * OF THIS SOFTWARE, EVEN IF ADVISED OF THE POSSIBILITY OF SUCH DAMAGE.
- */
-
-#include <stdio.h>
-#include <stdlib.h>
-// Define some error checking macros.
-#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); }
-void cudaErrCheck_(cudaError_t stat, const char *file, int line) {
- if (stat != cudaSuccess) {
- fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line);
- }
-}
-
-
-#include <mma.h>
-using namespace nvcuda;
-
-// Must be multiples of 16 for wmma code to work
-#define MATRIX_M (64)
-#define MATRIX_N (64)
-#define MATRIX_K (64)
-
-
-
-// The only dimensions currently supported by WMMA
-const int WMMA_M = 16;
-const int WMMA_N = 16;
-const int WMMA_K = 16;
-
-__global__ void wmma_example(half *a, half *b, float *c, int M, int N, int K, float alpha, float beta) {
- // Leading dimensions. Packed with no transpositions.
- int lda = M;
- int ldb = K;
- int ldc = M;
-
- // Tile using a 2D grid
- int warpM = (blockIdx.x * blockDim.x + threadIdx.x) / warpSize;
- int warpN = (blockIdx.y * blockDim.y + threadIdx.y);
-
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> acc_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
-
- wmma::fill_fragment(acc_frag, 0.0f);
-
- // Loop over k
- for (int i = 0; i < K; i += WMMA_K) {
- int aRow = warpM * WMMA_M;
- int aCol = i;
-
- int bRow = i;
- int bCol = warpN * WMMA_N;
-
- // Bounds checking
- if (aRow < M && aCol < K && bRow < K && bCol < N) {
- // Load the inputs
- wmma::load_matrix_sync(a_frag, a + aRow + aCol * lda, lda);
- wmma::load_matrix_sync(b_frag, b + bRow + bCol * ldb, ldb);
-
- // Perform the matrix multiplication
- wmma::mma_sync(acc_frag, a_frag, b_frag, acc_frag);
-
- }
- }
-
- // Load in the current value of c, scale it by beta, and add this our result scaled by alpha
- int cRow = warpM * WMMA_M;
- int cCol = warpN * WMMA_N;
-
- if (cRow < M && cCol < N) {
- wmma::load_matrix_sync(c_frag, c + cRow + cCol * ldc, ldc, wmma::mem_col_major);
-
-
- for(int i=0; i < c_frag.num_elements; i++) {
- c_frag.x[i] = alpha * acc_frag.x[i] + beta * c_frag.x[i];
- }
-
- // Store the output
- wmma::store_matrix_sync(c + cRow + cCol * ldc, c_frag, ldc, wmma::mem_col_major);
- }
-}
-
-__global__ void convertFp32ToFp16 (half *out, float *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-
-int main(int argc, char* argv[]) {
- float *a_fp32;
- float *b_fp32;
- half *a_fp16;
- half *b_fp16;
-
- float *c;
- float *c_wmma;
-
- float *d_host_wmma;
- float *d_cal_host_wmma;
- float *a_host_wmma;
- float *b_host_wmma;
- float *c_host_wmma;
-
-
- cudaEvent_t startWMMA;
- cudaEvent_t stopWMMA;
-
-
- cudaErrCheck(cudaEventCreate(&startWMMA));
- cudaErrCheck(cudaEventCreate(&stopWMMA));
-
- // Use tensor cores
- cudaErrCheck(cudaMalloc((void**)&a_fp32, MATRIX_M * MATRIX_K * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&b_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&a_fp16, MATRIX_M * MATRIX_K * sizeof(half)));
- cudaErrCheck(cudaMalloc((void**)&b_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
-
- cudaErrCheck(cudaMalloc((void**)&c, MATRIX_M * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&c_wmma, MATRIX_M * MATRIX_N * sizeof(float)));
-
- d_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- d_cal_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- c_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- a_host_wmma = (float*)malloc(MATRIX_M * MATRIX_K * sizeof(float));
- b_host_wmma = (float*)malloc(MATRIX_K * MATRIX_N * sizeof(float));
-
-
- printf("INITIAL_MATRIX_A\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_K;n++){
- a_host_wmma[m*MATRIX_K+n]= (rand()%3);///3.0;
- printf("%.2f ",a_host_wmma[m*MATRIX_K+n]);
- }
- printf("\n");
- }
- printf("INITIAL_MATRIX_B\n");
- for(int m=0;m<MATRIX_K;m++){
- for(int n=0;n<MATRIX_N;n++){
- b_host_wmma[m*MATRIX_N+n]=(rand()%3);///3.0;
- printf("%.2f ",b_host_wmma[m*MATRIX_K+n]);
- }
- printf("\n");
- }
- printf("INITIAL_MATRIX_C\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- c_host_wmma[m*MATRIX_N+n]= (rand()%3);///3.0;
- printf("%.2f ",c_host_wmma[m*MATRIX_K+n]);
- }
- printf("\n");
- }
-
- cudaErrCheck(cudaMemcpy(a_fp32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(float), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(b_fp32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice));
-
- convertFp32ToFp16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_fp16, a_fp32, MATRIX_M * MATRIX_K);
- convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N);
-
- cudaErrCheck(cudaMemcpy(c, c_host_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(c_wmma, c, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToDevice));
-
- float alpha = 1.0f;
- float beta = 1.0f;
-
-
- printf("\nM = %d, N = %d, K = %d. alpha = %f, beta = %f\n\n", MATRIX_M, MATRIX_N, MATRIX_K, alpha, beta);
-
- // First: using WMMA
- dim3 gridDim;
- dim3 blockDim;
-
- // blockDim.x must be a multple of warpSize
- // 128x4 means we have 16 warps and a block computes a 64x64 output tile
- blockDim.x = 64;
- blockDim.y = 2;
-
- gridDim.x = (MATRIX_M + (WMMA_M * blockDim.x / 32 - 1)) / (WMMA_M * blockDim.x / 32);
- gridDim.y = (MATRIX_N + WMMA_N * blockDim.y - 1) / (WMMA_N * blockDim.y);
- printf("GRID:X=%d,Y=%d\n",gridDim.x,gridDim.y);
- printf("BLOCK:X=%d,Y=%d\n",blockDim.x,blockDim.y);
-
- printf("Running with wmma...\n");
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example <<< gridDim, blockDim >>> (a_fp16, b_fp16, c_wmma, MATRIX_M, MATRIX_N, MATRIX_K, alpha, beta);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
-
- printf("\nChecking results...\n");
- cudaErrCheck(cudaMemcpy(d_host_wmma, c_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
-
- int t=200000000;
- while(t-->0);
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- printf("cal:d\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%.2f ",d_cal_host_wmma[m*MATRIX_K+n]);
- }
- printf("\n");
- }
- printf("wmma:d\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%.2f ",d_host_wmma[m*MATRIX_K+n]);
- }
- printf("\n");
- }
- int suc=1;
- float relative_error;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- relative_error=100*abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])/d_host_wmma[m*MATRIX_N+n];
- printf("relative_error=%f\n",relative_error);
- if((int)relative_error>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("ROW=%d,COL=%d:cpu=%f,gpgpusim=%f\n",m,n,d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("COMPLETED_SUCCESSFULLY\n");
-
- //int errors = 0;
- //for (int i = 0; i < MATRIX_M * MATRIX_N; i++) {
- // float v1 = c_host_wmma[i];
- // float v2 = c_host_cublas[i];
- // if (v1 / v2 > 1.0001 || v2 / v1 > 1.0001 || abs(v1 - v2) > 1e-5) {
- // errors++;
- // if (errors < 10) printf("%f %f\n", v1, v2);
- // }
- //}
-
- float wmmaTime;
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma took %fms\n", wmmaTime);
-
- cudaErrCheck(cudaEventDestroy(startWMMA));
- cudaErrCheck(cudaEventDestroy(stopWMMA));
- cudaErrCheck(cudaFree(a_fp32));
- cudaErrCheck(cudaFree(b_fp32));
- cudaErrCheck(cudaFree(a_fp16));
- cudaErrCheck(cudaFree(b_fp16));
- cudaErrCheck(cudaFree(c));
- cudaErrCheck(cudaFree(c_wmma));
- free(d_host_wmma);
- free(c_host_wmma);
- cudaErrCheck(cudaDeviceReset());
- return 0;
-}
-
-
diff --git a/cuda-kernels/genericMatrixMultiplyRow.cu b/cuda-kernels/genericMatrixMultiplyRow.cu
deleted file mode 100644
index 6194492..0000000
--- a/cuda-kernels/genericMatrixMultiplyRow.cu
+++ /dev/null
@@ -1,289 +0,0 @@
-/* Copyright (c) 1993-2017, NVIDIA CORPORATION. All rights reserved.
- *
- * Redistribution and use in source and binary forms, with or without
- * modification, are permitted provided that the following conditions
- * are met:
- * * Redistributions of source code must retain the above copyright
- * notice, this list of conditions and the following disclaimer.
- * * Redistributions in binary form must reproduce the above copyright
- * notice, this list of conditions and the following disclaimer in the
- * documentation and/or other materials provided with the distribution.
- * * Neither the name of NVIDIA CORPORATION nor the names of its
- * contributors may be used to endorse or promote products derived
- * from this software without specific prior written permission.
- *
- * THIS SOFTWARE IS PROVIDED BY THE COPYRIGHT HOLDERS ``AS IS'' AND ANY
- * EXPRESS OR IMPLIED WARRANTIES, INCLUDING, BUT NOT LIMITED TO, THE
- * IMPLIED WARRANTIES OF MERCHANTABILITY AND FITNESS FOR A PARTICULAR
- * PURPOSE ARE DISCLAIMED. IN NO EVENT SHALL THE COPYRIGHT OWNER OR
- * CONTRIBUTORS BE LIABLE FOR ANY DIRECT, INDIRECT, INCIDENTAL, SPECIAL,
- * EXEMPLARY, OR CONSEQUENTIAL DAMAGES (INCLUDING, BUT NOT LIMITED TO,
- * PROCUREMENT OF SUBSTITUTE GOODS OR SERVICES; LOSS OF USE, DATA, OR
- * PROFITS; OR BUSINESS INTERRUPTION) HOWEVER CAUSED AND ON ANY THEORY
- * OF LIABILITY, WHETHER IN CONTRACT, STRICT LIABILITY, OR TORT
- * (INCLUDING NEGLIGENCE OR OTHERWISE) ARISING IN ANY WAY OUT OF THE USE
- * OF THIS SOFTWARE, EVEN IF ADVISED OF THE POSSIBILITY OF SUCH DAMAGE.
- */
-
-#include <stdio.h>
-#include <stdlib.h>
-// Define some error checking macros.
-#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); }
-void cudaErrCheck_(cudaError_t stat, const char *file, int line) {
- if (stat != cudaSuccess) {
- fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line);
- }
-}
-
-
-#include <mma.h>
-using namespace nvcuda;
-
-// Must be multiples of 16 for wmma code to work
-#define MATRIX_M (32)
-#define MATRIX_N (32)
-#define MATRIX_K (32)
-
-
-
-// The only dimensions currently supported by WMMA
-const int WMMA_M = 16;
-const int WMMA_N = 16;
-const int WMMA_K = 16;
-
-__global__ void wmma_example(half *a, half *b, float *c, int M, int N, int K, float alpha, float beta) {
- // Leading dimensions. Packed with no transpositions.
- int lda = M;
- int ldb = K;
- int ldc = M;
-
- // Tile using a 2D grid
- int warpM = (blockIdx.x * blockDim.x + threadIdx.x) / warpSize;
- int warpN = (blockIdx.y * blockDim.y + threadIdx.y);
-
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> acc_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
-
- wmma::fill_fragment(acc_frag, 0.0f);
-
- // Loop over k
- for (int i = 0; i < K; i += WMMA_K) {
- int aRow = warpM * WMMA_M;
- int aCol = i;
-
- int bRow = i;
- int bCol = warpN * WMMA_N;
-
- // Bounds checking
- if (aRow < M && aCol < K && bRow < K && bCol < N) {
- // Load the inputs
- wmma::load_matrix_sync(a_frag, a + aRow * lda+ aCol , lda);
- wmma::load_matrix_sync(b_frag, b + bRow * ldb+ bCol , ldb);
-
- // Perform the matrix multiplication
- wmma::mma_sync(acc_frag, a_frag, b_frag, acc_frag);
-
- }
- }
-
- // Load in the current value of c, scale it by beta, and add this our result scaled by alpha
- int cRow = warpM * WMMA_M;
- int cCol = warpN * WMMA_N;
-
- if (cRow < M && cCol < N) {
- wmma::load_matrix_sync(c_frag, c + cRow*ldc + cCol , ldc, wmma::mem_row_major);
-
-
- for(int i=0; i < c_frag.num_elements; i++) {
- c_frag.x[i] = alpha * acc_frag.x[i] + beta * c_frag.x[i];
- }
-
- // Store the output
- wmma::store_matrix_sync(c + cRow *ldc + cCol , c_frag, ldc, wmma::mem_row_major);
- }
-}
-
-__global__ void convertFp32ToFp16 (half *out, float *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-
-int main(int argc, char* argv[]) {
- float *a_fp32;
- float *b_fp32;
- half *a_fp16;
- half *b_fp16;
-
- float *c;
- float *c_wmma;
-
- float *d_host_wmma;
- float *d_cal_host_wmma;
- float *a_host_wmma;
- float *b_host_wmma;
- float *c_host_wmma;
-
-
- cudaEvent_t startWMMA;
- cudaEvent_t stopWMMA;
-
-
- cudaErrCheck(cudaEventCreate(&startWMMA));
- cudaErrCheck(cudaEventCreate(&stopWMMA));
-
- // Use tensor cores
- cudaErrCheck(cudaMalloc((void**)&a_fp32, MATRIX_M * MATRIX_K * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&b_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&a_fp16, MATRIX_M * MATRIX_K * sizeof(half)));
- cudaErrCheck(cudaMalloc((void**)&b_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
-
- cudaErrCheck(cudaMalloc((void**)&c, MATRIX_M * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&c_wmma, MATRIX_M * MATRIX_N * sizeof(float)));
-
- d_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- d_cal_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- c_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- a_host_wmma = (float*)malloc(MATRIX_M * MATRIX_K * sizeof(float));
- b_host_wmma = (float*)malloc(MATRIX_K * MATRIX_N * sizeof(float));
-
-
- printf("INITIAL_MATRIX_A\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_K;n++){
- a_host_wmma[m*MATRIX_K+n]= (rand()%3);///3.0;
- printf("%.2f ",a_host_wmma[m*MATRIX_K+n]);
- }
- printf("\n");
- }
- printf("INITIAL_MATRIX_B\n");
- for(int m=0;m<MATRIX_K;m++){
- for(int n=0;n<MATRIX_N;n++){
- b_host_wmma[m*MATRIX_N+n]=(rand()%3);///3.0;
- printf("%.2f ",b_host_wmma[m*MATRIX_K+n]);
- }
- printf("\n");
- }
- printf("INITIAL_MATRIX_C\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- c_host_wmma[m*MATRIX_N+n]= (rand()%3);///3.0;
- printf("%.2f ",c_host_wmma[m*MATRIX_K+n]);
- }
- printf("\n");
- }
-
- cudaErrCheck(cudaMemcpy(a_fp32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(float), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(b_fp32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice));
-
- convertFp32ToFp16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_fp16, a_fp32, MATRIX_M * MATRIX_K);
- convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N);
-
- cudaErrCheck(cudaMemcpy(c, c_host_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(c_wmma, c, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToDevice));
-
- float alpha = 1.0f;
- float beta = 1.0f;
-
-
- printf("\nM = %d, N = %d, K = %d. alpha = %f, beta = %f\n\n", MATRIX_M, MATRIX_N, MATRIX_K, alpha, beta);
-
- // First: using WMMA
- dim3 gridDim;
- dim3 blockDim;
-
- // blockDim.x must be a multple of warpSize
- // 128x4 means we have 16 warps and a block computes a 64x64 output tile
- blockDim.x = 64;
- blockDim.y = 2;
-
- gridDim.x = (MATRIX_M + (WMMA_M * blockDim.x / 32 - 1)) / (WMMA_M * blockDim.x / 32);
- gridDim.y = (MATRIX_N + WMMA_N * blockDim.y - 1) / (WMMA_N * blockDim.y);
- printf("GRID:X=%d,Y=%d\n",gridDim.x,gridDim.y);
- printf("BLOCK:X=%d,Y=%d\n",blockDim.x,blockDim.y);
-
- printf("Running with wmma...\n");
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example <<< gridDim, blockDim >>> (a_fp16, b_fp16, c_wmma, MATRIX_M, MATRIX_N, MATRIX_K, alpha, beta);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
-
- printf("\nChecking results...\n");
- cudaErrCheck(cudaMemcpy(d_host_wmma, c_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
-
- int t=200000000;
- while(t-->0);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- printf("cal:d\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%.2f ",d_cal_host_wmma[m*MATRIX_K+n]);
- }
- printf("\n");
- }
- printf("wmma:d\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%.2f ",d_host_wmma[m*MATRIX_K+n]);
- }
- printf("\n");
- }
- int suc=1;
- float relative_error;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- relative_error=100*abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])/d_host_wmma[m*MATRIX_N+n];
- printf("relative_error=%f\n",relative_error);
- if((int)relative_error>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("ROW=%d,COL=%d:cpu=%f,gpgpusim=%f\n",m,n,d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("COMPLETED_SUCCESSFULLY\n");
-
- //int errors = 0;
- //for (int i = 0; i < MATRIX_M * MATRIX_N; i++) {
- // float v1 = c_host_wmma[i];
- // float v2 = c_host_cublas[i];
- // if (v1 / v2 > 1.0001 || v2 / v1 > 1.0001 || abs(v1 - v2) > 1e-5) {
- // errors++;
- // if (errors < 10) printf("%f %f\n", v1, v2);
- // }
- //}
-
- float wmmaTime;
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma took %fms\n", wmmaTime);
-
- cudaErrCheck(cudaEventDestroy(startWMMA));
- cudaErrCheck(cudaEventDestroy(stopWMMA));
- cudaErrCheck(cudaFree(a_fp32));
- cudaErrCheck(cudaFree(b_fp32));
- cudaErrCheck(cudaFree(a_fp16));
- cudaErrCheck(cudaFree(b_fp16));
- cudaErrCheck(cudaFree(c));
- cudaErrCheck(cudaFree(c_wmma));
- free(d_host_wmma);
- free(c_host_wmma);
- cudaErrCheck(cudaDeviceReset());
- return 0;
-}
-
-
diff --git a/cuda-kernels/gpgpusim.config b/cuda-kernels/gpgpusim.config
deleted file mode 100755
index 5f1be25..0000000
--- a/cuda-kernels/gpgpusim.config
+++ /dev/null
@@ -1,151 +0,0 @@
-# This config models the Pascal GP102 (GeForceGTX 1080Ti)
-
-# functional simulator specification
--gpgpu_ptx_instruction_classification 0
--gpgpu_ptx_sim_mode 0
--gpgpu_ptx_force_max_capability 70
-
-# SASS execution (only supported with CUDA >= 4.0)
--gpgpu_ptx_convert_to_ptxplus 0
--gpgpu_ptx_save_converted_ptxplus 0
-
-# high level architecture configuration
--gpgpu_n_clusters 80
--gpgpu_n_cores_per_cluster 1
--gpgpu_n_mem 11
--gpgpu_n_sub_partition_per_mchannel 2
-
-# Pascal clock domains
-#-gpgpu_clock_domains <Core Clock>:<Interconnect Clock>:<L2 Clock>:<DRAM Clock>
-# Pascal NVIDIA TITAN X clock domains are adopted from
-# https://en.wikipedia.org/wiki/GeForce_10_series
--gpgpu_clock_domains 1481.0:2962.0:1481.0:2750.0
-
-# shader core pipeline config
--gpgpu_shader_registers 65536
-
-# This implies a maximum of 64 warps/SM
--gpgpu_shader_core_pipeline 2048:32
--gpgpu_shader_cta 32
--gpgpu_simd_model 1
-
-# Pipeline widths and number of FUs
-# ID_OC_SP,ID_OC_SFU,ID_OC_MEM,OC_EX_SP,OC_EX_SFU,OC_EX_MEM,EX_WB
-## Pascal GP102 has 4 SP SIMD units and 1 SFU unit
-## we need to scale the number of pipeline registers to be equal to the number of SP units
--gpgpu_pipeline_widths 4,1,1,1,1,4,1,1,1,1,6
--gpgpu_num_sp_units 4
--gpgpu_num_sfu_units 1
-# Instruction latencies and initiation intervals
-# "ADD,MAX,MUL,MAD,DIV"
-# SFU is 32-width in pascal, then dp units initiation is 1 cycle
--ptx_opcode_latency_int 4,13,4,5,145,16,4
--ptx_opcode_initiation_int 1,2,2,2,8,16,4
--ptx_opcode_latency_fp 4,13,4,5,39
--ptx_opcode_initiation_fp 1,2,1,1,4
--ptx_opcode_latency_dp 8,19,8,8,330
--ptx_opcode_initiation_dp 1,2,1,1,130
-
-# <nsets>:<bsize>:<assoc>,<rep>:<wr>:<alloc>:<wr_alloc>:<set_index_fn>,<mshr>:<N>:<merge>,<mq>:**<fifo_entry>
-# ** Optional parameter - Required when mshr_type==Texture Fifo
-# Note: Hashing set index function (H) only applies to a set size of 32 or 64.
-# Pascal GP102 has 96KB Shared memory
-# Pascal GP102 has 64KB L1 cache
-# The default is to disable the L1 cache, unless cache modifieres is used
--gpgpu_cache:dl1 64:128:6,L:L:m:N:H,A:128:8,8
--gpgpu_shmem_size 98304
--gmem_skip_L1D 1
-
-# 64 sets, each 128 bytes 16-way for each memory sub partition (128 KB per memory sub partition). This gives 3MB L2 cache
--gpgpu_cache:dl2 64:128:16,L:B:m:W:L,A:1024:1024,4:0,32 # used to be 128:4
--gpgpu_cache:dl2_texture_only 0
-
-# 4 KB Inst.
--gpgpu_cache:il1 8:128:4,L:R:f:N:L,A:2:48,4
-# 48 KB Tex
--gpgpu_tex_cache:l1 16:128:24,L:R:m:N:L,F:128:4,128:2
-# 12 KB Const
--gpgpu_const_cache:l1 128:64:2,L:R:f:N:L,A:2:64,4
-
-# enable operand collector
-## larger operand collectors and reg_banks are needed for the 4 warp schedulers and 4 SIMD units
--gpgpu_operand_collector_num_units_sp 20
--gpgpu_operand_collector_num_units_sfu 4
-#-gpgpu_operand_collector_num_units_tensor_core 24
--gpgpu_operand_collector_num_units_mem 8
--gpgpu_operand_collector_num_in_ports_sp 4
--gpgpu_operand_collector_num_out_ports_sp 4
--gpgpu_operand_collector_num_in_ports_sfu 1
--gpgpu_operand_collector_num_out_ports_sfu 1
-#-gpgpu_operand_collector_num_in_ports_tensor_core 1
-#-gpgpu_operand_collector_num_out_ports_tensor_core 1
--gpgpu_operand_collector_num_in_ports_mem 10
--gpgpu_operand_collector_num_out_ports_mem 10
-# gpgpu_num_reg_banks should be increased to 32, but it gives an error!
--gpgpu_num_reg_banks 32
-
-# shared memory bankconflict detection
--gpgpu_shmem_num_banks 32
--gpgpu_shmem_limited_broadcast 0
--gpgpu_shmem_warp_parts 1
-
-## In Pascal, a warp scheduler can issue 2 insts per cycle
--gpgpu_max_insn_issue_per_warp 2
-
-# interconnection
--network_mode 1
--inter_config_file config_fermi_islip.icnt
-
-# memory partition latency config
--rop_latency 120
--dram_latency 100
-
-# dram model config
--gpgpu_dram_scheduler 1
-# The DRAM return queue and the scheduler queue together should provide buffer
-# to sustain the memory level parallelism to tolerate DRAM latency
-# To allow 100% DRAM utility, there should at least be enough buffer to sustain
-# the minimum DRAM latency (100 core cycles). I.e.
-# Total buffer space required = 100 x 924MHz / 700MHz = 132
--gpgpu_frfcfs_dram_sched_queue_size 64
--gpgpu_dram_return_queue_size 116
-
-# for NVIDIA GeForceGTX 1080Ti, bus width is 352bits (11 DRAM chips x 32 bits)
-# 11 memory paritions, 4 bytes (1 DRAM chip) per memory partition
-# the atom size of GDDR5X (the smallest read request) is 32 bytes
--gpgpu_n_mem_per_ctrlr 1
--gpgpu_dram_buswidth 4
--gpgpu_dram_burst_length 8
--dram_data_command_freq_ratio 4 # GDDR5X is QDR
--gpgpu_mem_address_mask 1
--gpgpu_mem_addr_mapping dramid@8;00000000.00000000.00000000.00000000.0000RRRR.RRRRRRRR.RBBBCCCC.BCCSSSSS
-
-# Use the same GDDR5 timing from hynix H5GQ1H24AFR
-# disable bank groups for now, set nbkgrp to 1 and tCCDL and tRTPL to 0
--gpgpu_dram_timing_opt "nbk=16:CCD=2:RRD=6:RCD=12:RAS=28:RP=12:RC=40:
- CL=12:WL=4:CDLR=5:WR=12:nbkgrp=1:CCDL=0:RTPL=0"
-
-# Pascal has four schedulers per core
--gpgpu_num_sched_per_core 2
-# Two Level Scheduler with active and pending pools
-#-gpgpu_scheduler two_level_active:6:0:1
-# Loose round robbin scheduler
-#-gpgpu_scheduler lrr
-# Greedy then oldest scheduler
--gpgpu_scheduler gto
-
-# stat collection
--gpgpu_memlatency_stat 14
--gpgpu_runtime_stat 500
--enable_ptx_file_line_stats 1
--visualizer_enabled 1
-
-# power model configs
--power_simulation_enabled 1
--gpuwattch_xml_file gpuwattch_gtx1080Ti.xml
-
-# tracing functionality
-#-trace_enabled 1
-#-trace_components WARP_SCHEDULER,SCOREBOARD
-#-trace_sampling_core 0
-
diff --git a/cuda-kernels/gpuwattch_gtx1080Ti.xml b/cuda-kernels/gpuwattch_gtx1080Ti.xml
deleted file mode 100755
index 02619ff..0000000
--- a/cuda-kernels/gpuwattch_gtx1080Ti.xml
+++ /dev/null
@@ -1,538 +0,0 @@
-<?xml version="1.0" ?>
-<component id="root" name="root">
- <component id="system" name="system">
- <!--McPAT will skip the components if number is set to 0 -->
- <param name="GPU_Architecture" value="1"/><!-- 0-G80; 1-Fermi; others not supported -->
- <param name="number_of_cores" value="28"/>
- <param name="architecture" value="1"/> <!-- fermi:1 quadro:2 other: undefined-->
- <param name="number_of_L1Directories" value="0"/>
- <param name="number_of_L2Directories" value="0"/>
- <param name="number_of_L2s" value="1"/> <!-- This number means how many L2 clusters in each cluster there can be multiple banks/ports -->
- <param name="number_of_L3s" value="0"/> <!-- This number means how many L3 clusters -->
- <param name="number_of_NoCs" value="1"/>
- <param name="homogeneous_cores" value="1"/><!--1 means homo -->
- <param name="homogeneous_L2s" value="1"/>
- <param name="homogeneous_L1Directorys" value="1"/>
- <param name="homogeneous_L2Directorys" value="1"/>
- <param name="homogeneous_L3s" value="1"/>
- <param name="homogeneous_ccs" value="1"/><!--cache coherece hardware -->
- <param name="homogeneous_NoCs" value="1"/>
- <param name="core_tech_node" value="23"/><!-- nm -->
- <param name="target_core_clockrate" value="1481"/><!--MHz -->
- <param name="temperature" value="380"/> <!-- Kelvin -->
- <param name="number_cache_levels" value="2"/>
- <param name="interconnect_projection_type" value="0"/><!--0: agressive wire technology; 1: conservative wire technology -->
- <param name="device_type" value="0"/><!--0: HP(High Performance Type); 1: LSTP(Low standby power) 2: LOP (Low Operating Power) -->
- <param name="longer_channel_device" value="1"/><!-- 0 no use; 1 use when possible -->
- <param name="machine_bits" value="32"/>
- <param name="virtual_address_width" value="32"/>
- <param name="physical_address_width" value="32"/>
- <param name="virtual_memory_page_size" value="4096"/>
- <param name="idle_core_power" value="1.59"/><!-- idle core power for GTX479 -->
- <!--param name="scaling_coefficients" value="10,0.0884816,10,10,8,10,4.12782,10,2.48832,10,10,10,4.29982,0.387764,0.0714269,0.14302,0.01,0.546811,0.485351,0.806633,0.818073,1.9207,100,100,100,87.9303,100,10,4.3548,10"/-->
- <param name="TOT_INST" value="10" />
- <param name="FP_INT" value="10" />
- <param name="IC_H" value="0.001" />
- <param name="IC_M" value="10" />
- <param name="DC_RH" value="1" />
- <param name="DC_RM" value="1" />
- <param name="DC_WH" value="1" />
- <param name="DC_WM" value="1" />
- <param name="TC_H" value="0.001" />
- <param name="TC_M" value="10" />
- <param name="CC_H" value="4.5071" />
- <param name="CC_M" value="10" />
- <param name="SHRD_ACC" value="10" />
- <param name="REG_RD" value="1.6294" />
- <param name="REG_WR" value="0.5031" />
- <param name="NON_REG_OPs" value="0.01" />
- <param name="SP_ACC" value="10" />
- <param name="SFU_ACC" value="0.0082" />
- <param name="FPU_ACC" value="0.4126" />
- <param name="MEM_RD" value="0.1234" />
- <param name="MEM_WR" value="0.001" />
- <param name="MEM_PRE" value="0.001" />
- <param name="L2_RH" value="100" />
- <param name="L2_RM" value="100" />
- <param name="L2_WH" value="100" />
- <param name="L2_WM" value="42.6966" />
- <param name="NOC_A" value="100" />
- <param name="PIPE_A" value="44.8085" />
- <param name="IDLE_CORE_N" value="2.0382"/>
- <param name="CONST_DYNAMICN" value="5.0005" />
- <stat name="num_idle_cores" value="0"/><!-- Average Number of idle cores during this period -->
- <stat name="total_cycles" value="total_cycles_match_mcpat"/>
- <stat name="idle_cycles" value="idle_cycles_match_mcpat"/>
- <stat name="busy_cycles" value="busy_cycles_match_mcpat"/>
- <!--This page size(B) is complete different from the page size in Main memo secction. this page size is the size of
- virtual memory from OS/Archi perspective; the page size in Main memo secction is the actuall physical line in a DRAM bank -->
- <!-- *********************** cores ******************* -->
- <component id="system.core0" name="core0">
- <!-- Core property -->
- <param name="clock_rate" value="1481"/>
- <param name="instruction_length" value="32"/>
- <param name="opcode_width" value="9"/>
- <!-- address width determins the tag_width in Cache, LSQ and buffers in cache controller
- default value is machine_bits, if not set -->
- <param name="machine_type" value="1"/><!-- 1 inorder; 0 OOO-->
- <!-- inorder/OoO -->
- <param name="number_hardware_threads" value="32"/>
- <!-- number_instruction_fetch_ports(icache ports) is always 1 in single-thread processor,
- it only may be more than one in SMT processors. BTB ports always equals to fetch ports since
- branch information in consective branch instructions in the same fetch group can be read out from BTB once.-->
- <param name="fetch_width" value="1"/>
- <!-- fetch_width determins the size of cachelines of L1 cache block -->
- <param name="number_instruction_fetch_ports" value="1"/>
- <param name="decode_width" value="1"/>
- <!-- decode_width determins the number of ports of the
- renaming table (both RAM and CAM) scheme -->
- <param name="issue_width" value="2"/>
- <!-- issue_width determins the number of ports of Issue window and other logic
- as in the complexity effective proccessors paper; issue_width==dispatch_width -->
- <param name="commit_width" value="2"/>
- <!-- commit_width determins the number of ports of register files -->
- <param name="fp_issue_width" value="1"/>
- <param name="prediction_width" value="0"/>
- <!-- number of branch instructions can be predicted simultannouesl-->
- <!-- Current version of McPAT does not distinguish int and floating point pipelines
- Theses parameters are reserved for future use.-->
- <param name="pipelines_per_core" value="1,1"/>
- <!--integer_pipeline and floating_pipelines, if the floating_pipelines is 0, then the pipeline is shared-->
- <param name="pipeline_depth" value="8,8"/>
- <!-- pipeline depth of int and fp, if pipeline is shared, the second number is the average cycles of fp ops -->
- <!-- issue and exe unit-->
- <param name="ALU_per_core" value="32"/>
- <!-- contains an adder, a shifter, and a logical unit -->
- <param name="MUL_per_core" value="4"/>
- <!-- For MUL and Div -->
- <param name="FPU_per_core" value="32"/>
- <!-- buffer between IF and ID stage -->
- <param name="instruction_buffer_size" value="1"/>
- <!-- buffer between ID and sche/exe stage -->
- <param name="decoded_stream_buffer_size" value="1"/>
- <param name="instruction_window_scheme" value="0"/><!-- 0 PHYREG based, 1 RSBASED-->
- <!-- McPAT support 2 types of OoO cores, RS based and physical reg based-->
- <param name="instruction_window_size" value="1"/>
- <param name="fp_instruction_window_size" value="1"/>
- <!-- the instruction issue Q as in Alpha 21264; The RS as in Intel P6 -->
- <param name="ROB_size" value="0"/>
- <!-- each in-flight instruction has an entry in ROB -->
- <!-- registers -->
- <!-- SM parameters Added by Syed Gilani -->
- <param name="rf_banks" value="32"/>
- <param name="simd_width" value="32"/>
- <param name="collector_units" value="32"/>
- <param name="core_clock_ratio" value="2"/>
- <param name="warp_size" value="32"/>
-
- <param name="archi_Regs_IRF_size" value="65536"/>
- <param name="archi_Regs_FRF_size" value="32"/>
- <!-- if OoO processor, phy_reg number is needed for renaming logic,
- renaming logic is for both integer and floating point insts. -->
- <param name="phy_Regs_IRF_size" value="32"/>
- <param name="phy_Regs_FRF_size" value="32"/>
- <!-- rename logic -->
- <param name="rename_scheme" value="0"/>
- <!-- can be RAM based(0) or CAM based(1) rename scheme
- RAM-based scheme will have free list, status table;
- CAM-based scheme have the valid bit in the data field of the CAM
- both RAM and CAM need RAM-based checkpoint table, checkpoint_depth=# of in_flight instructions;
- Detailed RAT Implementation see TR -->
- <param name="register_windows_size" value="0"/>
- <!-- how many windows in the windowed register file, sun processors;
- no register windowing is used when this number is 0 -->
- <!-- In OoO cores, loads and stores can be issued whether inorder(Pentium Pro) or (OoO)out-of-order(Alpha),
- They will always try to exeute out-of-order though. -->
- <param name="LSU_order" value="inorder"/>
- <param name="store_buffer_size" value="32"/>
- <!-- By default, in-order cores do not have load buffers -->
- <param name="load_buffer_size" value="32"/>
- <!-- number of ports refer to sustainable concurrent memory accesses -->
- <param name="memory_ports" value="2"/>
- <!-- max_allowed_in_flight_memo_instructions determins the # of ports of load and store buffer
- as well as the ports of Dcache which is connected to LSU -->
- <!-- dual-pumped Dcache can be used to save the extra read/write ports -->
- <param name="RAS_size" value="1"/>
- <!-- general stats, defines simulation periods;require total, idle, and busy cycles for senity check -->
- <!-- please note: if target architecture is X86, then all the instrucions refer to (fused) micro-ops -->
- <stat name="total_instructions" value="total_instructions_match_mcpat"/>
- <stat name="int_instructions" value="int_instruction_match_mcpat"/>
- <stat name="fp_instructions" value="flt_instruction_match_mcpat"/>
- <stat name="branch_instructions" value="branch_instruction_match_mcpat"/>
- <stat name="branch_mispredictions" value="0"/>
- <stat name="load_instructions" value="load_instruction_match_mcpat"/>
- <stat name="store_instructions" value="store_instruction_match_mcpat"/>
- <stat name="committed_instructions" value="total_instructions_match_mcpat"/>
- <stat name="committed_int_instructions" value="int_instruction_match_mcpat"/>
- <stat name="committed_fp_instructions" value="flt_instruction_match_mcpat"/>
- <stat name="pipeline_duty_cycle" value="0.6"/><!--<=1, runtime_ipc/peak_ipc; averaged for all cores if homogenous -->
- <!-- the following cycle stats are used for heterogeneouse cores only,
- please ignore them if homogeneouse cores -->
- <stat name="total_cycles" value="total_cycles_match_mcpat"/>
- <stat name="idle_cycles" value="idle_cycles_match_mcpat"/>
- <stat name="busy_cycles" value="busy_cycles_match_mcpat"/>
- <!-- instruction buffer stats -->
- <!-- ROB stats, both RS and Phy based OoOs have ROB
- performance simulator should capture the difference on accesses,
- otherwise, McPAT has to guess based on number of commited instructions. -->
- <stat name="ROB_reads" value="263886"/>
- <stat name="ROB_writes" value="263886"/>
- <!-- RAT accesses -->
- <stat name="rename_accesses" value="263886"/>
- <stat name="fp_rename_accesses" value="263886"/>
- <!-- decode and rename stage use this, should be total ic - nop -->
- <!-- Inst window stats -->
- <stat name="inst_window_reads" value="263886"/>
- <stat name="inst_window_writes" value="263886"/>
- <stat name="inst_window_wakeup_accesses" value="263886"/>
- <stat name="fp_inst_window_reads" value="263886"/>
- <stat name="fp_inst_window_writes" value="263886"/>
- <stat name="fp_inst_window_wakeup_accesses" value="263886"/>
- <!-- RF accesses -->
- <stat name="int_regfile_reads" value="int_register_read_access_match_mcpat"/>
- <stat name="float_regfile_reads" value="int_register_write_access_match_mcpat"/>
- <stat name="int_regfile_writes" value="float_register_read_access_match_mcpat"/>
- <stat name="float_regfile_writes" value="float_register_write_access_match_mcpat"/>
-
- <!-- The following stat is for operand collector power - Added by Syed -->
- <stat name="non_rf_operands" value="0"/>
-
- <!-- accesses to the working reg -->
- <stat name="function_calls" value="0"/>
- <stat name="context_switches" value="0"/> <!--not used in the McPAT -->
- <!-- Number of Windowes switches (number of function calls and returns)-->
- <!-- Alu stats by default, the processor has one FPU that includes the divider and
- multiplier. The fpu accesses should include accesses to multiplier and divider -->
- <stat name="ialu_accesses" value="ialu_accesses_match_mcpat"/>
- <stat name="fpu_accesses" value="fpu_accesses_match_mcpat"/>
- <stat name="mul_accesses" value="mul_accesses_match_mcpat"/>
- <stat name="cdb_alu_accesses" value="0"/>
- <stat name="cdb_mul_accesses" value="0"/>
- <stat name="cdb_fpu_accesses" value="0"/>
- <!-- multiple cycle accesses should be counted multiple times,
- otherwise, McPAT can use internal counter for different floating point instructions
- to get final accesses. But that needs detailed info for floating point inst mix -->
- <!-- currently the performance simulator should
- make sure all the numbers are final numbers,
- including the explicit read/write accesses,
- and the implicite accesses such as replacements and etc.
- Future versions of McPAT may be able to reason the implicite access
- based on param and stats of last level cache
- The same rule applies to all cache access stats too! -->
- <!-- following is AF for max power computation.
- Do not change them, unless you understand them-->
- <stat name="IFU_duty_cycle" value="0.25"/>
- <stat name="LSU_duty_cycle" value="0.25"/>
- <stat name="MemManU_I_duty_cycle" value="1"/>
- <stat name="MemManU_D_duty_cycle" value="0.25"/>
- <stat name="ALU_duty_cycle" value="0.9"/>
- <stat name="MUL_duty_cycle" value="0.5"/>
- <stat name="FPU_duty_cycle" value="1"/><!-- FPU numbers are already average -->
- <stat name="ALU_cdb_duty_cycle" value="0.9"/>
- <stat name="MUL_cdb_duty_cycle" value="0.5"/>
- <stat name="FPU_cdb_duty_cycle" value="15"/>
- <component id="system.core0.predictor" name="PBT">
- <!-- branch predictor; tournament predictor see Alpha implementation -->
- <param name="local_predictor_size" value="10,3"/>
- <param name="local_predictor_entries" value="1024"/>
- <param name="global_predictor_entries" value="4096"/>
- <param name="global_predictor_bits" value="2"/>
- <param name="chooser_predictor_entries" value="4096"/>
- <param name="chooser_predictor_bits" value="2"/>
- <!-- These parameters can be combined like below in next version
- <param name="load_predictor" value="10,3,1024"/>
- <param name="global_predictor" value="4096,2"/>
- <param name="predictor_chooser" value="4096,2"/>
- -->
- </component>
- <component id="system.core0.itlb" name="itlb">
- <param name="number_entries" value="1"/>
- <stat name="total_accesses" value="0"/>
- <stat name="total_misses" value="0"/>
- <stat name="conflicts" value="0"/>
- <!-- there is no write requests to itlb although writes happen to itlb after miss,
- which is actually a replacement -->
- </component>
- <component id="system.core0.icache" name="icache">
- <!-- there is no write requests to itlb although writes happen to it after miss,
- which is actually a replacement -->
- <param name="icache_config" value="16384,128,4,1,1,3,8,0"/>
- <!-- the parameters are capacity,block_width, associativity, bank, throughput w.r.t. core clock, latency w.r.t. core clock,output_width, cache policy -->
- <!-- cache_policy;//0 no write or write-though with non-write allocate;1 write-back with write-allocate -->
- <param name="buffer_sizes" value="16, 16, 16,0"/>
- <!-- cache controller buffer sizes: miss_buffer_size(MSHR),fill_buffer_size,prefetch_buffer_size,wb_buffer_size-->
- <stat name="read_accesses" value="total_instructions_match_mcpat"/>
- <stat name="read_misses" value="0"/>
- <stat name="conflicts" value="0"/>
- </component>
- <component id="system.core0.dtlb" name="dtlb">
- <param name="number_entries" value="1"/>
- <stat name="total_accesses" value="0"/>
- <stat name="total_misses" value="0"/>
- <stat name="conflicts" value="0"/>
- </component>
- <component id="system.core0.ccache" name="ccache">
- <!-- all the buffer related are optional -->
- <param name="ccache_config" value="16384,64,2,1,1,3,8,0"/>
- <param name="buffer_sizes" value="16, 16, 16, 0"/>
- <!-- cache controller buffer sizes: miss_buffer_size(MSHR),fill_buffer_size,prefetch_buffer_size,wb_buffer_size-->
- <stat name="read_accesses" value="ccache_read_accesses_match_mcpat"/>
- <stat name="write_accesses" value="0"/>
- <stat name="read_misses" value="ccache_read_misses_match_mcpat"/>
- <stat name="write_misses" value="0"/>
- <stat name="conflicts" value="0"/>
- </component>
- <component id="system.core0.tcache" name="tcache">
- <!-- all the buffer related are optional -->
- <param name="tcache_config" value="49152,128,8,1,1,3,8,0"/>
- <param name="buffer_sizes" value="16, 16, 16, 0"/>
- <!-- cache controller buffer sizes: miss_buffer_size(MSHR),fill_buffer_size,prefetch_buffer_size,wb_buffer_size-->
- <stat name="read_accesses" value="tcache_read_accesses_match_mcpat"/>
- <stat name="write_accesses" value="0"/>
- <stat name="read_misses" value="tcache_read_misses_match_mcpat"/>
- <stat name="write_misses" value="0"/>
- <stat name="conflicts" value="0"/>
- </component>
- <!--model the shared memory by mimicing dcache-->
- <component id="system.core0.sharedmemory" name="sharedmemory">
- <!-- all the buffer related are optional -->
- <param name="sharedmemory_config" value="98304,16,1,16,1,3,16,0"/>
- <!-- the parameters are capacity,block_width, associativity, bank, throughput w.r.t. core clock, latency w.r.t. core clock,output_width, cache policy -->
- <param name="buffer_sizes" value="16, 16, 16, 16"/>
- <!-- cache controller buffer sizes: miss_buffer_size(MSHR),fill_buffer_size,prefetch_buffer_size,wb_buffer_size-->
- <stat name="read_accesses" value="sharedmemory_read_access_match_mcpat"/>
- <stat name="write_accesses" value="sharedmemory_write_access_match_mcpat"/>
- <stat name="read_misses" value="0"/>
- <stat name="write_misses" value="0"/>
- <stat name="conflicts" value="0"/>
- </component>
- <component id="system.core0.dcache" name="dcache">
- <!-- all the buffer related are optional -->
- <param name="dcache_config" value="16384,32,4,1,1,3,8,0"/>
- <param name="buffer_sizes" value="16, 16, 16, 0"/>
- <!-- cache controller buffer sizes: miss_buffer_size(MSHR),fill_buffer_size,prefetch_buffer_size,wb_buffer_size-->
- <stat name="read_accesses" value="dcache_read_access_match_mcpat"/>
- <stat name="write_accesses" value="dcache_write_access_match_mcpat"/>
- <stat name="read_misses" value="dcache_read_miss_match_mcpat"/>
- <stat name="write_misses" value="dcache_write_miss_match_mcpat"/>
- <stat name="conflicts" value="0"/>
- </component>
- <component id="system.core0.BTB" name="BTB">
- <!-- all the buffer related are optional -->
- <param name="BTB_config" value="8192,4,2,1, 1,3"/>
- <!-- the parameters are capacity,block_width,associativity,bank, throughput w.r.t. core clock, latency w.r.t. core clock,-->
- </component>
- </component>
- <component id="system.L1Directory0" name="L1Directory0">
- <param name="Directory_type" value="0"/>
- <!--0 cam based shadowed tag. 1 directory cache -->
- <param name="Dir_config" value="2048,1,0,1, 4, 4,8"/>
- <!-- the parameters are capacity,block_width, associativity,bank, throughput w.r.t. core clock, latency w.r.t. core clock,-->
- <param name="buffer_sizes" value="8, 8, 8, 8"/>
- <!-- all the buffer related are optional -->
- <param name="clockrate" value="1400"/>
- <param name="ports" value="1,1,1"/>
- <!-- number of r, w, and rw search ports -->
- <param name="device_type" value="0"/>
- <!-- altough there are multiple access types,
- Performance simulator needs to cast them into reads or writes
- e.g. the invalidates can be considered as writes -->
- <stat name="read_accesses" value="800000"/>
- <stat name="write_accesses" value="27276"/>
- <stat name="read_misses" value="1632"/>
- <stat name="write_misses" value="183"/>
- <stat name="conflicts" value="20"/>
- <stat name="duty_cycle" value="0.45"/>
- </component>
- <component id="system.L2Directory0" name="L2Directory0">
- <param name="Directory_type" value="1"/>
- <!--0 cam based shadowed tag. 1 directory cache -->
- <param name="Dir_config" value="1048576,16,16,1,2, 100"/>
- <!-- the parameters are capacity,block_width, associativity,bank, throughput w.r.t. core clock, latency w.r.t. core clock,-->
- <param name="buffer_sizes" value="8, 8, 8, 8"/>
- <!-- all the buffer related are optional -->
- <param name="clockrate" value="1400"/>
- <param name="ports" value="1,1,1"/>
- <!-- number of r, w, and rw search ports -->
- <param name="device_type" value="0"/>
- <!-- altough there are multiple access types,
- Performance simulator needs to cast them into reads or writes
- e.g. the invalidates can be considered as writes -->
- <stat name="read_accesses" value="0"/>
- <stat name="write_accesses" value="0"/>
- <stat name="read_misses" value="0"/>
- <stat name="write_misses" value="0"/>
- <stat name="conflicts" value="0"/>
- <stat name="duty_cycle" value="0.45"/>
- </component>
- <component id="system.L20" name="L20">
- <!-- all the buffer related are optional -->
- <param name="L2_config" value="131072,128,16,1, 4,23, 64, 1"/>
- <!-- consider 4-way bank interleaving for Niagara 1 -->
- <!-- the parameters are capacity,block_width, associativity, bank, throughput w.r.t. core clock, latency w.r.t. core clock,output_width, cache policy -->
- <param name="buffer_sizes" value="16, 16, 16, 16"/>
- <!-- cache controller buffer sizes: miss_buffer_size(MSHR),fill_buffer_size,prefetch_buffer_size,wb_buffer_size-->
- <param name="clockrate" value="2962"/>
- <param name="ports" value="1,1,1"/>
- <!-- number of r, w, and rw ports -->
- <param name="device_type" value="0"/>
- <stat name="read_accesses" value="200000"/>
- <stat name="write_accesses" value="0"/>
- <stat name="read_misses" value="0"/>
- <stat name="write_misses" value="0"/>
- <stat name="conflicts" value="0"/>
- <stat name="duty_cycle" value="0.5"/>
- </component>
-
-<!--**********************************************************************-->
-<component id="system.L30" name="L30">
- <param name="L3_config" value="1048576,64,16,1, 2,100, 64,1"/>
- <!-- the parameters are capacity,block_width, associativity, bank, throughput w.r.t. core clock, latency w.r.t. core clock,output_width, cache policy -->
- <param name="clockrate" value="3500"/>
- <param name="ports" value="1,1,1"/>
- <!-- number of r, w, and rw ports -->
- <param name="device_type" value="0"/>
- <param name="buffer_sizes" value="16, 16, 16, 16"/>
- <!-- cache controller buffer sizes: miss_buffer_size(MSHR),fill_buffer_size,prefetch_buffer_size,wb_buffer_size-->
- <stat name="read_accesses" value="58824"/>
- <stat name="write_accesses" value="27276"/>
- <stat name="read_misses" value="1632"/>
- <stat name="write_misses" value="183"/>
- <stat name="conflicts" value="0"/>
- <stat name="duty_cycle" value="0.35"/>
- </component>
-
-
-<!--**********************************************************************-->
- <component id="system.NoC0" name="noc0">
- <param name="clockrate" value="700"/>
- <param name="type" value="1"/>
- <!-- 1 NoC, O bus -->
- <param name="horizontal_nodes" value="2"/>
- <param name="vertical_nodes" value="1"/>
- <param name="has_global_link" value="0"/>
- <!-- 1 has global link, 0 does not have global link -->
- <param name="link_throughput" value="1"/><!--w.r.t clock -->
- <param name="link_latency" value="1"/><!--w.r.t clock -->
- <!-- througput >= latency -->
- <!-- Router architecture -->
- <param name="input_ports" value="6"/>
- <param name="output_ports" value="6"/>
- <param name="virtual_channel_per_port" value="1"/>
- <!-- input buffer; in classic routers only input ports need buffers -->
- <param name="flit_bits" value="32"/>
- <param name="input_buffer_entries_per_vc" value="1"/><!--VCs within the same ports share input buffers whose size is propotional to the number of VCs-->
- <param name="chip_coverage" value="1"/>
- <!-- When multiple NOC present, one NOC will cover part of the whole chip. chip_coverage <=1 -->
- <stat name="total_accesses" value="0"/>
- <!-- This is the number of total accesses within the whole network not for each router -->
- <stat name="duty_cycle" value="0.6"/>
- </component>
-<!--**********************************************************************-->
-<!--**********************************************************************-->
-
- <component id="system.mem" name="mem">
- <!-- Main memory property -->
- <param name="mem_tech_node" value="23"/>
- <param name="device_clock" value="200"/><!--MHz, this is clock rate of the actual memory device, not the FSB -->
- <param name="peak_transfer_rate" value="3200"/><!--MB/S-->
- <param name="internal_prefetch_of_DRAM_chip" value="4"/>
- <!-- 2 for DDR, 4 for DDR2, 8 for DDR3...-->
- <!-- the device clock, peak_transfer_rate, and the internal prefetch decide the DIMM property -->
- <!-- above numbers can be easily found from Wikipedia -->
- <param name="capacity_per_channel" value="4096"/> <!-- MB -->
- <!-- capacity_per_Dram_chip=capacity_per_channel/number_of_dimms/number_ranks/Dram_chips_per_rank
- Current McPAT assumes single DIMMs are used.-->
- <param name="number_ranks" value="2"/>
- <param name="num_banks_of_DRAM_chip" value="6"/>
- <param name="Block_width_of_DRAM_chip" value="64"/> <!-- B -->
- <param name="output_width_of_DRAM_chip" value="8"/>
- <!--number of Dram_chips_per_rank=" 72/output_width_of_DRAM_chip-->
- <!--number of Dram_chips_per_rank=" 72/output_width_of_DRAM_chip-->
- <param name="page_size_of_DRAM_chip" value="8"/> <!-- 8 or 16 -->
- <param name="burstlength_of_DRAM_chip" value="8"/>
- <stat name="memory_accesses" value="1052"/>
- <stat name="memory_reads" value="1052"/>
- <stat name="memory_writes" value="1052"/>
- </component>
- <component id="system.mc" name="mc">
- <!-- Memeory controllers are for DDR(2,3...) DIMMs -->
- <!-- current version of McPAT uses published values for base parameters of memory controller
- improvments on MC will be added in later versions. -->
- <param name="type" value="0"/> <!-- 1: low power; 0 high performance -->
- <param name="mc_clock" value="1848"/><!--DIMM IO bus clock rate MHz DDR2-400 for Niagara 1-->
- <param name="peak_transfer_rate" value="29568"/><!--MB/S Syed: GTX 470 has 177.4GB/s mem transfer rate with 6 MCs -->
- <param name="block_size" value="64"/><!--B-->
- <param name="number_mcs" value="6"/><!-- 6 GDDR5 memory controllers -->
- <!-- current McPAT only supports homogeneous memory controllers -->
- <param name="memory_channels_per_mc" value="2"/>
- <param name="number_ranks" value="1"/>
- <param name="withPHY" value="0"/>
- <!-- # of ranks of each channel-->
- <param name="req_window_size_per_channel" value="16"/>
- <param name="IO_buffer_size_per_channel" value="16"/>
- <param name="databus_width" value="32"/>
- <param name="addressbus_width" value="32"/>
- <param name="PRT_entries" value="32"/>
- <!-- # of empirical DRAM model parameter -->
- <param name="dram_cmd_coeff" value="0"/>
- <param name="dram_act_coeff" value="0"/>
- <param name="dram_nop_coeff" value="0"/>
- <param name="dram_activity_coeff" value="0"/>
- <param name="dram_pre_coeff" value="3.8475e-8f"/>
- <param name="dram_rd_coeff" value="7.74707143e-8f"/>
- <param name="dram_wr_coeff" value="3.54664286e-8f"/>
- <param name="dram_req_coeff" value="0"/>
- <param name="dram_const_coeff" value="0"/>
-
- <!-- McPAT will add the control bus width to the addressbus width automatically -->
- <stat name="memory_accesses" value="memory_accesses_match_mcpat"/>
- <stat name="memory_reads" value="memory_reads_match_mcpat"/>
- <stat name="memory_writes" value="memory_writes_match_mcpat"/>
- <!-- McPAT does not track individual mc, instead, it takes the total accesses and calculate
- the average power per MC or per channel. This is sufficent for most application.
- Further trackdown can be easily added in later versions. -->
- </component>
-<!--**********************************************************************-->
- <component id="system.niu" name="niu">
- <!-- On chip 10Gb Ethernet NIC, including XAUI Phy and MAC controller -->
- <!-- For a minimum IP packet size of 84B at 10Gb/s, a new packet arrives every 67.2ns.
- the low bound of clock rate of a 10Gb MAC is 150Mhz -->
- <param name="type" value="0"/> <!-- 1: low power; 0 high performance -->
- <param name="clockrate" value="350"/>
- <param name="number_units" value="0"/> <!-- unlike PCIe and memory controllers, each Ethernet controller only have one port -->
- <stat name="duty_cycle" value="1.0"/> <!-- achievable max load <= 1.0 -->
- <stat name="total_load_perc" value="0.7"/> <!-- ratio of total achived load to total achivable bandwidth -->
- <!-- McPAT does not track individual nic, instead, it takes the total accesses and calculate
- the average power per nic or per channel. This is sufficent for most application. -->
- </component>
-<!--**********************************************************************-->
- <component id="system.pcie" name="pcie">
- <!-- On chip PCIe controller, including Phy-->
- <!-- For a minimum PCIe packet size of 84B at 8Gb/s per lane (PCIe 3.0), a new packet arrives every 84ns.
- the low bound of clock rate of a PCIe per lane logic is 120Mhz -->
- <param name="type" value="0"/> <!-- 1: low power; 0 high performance -->
- <param name="withPHY" value="1"/>
- <param name="clockrate" value="350"/>
- <param name="number_units" value="0"/>
- <param name="num_channels" value="8"/> <!-- 2 ,4 ,8 ,16 ,32 -->
- <stat name="duty_cycle" value="1.0"/> <!-- achievable max load <= 1.0 -->
- <stat name="total_load_perc" value="0.7"/> <!-- Percentage of total achived load to total achivable bandwidth -->
- <!-- McPAT does not track individual pcie controllers, instead, it takes the total accesses and calculate
- the average power per pcie controller or per channel. This is sufficent for most application. -->
- </component>
-<!--**********************************************************************-->
- <component id="system.flashc" name="flashc">
- <param name="number_flashcs" value="0"/>
- <param name="type" value="1"/> <!-- 1: low power; 0 high performance -->
- <param name="withPHY" value="1"/>
- <param name="peak_transfer_rate" value="200"/><!--Per controller sustainable reak rate MB/S -->
- <stat name="duty_cycle" value="1.0"/> <!-- achievable max load <= 1.0 -->
- <stat name="total_load_perc" value="0.7"/> <!-- Percentage of total achived load to total achivable bandwidth -->
- <!-- McPAT does not track individual flash controller, instead, it takes the total accesses and calculate
- the average power per fc or per channel. This is sufficent for most application -->
- </component>
-<!--**********************************************************************-->
-
- </component>
-</component>
diff --git a/cuda-kernels/scripts b/cuda-kernels/scripts
deleted file mode 100755
index a24fb72..0000000
--- a/cuda-kernels/scripts
+++ /dev/null
@@ -1,139 +0,0 @@
-#!/bin/bash
-nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp4_16 v4p_genericMatrixMultiply.cu -DSIZE=16
-nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp4_32 v4p_genericMatrixMultiply.cu -DSIZE=32
-nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp4_64 v4p_genericMatrixMultiply.cu -DSIZE=64
-nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp4_128 v4p_genericMatrixMultiply.cu -DSIZE=128
-nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp4_256 v4p_genericMatrixMultiply.cu -DSIZE=256
-./vp4_16>vp4_log16
-./vp4_32>vp4_log32
-./vp4_64>vp4_log64
-./vp4_128>vp4_log128
-./vp4_256>vp4_log256
-
-#grep "kernel_name.*convertInt32To" -A 589 vp4_log16 >vp4_16_summary
-#grep "kernel_name.*convertInt32To" -A 589 vp4_log32 >vp4_32_summary
-#grep "kernel_name.*convertInt32To" -A 589 vp4_log64 >vp4_64_summary
-#grep "kernel_name.*convertInt32To" -A 589 vp4_log128 >vp4_128_summary
-#grep "kernel_name.*convertInt32To" -A 589 vp4_log256 >vp4_256_summary
-###grep "kernel_name.*vp_example" -A 589 vp4_log16 >>vp4_16_summary
-###grep "kernel_name.*vp_example" -A 589 vp4_log32 >>vp4_32_summary
-###grep "kernel_name.*vp_example" -A 589 vp4_log64 >>vp4_64_summary
-#grep "kernel_name.*vp_example" -A 589 vp4_log128 >>vp4_128_summary
-#grep "kernel_name.*vp_example" -A 589 vp4_log256 >>vp4_256_summary
-
-
-nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp8_16 v8p_genericMatrixMultiply.cu -DSIZE=16
-nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp8_32 v8p_genericMatrixMultiply.cu -DSIZE=32
-nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp8_64 v8p_genericMatrixMultiply.cu -DSIZE=64
-nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp8_128 v8p_genericMatrixMultiply.cu -DSIZE=128
-nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp8_256 v8p_genericMatrixMultiply.cu -DSIZE=256
-./vp8_16 >vp8_log16
-./vp8_32 >vp8_log32
-./vp8_64 >vp8_log64
-./vp8_128>vp8_log128
-./vp8_256>vp8_log256
-
-#grep "kernel_name.*convertInt32To" -A 589 vp8_log16 >vp8_16_summary
-#grep "kernel_name.*convertInt32To" -A 589 vp8_log32 >vp8_32_summary
-#grep "kernel_name.*convertInt32To" -A 589 vp8_log64 >vp8_64_summary
-#grep "kernel_name.*convertInt32To" -A 589 vp8_log128 >vp8_128_summary
-#grep "kernel_name.*convertInt32To" -A 589 vp8_log256 >vp8_256_summary
-##grep "kernel_name.*vp_example" -A 589 vp8_log16 >>vp8_16_summary
-##grep "kernel_name.*vp_example" -A 589 vp8_log32 >>vp8_32_summary
-##grep "kernel_name.*vp_example" -A 589 vp8_log64 >>vp8_64_summary
-#grep "kernel_name.*vp_example" -A 589 vp8_log128 >>vp8_128_summary
-#grep "kernel_name.*vp_example" -A 589 vp8_log256 >>vp8_256_summary
-
-nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp16_16 v16p_genericMatrixMultiply.cu -DSIZE=16
-nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp16_32 v16p_genericMatrixMultiply.cu -DSIZE=32
-nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp16_64 v16p_genericMatrixMultiply.cu -DSIZE=64
-nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp16_128 v16p_genericMatrixMultiply.cu -DSIZE=128
-nvcc --gpu-architecture=compute_70 --gpu-code=compute_70 -lcudart -g -o vp16_256 v16p_genericMatrixMultiply.cu -DSIZE=256
-./vp16_16>vp16_log16
-./vp16_32>vp16_log32
-./vp16_64>vp16_log64
-./vp16_128>vp16_log128
-./vp16_256>vp16_log256
-
-#grep "kernel_name.*convertInt32To" -A 589 vp16_log16 >vp16_16_summary
-#grep "kernel_name.*convertInt32To" -A 589 vp16_log32 >vp16_32_summary
-#grep "kernel_name.*convertInt32To" -A 589 vp16_log64 >vp16_64_summary
-#grep "kernel_name.*convertInt32To" -A 589 vp16_log128 >vp16_128_summary
-#grep "kernel_name.*convertInt32To" -A 589 vp16_log256 >vp16_256_summary
-##grep "kernel_name.*vp_example" -A 589 vp16_log16 >>vp16_16_summary
-##grep "kernel_name.*vp_example" -A 589 vp16_log32 >>vp16_32_summary
-##grep "kernel_name.*vp_example" -A 589 vp16_log64 >>vp16_64_summary
-#grep "kernel_name.*vp_example" -A 589 vp16_log128 >>vp16_128_summary
-#grep "kernel_name.*vp_example" -A 589 vp16_log256 >>vp16_256_summary
-
-###sed -n '/bind.*to.*kernel.*vp_example/,$p' vp4_log16 > kernel_log_vp4_log16
-###sed -n '/bind.*to.*kernel.*vp_example/,$p' vp4_log32 > kernel_log_vp4_log32
-###sed -n '/bind.*to.*kernel.*vp_example/,$p' vp4_log64 > kernel_log_vp4_log64
-####sed -n '/bind.*to.*kernel.*vp_example/,$p' vp4_log128 > kernel_log_vp4_log128
-####sed -n '/bind.*to.*kernel.*vp_example/,$p' vp4_log256 > kernel_log_vp4_log256
-###sed -n '/bind.*to.*kernel.*vp_example/,$p' vp8_log16 > kernel_log_vp8_log16
-###sed -n '/bind.*to.*kernel.*vp_example/,$p' vp8_log32 > kernel_log_vp8_log32
-###sed -n '/bind.*to.*kernel.*vp_example/,$p' vp8_log64 > kernel_log_vp8_log64
-####sed -n '/bind.*to.*kernel.*vp_example/,$p' vp8_log128 > kernel_log_vp8_log128
-####sed -n '/bind.*to.*kernel.*vp_example/,$p' vp8_log256 > kernel_log_vp8_log256
-###sed -n '/bind.*to.*kernel.*vp_example/,$p' vp16_log16 > kernel_log_vp16_log16
-###sed -n '/bind.*to.*kernel.*vp_example/,$p' vp16_log32 > kernel_log_vp16_log32
-###sed -n '/bind.*to.*kernel.*vp_example/,$p' vp16_log64 > kernel_log_vp16_log64
-####sed -n '/bind.*to.*kernel.*vp_example/,$p' vp16_log128 > kernel_log_vp16_log128
-####sed -n '/bind.*to.*kernel.*vp_example/,$p' vp16_log256 > kernel_log_vp16_log256
-###
-###grep memtocore:Icnt kernel_log_vp4_log16>memtocore_vp4_log16
-###grep coretomem:Icnt kernel_log_vp4_log16>coretomem_vp4_log16
-###grep MEM_TXN kernel_log_vp4_log16> gen_mem_vp4_log16
-###grep memtocore:Icnt kernel_log_vp4_log32>memtocore_vp4_log32
-###grep coretomem:Icnt kernel_log_vp4_log32>coretomem_vp4_log32
-###grep MEM_TXN kernel_log_vp4_log32> gen_mem_vp4_log32
-###grep memtocore:Icnt kernel_log_vp4_log64>memtocore_vp4_log64
-###grep coretomem:Icnt kernel_log_vp4_log64>coretomem_vp4_log64
-###grep MEM_TXN kernel_log_vp4_log64> gen_mem_vp4_log64
-####grep memtocore:Icnt kernel_log_vp4_log128>memtocore_vp4_log128
-####grep coretomem:Icnt kernel_log_vp4_log128>coretomem_vp4_log128
-####grep MEM_TXN kernel_log_vp4_log128> gen_mem_vp4_log128
-####grep memtocore:Icnt kernel_log_vp4_log256>memtocore_vp4_log256
-####grep coretomem:Icnt kernel_log_vp4_log256>coretomem_vp4_log256
-####grep MEM_TXN kernel_log_vp4_log256> gen_mem_vp4_log256
-###
-###grep memtocore:Icnt kernel_log_vp8_log16>memtocore_vp8_log16
-###grep coretomem:Icnt kernel_log_vp8_log16>coretomem_vp8_log16
-###grep MEM_TXN kernel_log_vp8_log16> gen_mem_vp8_log16
-###grep memtocore:Icnt kernel_log_vp8_log32>memtocore_vp8_log32
-###grep coretomem:Icnt kernel_log_vp8_log32>coretomem_vp8_log32
-###grep MEM_TXN kernel_log_vp8_log32> gen_mem_vp8_log32
-###grep memtocore:Icnt kernel_log_vp8_log64>memtocore_vp8_log64
-###grep coretomem:Icnt kernel_log_vp8_log64>coretomem_vp8_log64
-###grep MEM_TXN kernel_log_vp8_log64> gen_mem_vp8_log64
-####grep memtocore:Icnt kernel_log_vp8_log128>memtocore_vp8_log128
-####grep coretomem:Icnt kernel_log_vp8_log128>coretomem_vp8_log128
-####grep MEM_TXN kernel_log_vp8_log128> gen_mem_vp8_log128
-####grep memtocore:Icnt kernel_log_vp8_log256>memtocore_vp8_log256
-####grep coretomem:Icnt kernel_log_vp8_log256>coretomem_vp8_log256
-####grep MEM_TXN kernel_log_vp8_log256> gen_mem_vp8_log256
-###
-###grep memtocore:Icnt kernel_log_vp16_log16>memtocore_vp16_log16
-###grep coretomem:Icnt kernel_log_vp16_log16>coretomem_vp16_log16
-###grep MEM_TXN kernel_log_vp16_log16> gen_mem_vp16_log16
-###grep memtocore:Icnt kernel_log_vp16_log32>memtocore_vp16_log32
-###grep coretomem:Icnt kernel_log_vp16_log32>coretomem_vp16_log32
-###grep MEM_TXN kernel_log_vp16_log32> gen_mem_vp16_log32
-###grep memtocore:Icnt kernel_log_vp16_log64>memtocore_vp16_log64
-###grep coretomem:Icnt kernel_log_vp16_log64>coretomem_vp16_log64
-###grep MEM_TXN kernel_log_vp16_log64> gen_mem_vp16_log64
-####grep memtocore:Icnt kernel_log_vp16_log128>memtocore_vp16_log128
-####grep coretomem:Icnt kernel_log_vp16_log128>coretomem_vp16_log128
-####grep MEM_TXN kernel_log_vp16_log128> gen_mem_vp16_log128
-####grep memtocore:Icnt kernel_log_vp16_log256>memtocore_vp16_log256
-####grep coretomem:Icnt kernel_log_vp16_log256>coretomem_vp16_log256
-####grep MEM_TXN kernel_log_vp16_log256> gen_mem_vp16_log256
-###
-###mv kernel_* MemTraffic/
-###mv memtocore* MemTraffic/
-###mv coretomem* MemTraffic/
-###mv gen_mem* MemTraffic/
-###
-###mv vp* VPlog/
-###make clean
diff --git a/cuda-kernels/tensor_core.cu b/cuda-kernels/tensor_core.cu
deleted file mode 100644
index b7090c4..0000000
--- a/cuda-kernels/tensor_core.cu
+++ /dev/null
@@ -1,245 +0,0 @@
-/* Copyright (c) 1993-2017, NVIDIA CORPORATION. All rights reserved.
- *
- * Redistribution and use in source and binary forms, with or without
- * modification, are permitted provided that the following conditions
- * are met:
- * * Redistributions of source code must retain the above copyright
- * notice, this list of conditions and the following disclaimer.
- * * Redistributions in binary form must reproduce the above copyright
- * notice, this list of conditions and the following disclaimer in the
- * documentation and/or other materials provided with the distribution.
- * * Neither the name of NVIDIA CORPORATION nor the names of its
- * contributors may be used to endorse or promote products derived
- * from this software without specific prior written permission.
- *
- * THIS SOFTWARE IS PROVIDED BY THE COPYRIGHT HOLDERS ``AS IS'' AND ANY
- * EXPRESS OR IMPLIED WARRANTIES, INCLUDING, BUT NOT LIMITED TO, THE
- * IMPLIED WARRANTIES OF MERCHANTABILITY AND FITNESS FOR A PARTICULAR
- * PURPOSE ARE DISCLAIMED. IN NO EVENT SHALL THE COPYRIGHT OWNER OR
- * CONTRIBUTORS BE LIABLE FOR ANY DIRECT, INDIRECT, INCIDENTAL, SPECIAL,
- * EXEMPLARY, OR CONSEQUENTIAL DAMAGES (INCLUDING, BUT NOT LIMITED TO,
- * PROCUREMENT OF SUBSTITUTE GOODS OR SERVICES; LOSS OF USE, DATA, OR
- * PROFITS; OR BUSINESS INTERRUPTION) HOWEVER CAUSED AND ON ANY THEORY
- * OF LIABILITY, WHETHER IN CONTRACT, STRICT LIABILITY, OR TORT
- * (INCLUDING NEGLIGENCE OR OTHERWISE) ARISING IN ANY WAY OUT OF THE USE
- * OF THIS SOFTWARE, EVEN IF ADVISED OF THE POSSIBILITY OF SUCH DAMAGE.
- */
-
-#include <stdio.h>
-
-// Define some error checking macros.
-#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); }
-void cudaErrCheck_(cudaError_t stat, const char *file, int line) {
- if (stat != cudaSuccess) {
- fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line);
- }
-}
-
-
-
-
-#include <mma.h>
-using namespace nvcuda;
-
-// Must be multiples of 16 for wmma code to work
-#define MATRIX_M (16)
-#define MATRIX_N (16)
-#define MATRIX_K (16)
-
-
-
-// The only dimensions currently supported by WMMA
-const int WMMA_M = 16;
-const int WMMA_N = 16;
-const int WMMA_K = 16;
-
-
-// Performs an MxNxK GEMM (C=alpha*A*B + beta*C) assuming:
-// 1) Matrices are packed in memory.
-// 2) M, N and K are multiples of 16.
-// 3) Neither A nor B are transposed.
-// Note: This is NOT a high performance example but is for demonstration purposes only
-// For a high performance code please use the GEMM provided in cuBLAS.
-__global__ void wmma_example(half *a, half *b, float *c, int M, int N, int K, float alpha, float beta) {
- unsigned int start_time=0,end_time=0;
- // Leading dimensions. Packed with no transpositions.
- start_time=clock();
- int lda = M;
- int ldb = K;
- int ldc = M;
-
- // Tile using a 2D grid/
- int warpM = (blockIdx.x * blockDim.x + threadIdx.x) / warpSize;
- int warpN = (blockIdx.y * blockDim.y + threadIdx.y);
-
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> acc_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
-
- wmma::fill_fragment(c_frag, 0.0f);
-
- int i=0;
- int aRow = warpM * WMMA_M;
- int bCol = warpN * WMMA_N;
- int aCol = i;
- int bRow = i;
-
-
- // Bounds checking
- if (aRow < M && aCol < K && bRow < K && bCol < N) {
- wmma::load_matrix_sync(a_frag, a+aRow+aCol*lda, lda);
- wmma::load_matrix_sync(b_frag, b+bRow*ldb+bCol, ldb);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
- //wmma::mma_sync(acc_frag, a_frag, b_frag, acc_frag);
- }
- int cRow = warpM * WMMA_M;
- int cCol = warpN * WMMA_N;
- wmma::store_matrix_sync(c + cRow + cCol * ldc, c_frag, ldc, wmma::mem_col_major);
- end_time=clock();
- printf("clock=%d",end_time-start_time);
-}
-
-__global__ void convertFp32ToFp16 (half *out, float *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-
-int main(int argc, char* argv[]) {
- float *a_fp32;
- float *b_fp32;
- half *a_fp16;
- half *b_fp16;
-
- float *c;
- float *c_cublas;
- float *c_wmma;
-
- float *c_host_cublas;
- float *c_host_wmma;
- float *a_host_wmma;
- float *b_host_wmma;
- float *c_init_host_wmma;
-
-
- cudaEvent_t startWMMA;
- cudaEvent_t stopWMMA;
-
-
- cudaErrCheck(cudaEventCreate(&startWMMA));
- cudaErrCheck(cudaEventCreate(&stopWMMA));
-
- // Use tensor cores
-
- cudaErrCheck(cudaMalloc((void**)&a_fp32, MATRIX_M * MATRIX_K * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&b_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&a_fp16, MATRIX_M * MATRIX_K * sizeof(half)));
- cudaErrCheck(cudaMalloc((void**)&b_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
-
- cudaErrCheck(cudaMalloc((void**)&c, MATRIX_M * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&c_wmma, MATRIX_M * MATRIX_N * sizeof(float)));
-
- c_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- c_init_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- a_host_wmma = (float*)malloc(MATRIX_M * MATRIX_K * sizeof(float));
- b_host_wmma = (float*)malloc(MATRIX_K * MATRIX_N * sizeof(float));
-
-// printf("a_fp32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_K;n++){
- a_host_wmma[m*MATRIX_K+n]=(m*MATRIX_K+n)%10;
- }
- //printf(";\n");
- }
-
- // printf("b_fp32\n");
- for(int m=0;m<MATRIX_K;m++){
- for(int n=0;n<MATRIX_N;n++){
- b_host_wmma[m*MATRIX_N+n]=(m*MATRIX_N+n)%10;
- // printf("%f ",b_host_wmma[m*MATRIX_N+n]);
- }
- // printf(";\n");
- }
- cudaErrCheck(cudaMemcpy(a_fp32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(float), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(b_fp32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice));
-
- // curand doesn't currently support fp16 so we generate in fp32 and convert to fp16.
- convertFp32ToFp16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_fp16, a_fp32, MATRIX_M * MATRIX_K);
- convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- c_init_host_wmma[m*MATRIX_N+n]=(m*MATRIX_M+n)%10;
- }
- }
- cudaErrCheck(cudaMemcpy(c, c_init_host_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(c_wmma, c, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToDevice));
-
- float alpha = 1.0f;
- float beta = 1.0f;
-
-
- printf("\nM = %d, N = %d, K = %d. alpha = %f, beta = %f\n\n", MATRIX_M, MATRIX_N, MATRIX_K, alpha, beta);
-
- // First: using WMMA
- dim3 gridDim;
- dim3 blockDim;
-
- // blockDim.x must be a multple of warpSize
- // 128x4 means we have 16 warps and a block computes a 64x64 output tile
- blockDim.x = 128;
- blockDim.y = 4;
-
- gridDim.x = (MATRIX_M + (WMMA_M * blockDim.x / 32 - 1)) / (WMMA_M * blockDim.x / 32);
- gridDim.y = (MATRIX_N + WMMA_N * blockDim.y - 1) / (WMMA_N * blockDim.y);
-
- printf("Running with wmma...\n");
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example <<< 1, 32>>> (a_fp16, b_fp16, c_wmma, MATRIX_M, MATRIX_N, MATRIX_K, alpha, beta);
- // wmma_example <<< gridDim, blockDim >>> (a_fp16, b_fp16, c_wmma, MATRIX_M, MATRIX_N, MATRIX_K, alpha, beta);
- cudaErrCheck(cudaEventRecord(stopWMMA));
-
-
-
-
- // Error checking
- printf("\nChecking results...\n");
- cudaErrCheck(cudaMemcpy(c_host_wmma, c_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- // printf("c_host\n");
- // for(int m=0;m<MATRIX_M;m++){
- //for(int n=0;n<MATRIX_N;n++){
- //printf("%f ",c_host_wmma[m*MATRIX_N+n]);
- //}
- //printf(";\n");
- // }
-
- float wmmaTime;
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma took %fms\n", wmmaTime);
- //printf("Clock=%d",stopWMMA-startWMMA);
- printf("\nFor a faster code using wmma you should check out the cudaTensorCoreGemm sample in the CUDA Toolkit.\nThis code was written as a demo only!\n\n");
-
-
- cudaErrCheck(cudaEventDestroy(startWMMA));
- cudaErrCheck(cudaEventDestroy(stopWMMA));
-
-
- cudaErrCheck(cudaFree(a_fp32));
- cudaErrCheck(cudaFree(b_fp32));
- cudaErrCheck(cudaFree(a_fp16));
- cudaErrCheck(cudaFree(b_fp16));
-
- cudaErrCheck(cudaFree(c));
- cudaErrCheck(cudaFree(c_wmma));
-
- free(c_host_wmma);
-
- cudaErrCheck(cudaDeviceReset());
- return 0;
-}
-
-
diff --git a/cuda-kernels/tensor_core_ptx b/cuda-kernels/tensor_core_ptx
deleted file mode 100644
index 36074cb..0000000
--- a/cuda-kernels/tensor_core_ptx
+++ /dev/null
@@ -1,171 +0,0 @@
-//
-// Generated by NVIDIA NVVM Compiler
-//
-// Compiler Build ID: CL-22781540
-// Cuda compilation tools, release 9.0, V9.0.176
-// Based on LLVM 3.4svn
-//
-
-.version 6.0
-.target sm_70
-.address_size 64
-
- // .globl _Z12wmma_exampleP6__halfS0_Pfiiiff
-.extern .func (.param .b32 func_retval0) vprintf
-(
- .param .b64 vprintf_param_0,
- .param .b64 vprintf_param_1
-)
-;
-.global .align 16 .b8 $str[9] = {99, 108, 111, 99, 107, 61, 37, 100, 0};
-
-.visible .entry _Z12wmma_exampleP6__halfS0_Pfiiiff(
- .param .u64 _Z12wmma_exampleP6__halfS0_Pfiiiff_param_0,
- .param .u64 _Z12wmma_exampleP6__halfS0_Pfiiiff_param_1,
- .param .u64 _Z12wmma_exampleP6__halfS0_Pfiiiff_param_2,
- .param .u32 _Z12wmma_exampleP6__halfS0_Pfiiiff_param_3,
- .param .u32 _Z12wmma_exampleP6__halfS0_Pfiiiff_param_4,
- .param .u32 _Z12wmma_exampleP6__halfS0_Pfiiiff_param_5,
- .param .f32 _Z12wmma_exampleP6__halfS0_Pfiiiff_param_6,
- .param .f32 _Z12wmma_exampleP6__halfS0_Pfiiiff_param_7
-)
-{
- .local .align 8 .b8 __local_depot0[8];
- .reg .b64 %SP;
- .reg .b64 %SPL;
- .reg .pred %p<6>;
- .reg .f32 %f<34>;
- .reg .b32 %r<38>;
- .reg .b64 %rd<18>;
-
-
- mov.u64 %rd17, __local_depot0;
- cvta.local.u64 %SP, %rd17;
- ld.param.u64 %rd1, [_Z12wmma_exampleP6__halfS0_Pfiiiff_param_0];
- ld.param.u64 %rd2, [_Z12wmma_exampleP6__halfS0_Pfiiiff_param_1];
- ld.param.u64 %rd3, [_Z12wmma_exampleP6__halfS0_Pfiiiff_param_2];
- ld.param.u32 %r4, [_Z12wmma_exampleP6__halfS0_Pfiiiff_param_3];
- ld.param.u32 %r7, [_Z12wmma_exampleP6__halfS0_Pfiiiff_param_4];
- ld.param.u32 %r5, [_Z12wmma_exampleP6__halfS0_Pfiiiff_param_5];
- // inline asm
- mov.u32 %r6, %clock;
- // inline asm
- mov.u32 %r8, %ntid.x;
- mov.u32 %r9, %ctaid.x;
- mov.u32 %r10, %tid.x;
- mad.lo.s32 %r11, %r8, %r9, %r10;
- mov.u32 %r12, WARP_SZ;
- div.u32 %r13, %r11, %r12;
- mov.u32 %r14, %ntid.y;
- mov.u32 %r15, %ctaid.y;
- mov.u32 %r16, %tid.y;
- mad.lo.s32 %r17, %r14, %r15, %r16;
- shl.b32 %r2, %r13, 4;
- shl.b32 %r3, %r17, 4;
- setp.lt.s32 %p1, %r2, %r4;
- setp.gt.s32 %p2, %r5, 0;
- and.pred %p3, %p1, %p2;
- setp.lt.s32 %p4, %r3, %r7;
- and.pred %p5, %p3, %p4;
- mov.f32 %f26, 0f00000000;
- mov.f32 %f27, %f26;
- mov.f32 %f28, %f26;
- mov.f32 %f29, %f26;
- mov.f32 %f30, %f26;
- mov.f32 %f31, %f26;
- mov.f32 %f32, %f26;
- mov.f32 %f33, %f26;
- @!%p5 bra BB0_2;
- bra.uni BB0_1;
-
-BB0_1:
- mul.wide.s32 %rd4, %r2, 2;
- add.s64 %rd5, %rd1, %rd4;
- wmma.load.a.sync.row.m16n16k16.f16 {%r18, %r19, %r20, %r21, %r22, %r23, %r24, %r25}, [%rd5], %r4;
- mul.wide.s32 %rd6, %r3, 2;
- add.s64 %rd7, %rd2, %rd6;
- wmma.load.b.sync.col.m16n16k16.f16 {%r26, %r27, %r28, %r29, %r30, %r31, %r32, %r33}, [%rd7], %r5;
- mov.f32 %f25, 0f00000000;
- wmma.mma.sync.row.col.m16n16k16.f32.f32 {%f33, %f32, %f31, %f30, %f29, %f28, %f27, %f26}, {%r18, %r19, %r20, %r21, %r22, %r23, %r24, %r25}, {%r26, %r27, %r28, %r29, %r30, %r31, %r32, %r33}, {%f25, %f25, %f25, %f25, %f25, %f25, %f25, %f25};
-
-BB0_2:
- add.u64 %rd8, %SP, 0;
- cvta.to.local.u64 %rd9, %rd8;
- mul.lo.s32 %r35, %r3, %r4;
- cvt.s64.s32 %rd10, %r35;
- cvt.s64.s32 %rd11, %r2;
- add.s64 %rd12, %rd10, %rd11;
- shl.b64 %rd13, %rd12, 2;
- add.s64 %rd14, %rd3, %rd13;
- wmma.store.d.sync.col.m16n16k16.f32 [%rd14], {%f33, %f32, %f31, %f30, %f29, %f28, %f27, %f26}, %r4;
- // inline asm
- mov.u32 %r34, %clock;
- // inline asm
- sub.s32 %r36, %r34, %r6;
- st.local.u32 [%rd9], %r36;
- mov.u64 %rd15, $str;
- cvta.global.u64 %rd16, %rd15;
- // Callseq Start 0
- {
- .reg .b32 temp_param_reg;
- // <end>}
- .param .b64 param0;
- st.param.b64 [param0+0], %rd16;
- .param .b64 param1;
- st.param.b64 [param1+0], %rd8;
- .param .b32 retval0;
- call.uni (retval0),
- vprintf,
- (
- param0,
- param1
- );
- ld.param.b32 %r37, [retval0+0];
-
- //{
- }// Callseq End 0
- ret;
-}
-
- // .globl _Z17convertFp32ToFp16P6__halfPfi
-.visible .entry _Z17convertFp32ToFp16P6__halfPfi(
- .param .u64 _Z17convertFp32ToFp16P6__halfPfi_param_0,
- .param .u64 _Z17convertFp32ToFp16P6__halfPfi_param_1,
- .param .u32 _Z17convertFp32ToFp16P6__halfPfi_param_2
-)
-{
- .reg .pred %p<2>;
- .reg .b16 %rs<2>;
- .reg .f32 %f<2>;
- .reg .b32 %r<6>;
- .reg .b64 %rd<9>;
-
-
- ld.param.u64 %rd1, [_Z17convertFp32ToFp16P6__halfPfi_param_0];
- ld.param.u64 %rd2, [_Z17convertFp32ToFp16P6__halfPfi_param_1];
- ld.param.u32 %r2, [_Z17convertFp32ToFp16P6__halfPfi_param_2];
- mov.u32 %r3, %ntid.x;
- mov.u32 %r4, %ctaid.x;
- mov.u32 %r5, %tid.x;
- mad.lo.s32 %r1, %r4, %r3, %r5;
- setp.ge.s32 %p1, %r1, %r2;
- @%p1 bra BB1_2;
-
- cvta.to.global.u64 %rd3, %rd2;
- mul.wide.s32 %rd4, %r1, 4;
- add.s64 %rd5, %rd3, %rd4;
- ld.global.f32 %f1, [%rd5];
- // inline asm
- { cvt.rn.f16.f32 %rs1, %f1;}
-
- // inline asm
- cvta.to.global.u64 %rd6, %rd1;
- mul.wide.s32 %rd7, %r1, 2;
- add.s64 %rd8, %rd6, %rd7;
- st.global.u16 [%rd8], %rs1;
-
-BB1_2:
- ret;
-}
-
-
diff --git a/cuda-kernels/tensorcore_layout_fp16_fp16.cu b/cuda-kernels/tensorcore_layout_fp16_fp16.cu
deleted file mode 100644
index c90874a..0000000
--- a/cuda-kernels/tensorcore_layout_fp16_fp16.cu
+++ /dev/null
@@ -1,892 +0,0 @@
-#include <stdio.h>
-#include <curand.h>
-#include <stdlib.h>
-// Define some error checking macros.
-#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); }
-void cudaErrCheck_(cudaError_t stat, const char *file, int line) {
- if (stat != cudaSuccess) {
- fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line);
- }
-}
-
-#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); }
-void curandErrCheck_(curandStatus_t stat, const char *file, int line) {
- if (stat != CURAND_STATUS_SUCCESS) {
- fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line);
- }
-}
-
-#include <mma.h>
-using namespace nvcuda;
-
-// Must be multiples of 16 for wmma code to work
-#define MATRIX_M (16)
-#define MATRIX_N (16)
-#define MATRIX_K (16)
-
-
-// The only dimensions currently supported by WMMA
-const int WMMA_M = 16;
-const int WMMA_N = 16;
-const int WMMA_K = 16;
-
-//wmma_example_dLayout_cLayout_bLayout_aLayout
-
-__global__ void wmma_example_col_col_col_col(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_col_col_row(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_col_row_col(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_col_row_row(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_row_col_col(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_row_col_row(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_row_row_col(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_row_row_row(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_row_col_col_col(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_col_col_row(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_col_row_col(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_col_row_row(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_row_col_col(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_row_col_row(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_row_row_col(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_row_row_row(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major);
-}
-
-__global__ void convertFp32ToFp16 (half *out, float *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-__global__ void convertFp16ToFp32 (float *out, half *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-
-int main(int argc, char* argv[]) {
- float *a_fp32;
- float *b_fp32;
- float *c_fp32;
- float *d_fp32;
-
- half *a_fp16;
- half *b_fp16;
- half *c_fp16;
- half *d_fp16;
-
- float *a_host_wmma;
- float *b_host_wmma;
- float *c_host_wmma;
- float *d_host_wmma;
- float *d_cal_host_wmma;
-
- cudaEvent_t startWMMA;
- cudaEvent_t stopWMMA;
-
- float wmmaTime;
-
- cudaErrCheck(cudaEventCreate(&startWMMA));
- cudaErrCheck(cudaEventCreate(&stopWMMA));
-
- // Use tensor cores
- cudaErrCheck(cudaMalloc((void**)&a_fp32, MATRIX_M * MATRIX_K * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&b_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&c_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&d_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&a_fp16, MATRIX_M * MATRIX_K * sizeof(half)));
- cudaErrCheck(cudaMalloc((void**)&b_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
- cudaErrCheck(cudaMalloc((void**)&c_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
- cudaErrCheck(cudaMalloc((void**)&d_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
-
-
- a_host_wmma = (float*)malloc(MATRIX_M * MATRIX_K * sizeof(float));
- b_host_wmma = (float*)malloc(MATRIX_K * MATRIX_N * sizeof(float));
- c_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- d_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- d_cal_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
-
- printf("a_fp32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_K;n++){
- a_host_wmma[m*MATRIX_K+n]=((rand()%9)/3.0);
- printf("%f ",a_host_wmma[m*MATRIX_K+n]);
- }
- printf(";\n");
- }
-
- printf("b_fp32\n");
- for(int m=0;m<MATRIX_K;m++){
- for(int n=0;n<MATRIX_N;n++){
- b_host_wmma[m*MATRIX_N+n]=((rand()%9)/3.0);
- printf("%f ",b_host_wmma[m*MATRIX_N+n]);
- }
- printf(";\n");
- }
-
- printf("c_fp32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- c_host_wmma[m*MATRIX_N+n]=((rand()%9)/3.0);
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- printf("%f ",c_host_wmma[m*MATRIX_N+n]);
- }
- printf(";\n");
- }
-
-
- cudaErrCheck(cudaMemcpy(a_fp32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(float), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(b_fp32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(c_fp32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice));
-
- convertFp32ToFp16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_fp16, a_fp32, MATRIX_M * MATRIX_K);
- convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N);
- convertFp32ToFp16 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (c_fp16, c_fp32, MATRIX_K * MATRIX_N);
-
- printf("\nM = %d, N = %d, K = %d. \n", MATRIX_M, MATRIX_N, MATRIX_K);
-
- int suc=1;
- printf("Running with wmma...\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_col_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:1 took %fms\n", wmmaTime);
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_COL_COL_COL_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_col_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:2 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_COL_COL_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_col_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:3 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_COL_ROW_COL_COMPLETED_SUCCESSFULLY\n");
-
-
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_col_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:4 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_COL_ROW_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_row_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:5 took %fms\n", wmmaTime);
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_ROW_COL_COL_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_row_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:6 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_ROW_COL_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_row_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:7 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_ROW_ROW_COL_COMPLETED_SUCCESSFULLY\n");
-
-
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_row_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:8 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_ROW_ROW_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_col_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:9 took %fms\n", wmmaTime);
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_COL_COL_COL_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_col_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:10 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_COL_COL_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_col_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:11 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_COL_ROW_COL_COMPLETED_SUCCESSFULLY\n");
-
-
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_col_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:12 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_COL_ROW_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_row_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:13 took %fms\n", wmmaTime);
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_ROW_COL_COL_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_row_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:14 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_ROW_COL_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_row_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:15 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_ROW_ROW_COL_COMPLETED_SUCCESSFULLY\n");
-
-
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_row_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:16 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_ROW_ROW_ROW_COMPLETED_SUCCESSFULLY\n");
-
-
-
- cudaErrCheck(cudaEventDestroy(startWMMA));
- cudaErrCheck(cudaEventDestroy(stopWMMA));
-
- cudaErrCheck(cudaFree(a_fp32));
- cudaErrCheck(cudaFree(b_fp32));
- cudaErrCheck(cudaFree(c_fp32));
- cudaErrCheck(cudaFree(d_fp32));
- cudaErrCheck(cudaFree(a_fp16));
- cudaErrCheck(cudaFree(b_fp16));
- cudaErrCheck(cudaFree(c_fp16));
- cudaErrCheck(cudaFree(d_fp16));
-
- free(a_host_wmma);
- free(b_host_wmma);
- free(c_host_wmma);
- free(d_host_wmma);
- cudaErrCheck(cudaDeviceReset());
- return 0;
-}
-
-
diff --git a/cuda-kernels/tensorcore_layout_fp16_fp32.cu b/cuda-kernels/tensorcore_layout_fp16_fp32.cu
deleted file mode 100644
index cd0bdf7..0000000
--- a/cuda-kernels/tensorcore_layout_fp16_fp32.cu
+++ /dev/null
@@ -1,892 +0,0 @@
-#include <stdio.h>
-#include <curand.h>
-#include <stdlib.h>
-// Define some error checking macros.
-#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); }
-void cudaErrCheck_(cudaError_t stat, const char *file, int line) {
- if (stat != cudaSuccess) {
- fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line);
- }
-}
-
-#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); }
-void curandErrCheck_(curandStatus_t stat, const char *file, int line) {
- if (stat != CURAND_STATUS_SUCCESS) {
- fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line);
- }
-}
-
-#include <mma.h>
-using namespace nvcuda;
-
-// Must be multiples of 16 for wmma code to work
-#define MATRIX_M (16)
-#define MATRIX_N (16)
-#define MATRIX_K (16)
-
-
-// The only dimensions currently supported by WMMA
-const int WMMA_M = 16;
-const int WMMA_N = 16;
-const int WMMA_K = 16;
-
-//wmma_example_dLayout_cLayout_bLayout_aLayout
-
-__global__ void wmma_example_col_col_col_col(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(d_frag,a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_col_col_row(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(d_frag,a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_col_row_col(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(d_frag,a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_col_row_row(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(d_frag,a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_row_col_col(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(d_frag,a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_row_col_row(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(d_frag,a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_row_row_col(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(d_frag,a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_row_row_row(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(d_frag,a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_row_col_col_col(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(d_frag,a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_col_col_row(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(d_frag,a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_col_row_col(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(d_frag,a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_col_row_row(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(d_frag,a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_row_col_col(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(d_frag,a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_row_col_row(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(d_frag,a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_row_row_col(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(d_frag,a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_row_row_row(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(d_frag,a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_row_major);
-}
-
-__global__ void convertFp32ToFp16 (half *out, float *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-__global__ void convertFp16ToFp32 (float *out, half *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-
-int main(int argc, char* argv[]) {
- float *a_fp32;
- float *b_fp32;
- float *c_fp32;
- float *d_fp32;
-
- half *a_fp16;
- half *b_fp16;
- half *c_fp16;
- half *d_fp16;
-
- float *a_host_wmma;
- float *b_host_wmma;
- float *c_host_wmma;
- float *d_host_wmma;
- float *d_cal_host_wmma;
-
- cudaEvent_t startWMMA;
- cudaEvent_t stopWMMA;
-
- float wmmaTime;
-
- cudaErrCheck(cudaEventCreate(&startWMMA));
- cudaErrCheck(cudaEventCreate(&stopWMMA));
-
- // Use tensor cores
- cudaErrCheck(cudaMalloc((void**)&a_fp32, MATRIX_M * MATRIX_K * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&b_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&c_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&d_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&a_fp16, MATRIX_M * MATRIX_K * sizeof(half)));
- cudaErrCheck(cudaMalloc((void**)&b_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
- cudaErrCheck(cudaMalloc((void**)&c_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
- cudaErrCheck(cudaMalloc((void**)&d_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
-
-
- a_host_wmma = (float*)malloc(MATRIX_M * MATRIX_K * sizeof(float));
- b_host_wmma = (float*)malloc(MATRIX_K * MATRIX_N * sizeof(float));
- c_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- d_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- d_cal_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
-
- printf("a_fp32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_K;n++){
- a_host_wmma[m*MATRIX_K+n]=((rand()%9)/3.0);
- printf("%f ",a_host_wmma[m*MATRIX_K+n]);
- }
- printf(";\n");
- }
-
- printf("b_fp32\n");
- for(int m=0;m<MATRIX_K;m++){
- for(int n=0;n<MATRIX_N;n++){
- b_host_wmma[m*MATRIX_N+n]=((rand()%9)/3.0);
- printf("%f ",b_host_wmma[m*MATRIX_N+n]);
- }
- printf(";\n");
- }
-
- printf("c_fp32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- c_host_wmma[m*MATRIX_N+n]=((rand()%9)/3.0);
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- printf("%f ",c_host_wmma[m*MATRIX_N+n]);
- }
- printf(";\n");
- }
-
-
- cudaErrCheck(cudaMemcpy(a_fp32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(float), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(b_fp32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(c_fp32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice));
-
- convertFp32ToFp16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_fp16, a_fp32, MATRIX_M * MATRIX_K);
- convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N);
- convertFp32ToFp16 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (c_fp16, c_fp32, MATRIX_K * MATRIX_N);
-
- printf("\nM = %d, N = %d, K = %d. \n", MATRIX_M, MATRIX_N, MATRIX_K);
-
- int suc=1;
- printf("Running with wmma...\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_col_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:1 took %fms\n", wmmaTime);
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_COL_COL_COL_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_col_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:2 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_COL_COL_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_col_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:3 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_COL_ROW_COL_COMPLETED_SUCCESSFULLY\n");
-
-
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_col_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:4 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_COL_ROW_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_row_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:5 took %fms\n", wmmaTime);
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_ROW_COL_COL_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_row_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:6 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_ROW_COL_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_row_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:7 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_ROW_ROW_COL_COMPLETED_SUCCESSFULLY\n");
-
-
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_row_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:8 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_ROW_ROW_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_col_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:9 took %fms\n", wmmaTime);
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_COL_COL_COL_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_col_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:10 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_COL_COL_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_col_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:11 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_COL_ROW_COL_COMPLETED_SUCCESSFULLY\n");
-
-
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_col_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:12 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_COL_ROW_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_row_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:13 took %fms\n", wmmaTime);
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_ROW_COL_COL_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_row_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:14 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_ROW_COL_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_row_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:15 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_ROW_ROW_COL_COMPLETED_SUCCESSFULLY\n");
-
-
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_row_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:16 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_ROW_ROW_COL_COMPLETED_SUCCESSFULLY\n");
-
-
-
- cudaErrCheck(cudaEventDestroy(startWMMA));
- cudaErrCheck(cudaEventDestroy(stopWMMA));
-
- cudaErrCheck(cudaFree(a_fp32));
- cudaErrCheck(cudaFree(b_fp32));
- cudaErrCheck(cudaFree(c_fp32));
- cudaErrCheck(cudaFree(d_fp32));
- cudaErrCheck(cudaFree(a_fp16));
- cudaErrCheck(cudaFree(b_fp16));
- cudaErrCheck(cudaFree(c_fp16));
- cudaErrCheck(cudaFree(d_fp16));
-
- free(a_host_wmma);
- free(b_host_wmma);
- free(c_host_wmma);
- free(d_host_wmma);
- cudaErrCheck(cudaDeviceReset());
- return 0;
-}
-
-
diff --git a/cuda-kernels/tensorcore_layout_fp32_fp32.cu b/cuda-kernels/tensorcore_layout_fp32_fp32.cu
deleted file mode 100644
index c901387..0000000
--- a/cuda-kernels/tensorcore_layout_fp32_fp32.cu
+++ /dev/null
@@ -1,876 +0,0 @@
-#include <stdio.h>
-#include <curand.h>
-#include <stdlib.h>
-// Define some error checking macros.
-#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); }
-void cudaErrCheck_(cudaError_t stat, const char *file, int line) {
- if (stat != cudaSuccess) {
- fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line);
- }
-}
-
-#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); }
-void curandErrCheck_(curandStatus_t stat, const char *file, int line) {
- if (stat != CURAND_STATUS_SUCCESS) {
- fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line);
- }
-}
-
-#include <mma.h>
-using namespace nvcuda;
-
-// Must be multiples of 16 for wmma code to work
-#define MATRIX_M (16)
-#define MATRIX_N (16)
-#define MATRIX_K (16)
-
-
-// The only dimensions currently supported by WMMA
-const int WMMA_M = 16;
-const int WMMA_N = 16;
-const int WMMA_K = 16;
-
-//wmma_example_dLayout_cLayout_bLayout_aLayout
-
-__global__ void wmma_example_col_col_col_col(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_col_col_row(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_col_row_col(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_col_row_row(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_row_col_col(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_row_col_row(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_row_row_col(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_col_row_row_row(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major);
-}
-__global__ void wmma_example_row_col_col_col(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_col_col_row(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_col_row_col(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_col_row_row(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_row_col_col(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_row_col_row(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_row_row_col(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major);
-}
-__global__ void wmma_example_row_row_row_row(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) {
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::row_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_row_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_row_major);
-}
-
-__global__ void convertFp32ToFp16 (half *out, float *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-__global__ void convertFp16ToFp32 (float *out, half *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-
-int main(int argc, char* argv[]) {
- float *a_fp32;
- float *b_fp32;
- float *c_fp32;
- float *d_fp32;
-
- half *a_fp16;
- half *b_fp16;
- // half *c_fp16;
- // half *d_fp16;
-
- float *a_host_wmma;
- float *b_host_wmma;
- float *c_host_wmma;
- float *d_host_wmma;
- float *d_cal_host_wmma;
-
- cudaEvent_t startWMMA;
- cudaEvent_t stopWMMA;
-
- float wmmaTime;
-
- cudaErrCheck(cudaEventCreate(&startWMMA));
- cudaErrCheck(cudaEventCreate(&stopWMMA));
-
- // Use tensor cores
- cudaErrCheck(cudaMalloc((void**)&a_fp32, MATRIX_M * MATRIX_K * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&b_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&c_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&d_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&a_fp16, MATRIX_M * MATRIX_K * sizeof(half)));
- cudaErrCheck(cudaMalloc((void**)&b_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
- //cudaErrCheck(cudaMalloc((void**)&c_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
- //cudaErrCheck(cudaMalloc((void**)&d_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
-
-
- a_host_wmma = (float*)malloc(MATRIX_M * MATRIX_K * sizeof(float));
- b_host_wmma = (float*)malloc(MATRIX_K * MATRIX_N * sizeof(float));
- c_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- d_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- d_cal_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
-
- printf("a_fp32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_K;n++){
- a_host_wmma[m*MATRIX_K+n]=((rand()%9)/3.0);
- printf("%f ",a_host_wmma[m*MATRIX_K+n]);
- }
- printf(";\n");
- }
-
- printf("b_fp32\n");
- for(int m=0;m<MATRIX_K;m++){
- for(int n=0;n<MATRIX_N;n++){
- b_host_wmma[m*MATRIX_N+n]=((rand()%9)/3.0);
- printf("%f ",b_host_wmma[m*MATRIX_N+n]);
- }
- printf(";\n");
- }
-
- printf("c_fp32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- c_host_wmma[m*MATRIX_N+n]=((rand()%9)/3.0);
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- printf("%f ",c_host_wmma[m*MATRIX_N+n]);
- }
- printf(";\n");
- }
-
-
- cudaErrCheck(cudaMemcpy(a_fp32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(float), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(b_fp32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(c_fp32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice));
-
- convertFp32ToFp16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_fp16, a_fp32, MATRIX_M * MATRIX_K);
- convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N);
- //convertFp32ToFp16 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (c_fp16, c_fp32, MATRIX_K * MATRIX_N);
-
- printf("\nM = %d, N = %d, K = %d. \n", MATRIX_M, MATRIX_N, MATRIX_K);
-
- int suc=1;
- printf("Running with wmma...\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_col_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:1 took %fms\n", wmmaTime);
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_COL_COL_COL_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_col_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:2 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_COL_COL_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_col_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:3 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_COL_ROW_COL_COMPLETED_SUCCESSFULLY\n");
-
-
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_col_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:4 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_COL_ROW_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_row_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:5 took %fms\n", wmmaTime);
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_ROW_COL_COL_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_row_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:6 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_ROW_COL_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_row_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:7 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_ROW_ROW_COL_COMPLETED_SUCCESSFULLY\n");
-
-
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_col_row_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:8 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[n*MATRIX_N+m]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[n*MATRIX_N+m]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[n*MATRIX_N+m]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_COL_ROW_ROW_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_col_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:9 took %fms\n", wmmaTime);
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_COL_COL_COL_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_col_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:10 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_COL_COL_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_col_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:11 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_COL_ROW_COL_COMPLETED_SUCCESSFULLY\n");
-
-
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_col_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:12 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[n*MATRIX_N+m];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_COL_ROW_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_row_col_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:13 took %fms\n", wmmaTime);
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_ROW_COL_COL_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_row_col_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:14 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[n*MATRIX_K+k];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_ROW_COL_ROW_COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_row_row_col <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:15 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[k*MATRIX_K+m]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_ROW_ROW_COL_COMPLETED_SUCCESSFULLY\n");
-
-
-
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example_row_row_row_row <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma_kernel:16 took %fms\n", wmmaTime);
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
- suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- printf("cpu=%f,gpgpusim=%f\n",d_cal_host_wmma[m*MATRIX_N+n],d_host_wmma[m*MATRIX_N+n]);
- }
- }
- }
- if(suc==1)
- printf("WMMA_CONFIG_ROW_ROW_ROW_COL_COMPLETED_SUCCESSFULLY\n");
-
-
-
- cudaErrCheck(cudaEventDestroy(startWMMA));
- cudaErrCheck(cudaEventDestroy(stopWMMA));
-
- cudaErrCheck(cudaFree(a_fp32));
- cudaErrCheck(cudaFree(b_fp32));
- cudaErrCheck(cudaFree(c_fp32));
- cudaErrCheck(cudaFree(d_fp32));
- cudaErrCheck(cudaFree(a_fp16));
- cudaErrCheck(cudaFree(b_fp16));
- //cudaErrCheck(cudaFree(c_fp16));
- //cudaErrCheck(cudaFree(d_fp16));
-
- free(a_host_wmma);
- free(b_host_wmma);
- free(c_host_wmma);
- free(d_host_wmma);
- cudaErrCheck(cudaDeviceReset());
- return 0;
-}
-
-
diff --git a/cuda-kernels/tensorcore_type16_16.cu b/cuda-kernels/tensorcore_type16_16.cu
deleted file mode 100644
index 2b93bf5..0000000
--- a/cuda-kernels/tensorcore_type16_16.cu
+++ /dev/null
@@ -1,217 +0,0 @@
-#include <stdio.h>
-#include <curand.h>
-
-// Define some error checking macros.
-#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); }
-void cudaErrCheck_(cudaError_t stat, const char *file, int line) {
- if (stat != cudaSuccess) {
- fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line);
- }
-}
-
-#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); }
-void curandErrCheck_(curandStatus_t stat, const char *file, int line) {
- if (stat != CURAND_STATUS_SUCCESS) {
- fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line);
- }
-}
-
-#include <mma.h>
-using namespace nvcuda;
-
-// Must be multiples of 16 for wmma code to work
-#define MATRIX_M (16)
-#define MATRIX_N (16)
-#define MATRIX_K (16)
-
-
-// The only dimensions currently supported by WMMA
-const int WMMA_M = 16;
-const int WMMA_N = 16;
-const int WMMA_K = 16;
-
-__global__ void wmma_example(half *a, half *b, half *c,half *d_fp16, int M, int N, int K) {
- //unsigned int start_time=0,end_time=0;
- //start_time=clock();
-
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major);
- //printf("clock=%d",end_time-start_time);
-}
-
-__global__ void convertFp32ToFp16 (half *out, float *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-__global__ void convertFp16ToFp32 (float *out, half *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-
-int main(int argc, char* argv[]) {
- float *a_fp32;
- float *b_fp32;
- float *c_fp32;
- float *d_fp32;
-
- half *a_fp16;
- half *b_fp16;
- half *c_fp16;
- half *d_fp16;
-
- float *a_host_wmma;
- float *b_host_wmma;
- float *c_host_wmma;
- float *d_host_wmma;
- float *d_cal_host_wmma;
-
- cudaEvent_t startWMMA;
- cudaEvent_t stopWMMA;
-
-
- cudaErrCheck(cudaEventCreate(&startWMMA));
- cudaErrCheck(cudaEventCreate(&stopWMMA));
-
- // Use tensor cores
- cudaErrCheck(cudaMalloc((void**)&a_fp32, MATRIX_M * MATRIX_K * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&b_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&c_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&d_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&a_fp16, MATRIX_M * MATRIX_K * sizeof(half)));
- cudaErrCheck(cudaMalloc((void**)&b_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
- cudaErrCheck(cudaMalloc((void**)&c_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
- cudaErrCheck(cudaMalloc((void**)&d_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
-
-
- a_host_wmma = (float*)malloc(MATRIX_M * MATRIX_K * sizeof(float));
- b_host_wmma = (float*)malloc(MATRIX_K * MATRIX_N * sizeof(float));
- c_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- d_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- d_cal_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
-
- //printf("a_fp32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_K;n++){
- a_host_wmma[m*MATRIX_K+n]=(m*MATRIX_K+n)%10;
- // printf("%f ",a_host_wmma[m*MATRIX_K+n]);
- }
- //printf(";\n");
- }
-
- //printf("b_fp32\n");
- for(int m=0;m<MATRIX_K;m++){
- for(int n=0;n<MATRIX_N;n++){
- b_host_wmma[m*MATRIX_N+n]=(m*MATRIX_N+n)%10;
- // printf("%f ",b_host_wmma[m*MATRIX_N+n]);
- }
- // printf(";\n");
- }
-
- //printf("c_fp32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- c_host_wmma[m*MATRIX_N+n]=(m*MATRIX_N+n)%10;
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- // printf("%f ",c_host_wmma[m*MATRIX_N+n]);
- }
- }
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
-
-
- cudaErrCheck(cudaMemcpy(a_fp32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(float), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(b_fp32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(c_fp32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice));
-
- convertFp32ToFp16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_fp16, a_fp32, MATRIX_M * MATRIX_K);
- convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N);
- convertFp32ToFp16 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (c_fp16, c_fp32, MATRIX_K * MATRIX_N);
-
- printf("\nM = %d, N = %d, K = %d. \n", MATRIX_M, MATRIX_N, MATRIX_K);
-
- printf("Running with wmma...\n");
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
-
- convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N);
- // Error checking
- printf("\nChecking results...\n");
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
-
- printf("Results verified: cublas and WMMA agree.\n\n");
- float wmmaTime;
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma took %fms\n", wmmaTime);
-
- cudaErrCheck(cudaEventDestroy(startWMMA));
- cudaErrCheck(cudaEventDestroy(stopWMMA));
-
- int t=200000;
- while(t-->0);
- printf("D_CALCULATED\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%.2f,",d_cal_host_wmma[m*MATRIX_N+n]);
- }
- printf("\n");
- }
- printf("D_WMMA\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%.2f,",d_host_wmma[m*MATRIX_N+n]);
- }
- printf("\n");
- }
- int suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- }
- }
- }
- if(suc==1)
- printf("COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaFree(a_fp32));
- cudaErrCheck(cudaFree(b_fp32));
- cudaErrCheck(cudaFree(c_fp32));
- cudaErrCheck(cudaFree(d_fp32));
- cudaErrCheck(cudaFree(a_fp16));
- cudaErrCheck(cudaFree(b_fp16));
- cudaErrCheck(cudaFree(c_fp16));
- cudaErrCheck(cudaFree(d_fp16));
-
- free(a_host_wmma);
- free(b_host_wmma);
- free(c_host_wmma);
- free(d_host_wmma);
- cudaErrCheck(cudaDeviceReset());
- return 0;
-}
-
-
diff --git a/cuda-kernels/tensorcore_type16_32.cu b/cuda-kernels/tensorcore_type16_32.cu
deleted file mode 100644
index 9ab86e1..0000000
--- a/cuda-kernels/tensorcore_type16_32.cu
+++ /dev/null
@@ -1,207 +0,0 @@
-#include <stdio.h>
-#include <curand.h>
-
-// Define some error checking macros.
-#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); }
-void cudaErrCheck_(cudaError_t stat, const char *file, int line) {
- if (stat != cudaSuccess) {
- fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line);
- }
-}
-
-#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); }
-void curandErrCheck_(curandStatus_t stat, const char *file, int line) {
- if (stat != CURAND_STATUS_SUCCESS) {
- fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line);
- }
-}
-
-#include <mma.h>
-using namespace nvcuda;
-
-// Must be multiples of 16 for wmma code to work
-#define MATRIX_M (16)
-#define MATRIX_N (16)
-#define MATRIX_K (16)
-
-
-// The only dimensions currently supported by WMMA
-const int WMMA_M = 16;
-const int WMMA_N = 16;
-const int WMMA_K = 16;
-
-__global__ void wmma_example(half *a, half *b, float *c,half *d_fp16, int M, int N, int K) {
- //unsigned int start_time=0,end_time=0;
- //start_time=clock();
-
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> d_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
-
-// for(int i=0; i < c_frag.num_elements; i++) {
-//// c_frag.x[i]=c_frag.x[i]+c_frag.x[i];
-// float temp=c_frag.x[i];
-// printf("THREAD%d:%d: %f \n",threadIdx.x,i,temp );
-// }
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- for(int i=0; i < c_frag.num_elements; i++) {
- d_frag.x[i]=c_frag.x[i];
- }
- wmma::store_matrix_sync(d_fp16, d_frag, N, wmma::mem_col_major);
- //printf("clock=%d",end_time-start_time);
-}
-
-__global__ void convertFp32ToFp16 (half *out, float *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-__global__ void convertFp16ToFp32 (float *out, half *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-
-int main(int argc, char* argv[]) {
- float *a_fp32;
- float *b_fp32;
- float *c_fp32;
- float *d_fp32;
-
- half *a_fp16;
- half *b_fp16;
- half *c_fp16;
- half *d_fp16;
-
- float *a_host_wmma;
- float *b_host_wmma;
- float *c_host_wmma;
- float *d_host_wmma;
- float *d_cal_host_wmma;
-
- cudaEvent_t startWMMA;
- cudaEvent_t stopWMMA;
-
-
- cudaErrCheck(cudaEventCreate(&startWMMA));
- cudaErrCheck(cudaEventCreate(&stopWMMA));
-
- // Use tensor cores
- cudaErrCheck(cudaMalloc((void**)&a_fp32, MATRIX_M * MATRIX_K * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&b_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&c_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&d_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&a_fp16, MATRIX_M * MATRIX_K * sizeof(half)));
- cudaErrCheck(cudaMalloc((void**)&b_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
- cudaErrCheck(cudaMalloc((void**)&c_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
- cudaErrCheck(cudaMalloc((void**)&d_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
-
-
- a_host_wmma = (float*)malloc(MATRIX_M * MATRIX_K * sizeof(float));
- b_host_wmma = (float*)malloc(MATRIX_K * MATRIX_N * sizeof(float));
- c_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- d_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- d_cal_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
-
- //printf("a_fp32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_K;n++){
- a_host_wmma[m*MATRIX_K+n]=(m*MATRIX_K+n)%10;
- // printf("%f ",a_host_wmma[m*MATRIX_K+n]);
- }
- //printf(";\n");
- }
-
- //printf("b_fp32\n");
- for(int m=0;m<MATRIX_K;m++){
- for(int n=0;n<MATRIX_N;n++){
- b_host_wmma[m*MATRIX_N+n]=(m*MATRIX_N+n)%10;
- // printf("%f ",b_host_wmma[m*MATRIX_N+n]);
- }
- // printf(";\n");
- }
-
- //printf("c_fp32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- c_host_wmma[m*MATRIX_N+n]=(m*MATRIX_N+n);
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- // printf("%f ",c_host_wmma[m*MATRIX_N+n]);
- }
- }
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
-
-
- cudaErrCheck(cudaMemcpy(a_fp32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(float), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(b_fp32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(c_fp32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice));
-
- convertFp32ToFp16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_fp16, a_fp32, MATRIX_M * MATRIX_K);
- convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N);
-
- printf("\nM = %d, N = %d, K = %d. \n", MATRIX_M, MATRIX_N, MATRIX_K);
-
- printf("Running with wmma...\n");
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp16 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
-
- convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N);
- // Error checking
- printf("\nChecking results...\n");
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
-
- printf("Results verified: cublas and WMMA agree.\n\n");
- float wmmaTime;
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma took %fms\n", wmmaTime);
-
- cudaErrCheck(cudaEventDestroy(startWMMA));
- cudaErrCheck(cudaEventDestroy(stopWMMA));
- int t=600000;
- while(t-->0);
-
- printf("D_WMMA\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%.2f,",d_host_wmma[m*MATRIX_N+n]);
- }
- printf("\n");
- }
- printf("Check the result by executing the kernel on volta\n");
- cudaErrCheck(cudaFree(a_fp32));
- cudaErrCheck(cudaFree(b_fp32));
- cudaErrCheck(cudaFree(c_fp32));
- cudaErrCheck(cudaFree(d_fp32));
- cudaErrCheck(cudaFree(a_fp16));
- cudaErrCheck(cudaFree(b_fp16));
- cudaErrCheck(cudaFree(c_fp16));
- cudaErrCheck(cudaFree(d_fp16));
-
- free(a_host_wmma);
- free(b_host_wmma);
- free(c_host_wmma);
- free(d_host_wmma);
- cudaErrCheck(cudaDeviceReset());
- return 0;
-}
-
-
diff --git a/cuda-kernels/tensorcore_type32_16.cu b/cuda-kernels/tensorcore_type32_16.cu
deleted file mode 100644
index c66d8f8..0000000
--- a/cuda-kernels/tensorcore_type32_16.cu
+++ /dev/null
@@ -1,218 +0,0 @@
-#include <stdio.h>
-#include <curand.h>
-
-// Define some error checking macros.
-#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); }
-void cudaErrCheck_(cudaError_t stat, const char *file, int line) {
- if (stat != cudaSuccess) {
- fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line);
- }
-}
-
-#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); }
-void curandErrCheck_(curandStatus_t stat, const char *file, int line) {
- if (stat != CURAND_STATUS_SUCCESS) {
- fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line);
- }
-}
-
-#include <mma.h>
-using namespace nvcuda;
-
-// Must be multiples of 16 for wmma code to work
-#define MATRIX_M (16)
-#define MATRIX_N (16)
-#define MATRIX_K (16)
-
-
-// The only dimensions currently supported by WMMA
-const int WMMA_M = 16;
-const int WMMA_N = 16;
-const int WMMA_K = 16;
-
-__global__ void wmma_example(half *a, half *b, half *c,float *d_fp32, int M, int N, int K) {
- //unsigned int start_time=0,end_time=0;
- //start_time=clock();
-
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, half> c_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> d_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(d_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp32, d_frag, N, wmma::mem_col_major);
- //printf("clock=%d",end_time-start_time);
-}
-
-__global__ void convertFp32ToFp16 (half *out, float *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-__global__ void convertFp16ToFp32 (float *out, half *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-
-int main(int argc, char* argv[]) {
- float *a_fp32;
- float *b_fp32;
- float *c_fp32;
- float *d_fp32;
-
- half *a_fp16;
- half *b_fp16;
- half *c_fp16;
- half *d_fp16;
-
- float *a_host_wmma;
- float *b_host_wmma;
- float *c_host_wmma;
- float *d_host_wmma;
- float *d_cal_host_wmma;
-
- cudaEvent_t startWMMA;
- cudaEvent_t stopWMMA;
-
-
- cudaErrCheck(cudaEventCreate(&startWMMA));
- cudaErrCheck(cudaEventCreate(&stopWMMA));
-
- // Use tensor cores
- cudaErrCheck(cudaMalloc((void**)&a_fp32, MATRIX_M * MATRIX_K * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&b_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&c_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&d_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&a_fp16, MATRIX_M * MATRIX_K * sizeof(half)));
- cudaErrCheck(cudaMalloc((void**)&b_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
- cudaErrCheck(cudaMalloc((void**)&c_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
- cudaErrCheck(cudaMalloc((void**)&d_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
-
-
- a_host_wmma = (float*)malloc(MATRIX_M * MATRIX_K * sizeof(float));
- b_host_wmma = (float*)malloc(MATRIX_K * MATRIX_N * sizeof(float));
- c_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- d_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- d_cal_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
-
- //printf("a_fp32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_K;n++){
- a_host_wmma[m*MATRIX_K+n]=(m*MATRIX_K+n)%10;
- // printf("%f ",a_host_wmma[m*MATRIX_K+n]);
- }
- //printf(";\n");
- }
-
- //printf("b_fp32\n");
- for(int m=0;m<MATRIX_K;m++){
- for(int n=0;n<MATRIX_N;n++){
- b_host_wmma[m*MATRIX_N+n]=(m*MATRIX_N+n)%10;
- // printf("%f ",b_host_wmma[m*MATRIX_N+n]);
- }
- // printf(";\n");
- }
-
- //printf("c_fp32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- c_host_wmma[m*MATRIX_N+n]=(m*MATRIX_N+n)%10;
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- // printf("%f ",c_host_wmma[m*MATRIX_N+n]);
- }
- }
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
-
-
- cudaErrCheck(cudaMemcpy(a_fp32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(float), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(b_fp32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(c_fp32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice));
-
- convertFp32ToFp16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_fp16, a_fp32, MATRIX_M * MATRIX_K);
- convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N);
- convertFp32ToFp16 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (c_fp16, c_fp32, MATRIX_K * MATRIX_N);
-
- printf("\nM = %d, N = %d, K = %d. \n", MATRIX_M, MATRIX_N, MATRIX_K);
-
- printf("Running with wmma...\n");
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example <<< 1, 32>>> (a_fp16, b_fp16, c_fp16, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
-
- //convertFp16ToFp32 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (d_fp32, d_fp16, MATRIX_K * MATRIX_N);
- // Error checking
- printf("\nChecking results...\n");
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
-
- printf("Results verified: cublas and WMMA agree.\n\n");
- float wmmaTime;
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma took %fms\n", wmmaTime);
-
- cudaErrCheck(cudaEventDestroy(startWMMA));
- cudaErrCheck(cudaEventDestroy(stopWMMA));
-
- int t=600000;
- while(t-->0);
- printf("D_CALCULATED\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%.2f,",d_cal_host_wmma[m*MATRIX_N+n]);
- }
- printf("\n");
- }
- printf("D_WMMA\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%.2f,",d_host_wmma[m*MATRIX_N+n]);
- }
- printf("\n");
- }
- int suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- }
- }
- }
- if(suc==1)
- printf("COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaFree(a_fp32));
- cudaErrCheck(cudaFree(b_fp32));
- cudaErrCheck(cudaFree(c_fp32));
- cudaErrCheck(cudaFree(d_fp32));
- cudaErrCheck(cudaFree(a_fp16));
- cudaErrCheck(cudaFree(b_fp16));
- cudaErrCheck(cudaFree(c_fp16));
- cudaErrCheck(cudaFree(d_fp16));
-
- free(a_host_wmma);
- free(b_host_wmma);
- free(c_host_wmma);
- free(d_host_wmma);
- cudaErrCheck(cudaDeviceReset());
- return 0;
-}
-
-
diff --git a/cuda-kernels/tensorcore_type32_32.cu b/cuda-kernels/tensorcore_type32_32.cu
deleted file mode 100644
index 73386f9..0000000
--- a/cuda-kernels/tensorcore_type32_32.cu
+++ /dev/null
@@ -1,217 +0,0 @@
-#include <stdio.h>
-#include <curand.h>
-
-// Define some error checking macros.
-#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); }
-void cudaErrCheck_(cudaError_t stat, const char *file, int line) {
- if (stat != cudaSuccess) {
- fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line);
- }
-}
-
-#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); }
-void curandErrCheck_(curandStatus_t stat, const char *file, int line) {
- if (stat != CURAND_STATUS_SUCCESS) {
- fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line);
- }
-}
-
-#include <mma.h>
-using namespace nvcuda;
-
-// Must be multiples of 16 for wmma code to work
-#define MATRIX_M (16)
-#define MATRIX_N (16)
-#define MATRIX_K (16)
-
-
-// The only dimensions currently supported by WMMA
-const int WMMA_M = 16;
-const int WMMA_N = 16;
-const int WMMA_K = 16;
-
-__global__ void wmma_example(half *a, half *b, float *c,float *d_fp16, int M, int N, int K) {
- //unsigned int start_time=0,end_time=0;
- //start_time=clock();
-
- // Declare the fragments
- wmma::fragment<wmma::matrix_a, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> a_frag;
- wmma::fragment<wmma::matrix_b, WMMA_M, WMMA_N, WMMA_K, half, wmma::col_major> b_frag;
- wmma::fragment<wmma::accumulator, WMMA_M, WMMA_N, WMMA_K, float> c_frag;
-
- // Bounds checking
- wmma::load_matrix_sync(a_frag, a, K);
- wmma::load_matrix_sync(b_frag, b, K);
- wmma::load_matrix_sync(c_frag, c, N,wmma::mem_col_major);
- wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);
-
- wmma::store_matrix_sync(d_fp16, c_frag, N, wmma::mem_col_major);
- //printf("clock=%d",end_time-start_time);
-}
-
-__global__ void convertFp32ToFp16 (half *out, float *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-__global__ void convertFp16ToFp32 (float *out, half *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-
-int main(int argc, char* argv[]) {
- float *a_fp32;
- float *b_fp32;
- float *c_fp32;
- float *d_fp32;
-
- half *a_fp16;
- half *b_fp16;
- // half *c_fp16;
- // half *d_fp16;
-
- float *a_host_wmma;
- float *b_host_wmma;
- float *c_host_wmma;
- float *d_host_wmma;
- float *d_cal_host_wmma;
-
- cudaEvent_t startWMMA;
- cudaEvent_t stopWMMA;
-
-
- cudaErrCheck(cudaEventCreate(&startWMMA));
- cudaErrCheck(cudaEventCreate(&stopWMMA));
-
- // Use tensor cores
- cudaErrCheck(cudaMalloc((void**)&a_fp32, MATRIX_M * MATRIX_K * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&b_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&c_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&d_fp32, MATRIX_K * MATRIX_N * sizeof(float)));
- cudaErrCheck(cudaMalloc((void**)&a_fp16, MATRIX_M * MATRIX_K * sizeof(half)));
- cudaErrCheck(cudaMalloc((void**)&b_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
- //cudaErrCheck(cudaMalloc((void**)&c_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
- //cudaErrCheck(cudaMalloc((void**)&d_fp16, MATRIX_K * MATRIX_N * sizeof(half)));
-
-
- a_host_wmma = (float*)malloc(MATRIX_M * MATRIX_K * sizeof(float));
- b_host_wmma = (float*)malloc(MATRIX_K * MATRIX_N * sizeof(float));
- c_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- d_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
- d_cal_host_wmma = (float*)malloc(MATRIX_M * MATRIX_N * sizeof(float));
-
- //printf("a_fp32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_K;n++){
- a_host_wmma[m*MATRIX_K+n]=(m*MATRIX_K+n)%10;
- // printf("%f ",a_host_wmma[m*MATRIX_K+n]);
- }
- //printf(";\n");
- }
-
- //printf("b_fp32\n");
- for(int m=0;m<MATRIX_K;m++){
- for(int n=0;n<MATRIX_N;n++){
- b_host_wmma[m*MATRIX_N+n]=(m*MATRIX_N+n)%10;
- // printf("%f ",b_host_wmma[m*MATRIX_N+n]);
- }
- // printf(";\n");
- }
-
- //printf("c_fp32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- c_host_wmma[m*MATRIX_N+n]=(m*MATRIX_N+n)%10;
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- // printf("%f ",c_host_wmma[m*MATRIX_N+n]);
- }
- }
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
-
-
- cudaErrCheck(cudaMemcpy(a_fp32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(float), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(b_fp32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(c_fp32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyHostToDevice));
-
- convertFp32ToFp16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_fp16, a_fp32, MATRIX_M * MATRIX_K);
- convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N);
- //convertFp32ToFp16 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (c_fp16, c_fp32, MATRIX_K * MATRIX_N);
-
- printf("\nM = %d, N = %d, K = %d. \n", MATRIX_M, MATRIX_N, MATRIX_K);
-
- printf("Running with wmma...\n");
- cudaErrCheck(cudaEventRecord(startWMMA));
- wmma_example <<< 1, 32>>> (a_fp16, b_fp16, c_fp32, d_fp32 , MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
-
- // Error checking
- printf("\nChecking results...\n");
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_fp32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
-
- printf("Results verified: cublas and WMMA agree.\n\n");
- float wmmaTime;
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma took %fms\n", wmmaTime);
-
- cudaErrCheck(cudaEventDestroy(startWMMA));
- cudaErrCheck(cudaEventDestroy(stopWMMA));
-
- int t=200000;
- while(t-->0);
- printf("D_CALCULATED\n");
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%.2f,",d_cal_host_wmma[m*MATRIX_N+n]);
- }
- printf("\n");
- }
- printf("D_WMMA\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%.2f,",d_host_wmma[m*MATRIX_N+n]);
- }
- printf("\n");
- }
- int suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n])>1)
- {
- printf("ERROR:\n");
- suc=0;
- }
- }
- }
- if(suc==1)
- printf("COMPLETED_SUCCESSFULLY\n");
-
- cudaErrCheck(cudaFree(a_fp32));
- cudaErrCheck(cudaFree(b_fp32));
- cudaErrCheck(cudaFree(c_fp32));
- cudaErrCheck(cudaFree(d_fp32));
- cudaErrCheck(cudaFree(a_fp16));
- cudaErrCheck(cudaFree(b_fp16));
- //cudaErrCheck(cudaFree(c_fp16));
- //cudaErrCheck(cudaFree(d_fp16));
-
- free(a_host_wmma);
- free(b_host_wmma);
- free(c_host_wmma);
- free(d_host_wmma);
- cudaErrCheck(cudaDeviceReset());
- return 0;
-}
-
-
diff --git a/cuda-kernels/v16p_genericMatrixMultiply.cu b/cuda-kernels/v16p_genericMatrixMultiply.cu
deleted file mode 100644
index 284bd7e..0000000
--- a/cuda-kernels/v16p_genericMatrixMultiply.cu
+++ /dev/null
@@ -1,388 +0,0 @@
-#include <stdio.h>
-#include <curand.h>
-#include <stdlib.h>
-
-// Define some error checking macros.
-#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); }
-void cudaErrCheck_(cudaError_t stat, const char *file, int line) {
- if (stat != cudaSuccess) {
- fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line);
- }
-}
-
-#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); }
-void curandErrCheck_(curandStatus_t stat, const char *file, int line) {
- if (stat != CURAND_STATUS_SUCCESS) {
- fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line);
- }
-}
-
-#include <mma.h>
-using namespace nvcuda;
-
-// Must be multiples of 16 for wmma code to work
-#define MATRIX_M (SIZE)
-#define MATRIX_N (SIZE)
-#define MATRIX_K (SIZE)
-
-
-// The only dimensions currently supported by WMMA
-const int WMMA_M = 16;
-const int WMMA_N = 16;
-const int WMMA_K = 16;
-
-
-
-__global__ void vp_example(int *a, int *b, int *c, int M, int N, int K ) {
- // Leading dimensions. Packed with no transpositions.
- int lda = M;
- int ldb = K;
- int ldc = M;
-
- // Tile using a 2D grid
- int warpM = (blockIdx.x * blockDim.x + threadIdx.x) / warpSize;
- int warpN = (blockIdx.y * blockDim.y + threadIdx.y);
-
- // Declare the fragments
- int a_frag[8];
- int b_frag[8];
- int c_frag[8];
- int acc_frag[8];
-
- acc_frag[0]=0;
- acc_frag[1]=0;
- acc_frag[2]=0;
- acc_frag[3]=0;
- acc_frag[4]=0;
- acc_frag[5]=0;
- acc_frag[6]=0;
- acc_frag[7]=0;
-
- // Loop over k
- for (int i = 0; i < K; i += WMMA_K) {
- int aRow = warpM * WMMA_M;
- int aCol = i;
-
- int bRow = i;
- int bCol = warpN * WMMA_N;
-
- // Bounds checking
- if (aRow < M && aCol < K && bRow < K && bCol < N) {
- // Load the inputs
- // vp::load_matrix_sync(a_frag, a + aRow * lda+ aCol , lda);
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.load.a.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" :
- "=r"(a_frag[0]), "=r"(a_frag[1]),"=r"(a_frag[2]),"=r"(a_frag[3]),
- "=r"(a_frag[4]),"=r"(a_frag[5]),"=r"(a_frag[6]),"=r"(a_frag[7]):
- "l"(a+aRow*lda+aCol),"r"(lda)
- );
- asm("CPTX_END");
- asm("*/");
- //vp::load_matrix_sync(b_frag, b + bRow * ldb+ bCol , ldb);
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.load.b16.sync.row.m16n16k16.s32 {%0,%1,%2,%3},[%4],%5;" :
- "=r"(b_frag[0]),"=r"(b_frag[1]),"=r"(b_frag[2]),"=r"(b_frag[3]):
- "l"(b+bRow*ldb/2+bCol/2),"r"(ldb)//NOTE pointer arithematic is happenning over here so be extracareful
- );
- asm("CPTX_END");
- asm("*/");
-
- // Perform the matrix multiplication
- //vp::mma_sync(acc_frag, a_frag, b_frag, acc_frag);
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.mma16.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16, %17, %18, %19}, { %20, %21, %22, %23, %24, %25, %26,%27};" :
- "=r"(acc_frag[0]), "=r"(acc_frag[1]),"=r"(acc_frag[2]),"=r"(acc_frag[3]),
- "=r"(acc_frag[4]),"=r"(acc_frag[5]),"=r"(acc_frag[6]),"=r"(acc_frag[7]):
- "r"(a_frag[0]),"r"(a_frag[1]),"r"(a_frag[2]),"r"(a_frag[3]),
- "r"(a_frag[4]),"r"(a_frag[5]),"r"(a_frag[6]),"r"(a_frag[7]),
- "r"(b_frag[0]),"r"(b_frag[1]),"r"(b_frag[2]),"r"(b_frag[3]),
- "r"(acc_frag[0]),"r"(acc_frag[1]),"r"(acc_frag[2]),"r"(acc_frag[3]),
- "r"(acc_frag[4]),"r"(acc_frag[5]),"r"(acc_frag[6]),"r"(acc_frag[7])
- );
- asm("CPTX_END");
- asm("*/");
-
- }
- }
-
- // Load in the current value of c, scale it by beta, and add this our result scaled by alpha
- int cRow = warpM * WMMA_M;
- int cCol = warpN * WMMA_N;
-
- if (cRow < M && cCol < N) {
- //vp::load_matrix_sync(c_frag, c + cRow*ldc + cCol , ldc, wmma::mem_row_major);
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.load.c.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" :
- "=r"(c_frag[0]), "=r"(c_frag[1]),"=r"(c_frag[2]),"=r"(c_frag[3]),
- "=r"(c_frag[4]),"=r"(c_frag[5]),"=r"(c_frag[6]),"=r"(c_frag[7]):
- "l"(c+cRow*ldc+cCol),"r"(ldc)
- );
- asm("CPTX_END");
- asm("*/");
-
-
- for(int i=0; i < 8; i++) {
- c_frag[i] = acc_frag[i] + c_frag[i];
- }
-
- // Store the output
- //vp::store_matrix_sync(c + cRow *ldc + cCol , c_frag, ldc, wmma::mem_row_major);
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.store.d.sync.row.m16n16k16.s32 [%0], {%1,%2,%3,%4,%5,%6,%7,%8},%9;" :
- :"l"(c+cRow*ldc+cCol),
- "r"(c_frag[0]), "r"(c_frag[1]),"r"(c_frag[2]),"r"(c_frag[3]),
- "r"(c_frag[4]),"r"(c_frag[5]),"r"(c_frag[6]),"r"(c_frag[7]),
- "r"(ldc)
- );
- asm("CPTX_END");
- asm("*/");
- }
-}
-
-__global__ void convertFp32ToFp16 (half *out, float *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-__global__ void convertFp16ToFp32 (float *out, half *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-
-__global__ void convertInt32ToInt4 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n/8) {
- out[idx] =(in[8*idx]&0xf)|(in[8*idx+1]&0xf)<<4|(in[8*idx+2]&0xf)<<8|(in[8*idx+3]&0xf)<<12|
- (in[8*idx+4]&0xf)<<16|(in[8*idx+5]&0xf)<<20|(in[8*idx+6]&0xf)<<24|(in[8*idx+7]&0xf)<<28;
- }
-}
-__global__ void convertInt32ToInt8 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n/4) {
- out[idx] =(in[4*idx]&0xff)|(in[4*idx+1]&0xff)<<8|(in[4*idx+2]&0xff)<<16|(in[4*idx+3]&0xff)<<24;
- }
-}
-__global__ void convertInt32ToInt16 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n/2) {
- out[idx] =(in[2*idx]&0xffff)|(in[2*idx+1]&0xffff)<<16;
- }
-}
-
-__global__ void convertInt4ToInt32 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- int shft_amt=4*(idx%8);
- int shft_mask=0xf<<shft_amt;
- if (idx < n) {
- out[idx]= (in[idx/8]&shft_mask)>>shft_amt;
- }
-}
-__global__ void convertInt8ToInt32 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- int shft_amt=8*(idx%4);
- int shft_mask=0xff<<shft_amt;
- if (idx < n) {
- out[idx]= (in[idx/4]&shft_mask)>>shft_amt;
- }
-}
-__global__ void convertInt16ToInt32 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- int shft_amt=16*(idx%2);
- int shft_mask=0xffff<<shft_amt;
- if (idx < n) {
- out[idx]= (in[idx/2]&shft_mask)>>shft_amt;
- }
-}
-
-int main(int argc, char* argv[]) {
- int *a_int32;
- int *b_int32;
- int *c_int32;
- int *d_int32;
-
- int *a_int4;
- int *b_int4;
- int *a_int8;
- int *b_int8;
- int *a_int16;
- int *b_int16;
-
- int *a_host_wmma;
- int *b_host_wmma;
- int *c_host_wmma;
- int *d_host_wmma;
- int *d_cal_host_wmma;
-
- cudaEvent_t startWMMA;
- cudaEvent_t stopWMMA;
-
- srand(time(NULL));
- cudaErrCheck(cudaEventCreate(&startWMMA));
- cudaErrCheck(cudaEventCreate(&stopWMMA));
-
- // Use tensor cores
- cudaErrCheck(cudaMalloc((void**)&a_int32, MATRIX_M * MATRIX_K * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&b_int32, MATRIX_K * MATRIX_N * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&c_int32, MATRIX_K * MATRIX_N * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&d_int32, MATRIX_K * MATRIX_N * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&a_int4, MATRIX_M * MATRIX_K * sizeof(int)/8));
- cudaErrCheck(cudaMalloc((void**)&b_int4, MATRIX_K * MATRIX_N * sizeof(int)/8));
- cudaErrCheck(cudaMalloc((void**)&a_int8, MATRIX_M * MATRIX_K * sizeof(int)/4));
- cudaErrCheck(cudaMalloc((void**)&b_int8, MATRIX_K * MATRIX_N * sizeof(int)/4));
- cudaErrCheck(cudaMalloc((void**)&a_int16, MATRIX_M * MATRIX_K * sizeof(int)/2));
- cudaErrCheck(cudaMalloc((void**)&b_int16, MATRIX_K * MATRIX_N * sizeof(int)/2));
-
-
- a_host_wmma = (int *)malloc(MATRIX_M * MATRIX_K * sizeof(int));
- b_host_wmma = (int *)malloc(MATRIX_K * MATRIX_N * sizeof(int));
- c_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int));
- d_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int));
- d_cal_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int));
-
- printf("a_int32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_K;n++){
- a_host_wmma[m*MATRIX_K+n]= random()%2;
- //a_host_wmma[m*MATRIX_K+n]= m*MATRIX_K+n;
- printf("%d ",a_host_wmma[m*MATRIX_K+n]);
- }
- printf(";\n");
- }
-
- printf("b_int32\n");
- for(int m=0;m<MATRIX_K;m++){
- for(int n=0;n<MATRIX_N;n++){
- b_host_wmma[m*MATRIX_N+n]= random()%4;
- //b_host_wmma[m*MATRIX_N+n]= m*MATRIX_N+n;
- printf("%d ",b_host_wmma[m*MATRIX_N+n]);
- }
- printf(";\n");
- }
-
- printf("c_int32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- c_host_wmma[m*MATRIX_N+n]= random()%32;
- //c_host_wmma[m*MATRIX_N+n]= m*MATRIX_N+n;
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- printf("%d ",c_host_wmma[m*MATRIX_N+n]);
- }
- printf(";\n");
- }
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
-
-
- cudaErrCheck(cudaMemcpy(a_int32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(int), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(b_int32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(c_int32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice));
-
- #ifdef TEST16
- convertInt32ToInt16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_int16, a_int32, MATRIX_M * MATRIX_K);
- convertInt16ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, a_int16, MATRIX_M * MATRIX_K);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost));
- #endif
- #ifdef TEST8
- convertInt32ToInt8 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_int8, a_int32, MATRIX_M * MATRIX_K);
- convertInt8ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, a_int8, MATRIX_M * MATRIX_K);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost));
- #endif
- #ifdef TEST4
- convertInt32ToInt4 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int4, b_int32, MATRIX_M * MATRIX_K);
- convertInt4ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, b_int4, MATRIX_M * MATRIX_K);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost));
- #endif
- convertInt32ToInt16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int16, b_int32, MATRIX_M * MATRIX_K);
-
- dim3 gridDim;
- dim3 blockDim;
-
- // blockDim.x must be a multple of warpSize
- // 128x4 means we have 16 warps and a block computes a 64x64 output tile
- blockDim.x = 64;
- blockDim.y = 2;
-
- gridDim.x = (MATRIX_M + (WMMA_M * blockDim.x / 32 - 1)) / (WMMA_M * blockDim.x / 32);
- gridDim.y = (MATRIX_N + WMMA_N * blockDim.y - 1) / (WMMA_N * blockDim.y);
- printf("GRID:X=%d,Y=%d\n",gridDim.x,gridDim.y);
- printf("BLOCK:X=%d,Y=%d\n",blockDim.x,blockDim.y);
-
-
- printf("Running with wmma...\n");
- cudaErrCheck(cudaEventRecord(startWMMA));
- vp_example <<< gridDim, blockDim >>> (a_int32, b_int16, c_int32, MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
-
- // Error checking
- printf("\nChecking results...\n");
- cudaErrCheck(cudaMemcpy(d_host_wmma, c_int32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
-
- float wmmaTime;
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma took %fms\n", wmmaTime);
-
- cudaErrCheck(cudaEventDestroy(startWMMA));
- cudaErrCheck(cudaEventDestroy(stopWMMA));
-
- int t=1000000;
- while(t-->0);
- printf("D_CALCULATED\n");
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%d,",d_cal_host_wmma[m*MATRIX_N+n]);
- }
- printf("\n");
- }
- printf("D_WMMA\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%d,",d_host_wmma[m*MATRIX_N+n]);
- }
- printf("\n");
- }
- int suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n]))
- {
- printf("ERROR:\n");
- suc=0;
- }
- }
- }
- if(suc==1)
- printf("COMPLETED_SUCCESSFULLY\n");
-
-
- cudaErrCheck(cudaFree(a_int32));
- cudaErrCheck(cudaFree(b_int32));
- cudaErrCheck(cudaFree(c_int32));
- cudaErrCheck(cudaFree(d_int32));
- cudaErrCheck(cudaFree(a_int8));
- cudaErrCheck(cudaFree(b_int8));
-
- free(a_host_wmma);
- free(b_host_wmma);
- free(c_host_wmma);
- free(d_host_wmma);
- cudaErrCheck(cudaDeviceReset());
- return 0;
-}
-
-
diff --git a/cuda-kernels/v16p_kernel.cu b/cuda-kernels/v16p_kernel.cu
deleted file mode 100644
index d84328f..0000000
--- a/cuda-kernels/v16p_kernel.cu
+++ /dev/null
@@ -1,359 +0,0 @@
-#include <stdio.h>
-#include <curand.h>
-#include <stdlib.h>
-
-// Define some error checking macros.
-#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); }
-void cudaErrCheck_(cudaError_t stat, const char *file, int line) {
- if (stat != cudaSuccess) {
- fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line);
- }
-}
-
-#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); }
-void curandErrCheck_(curandStatus_t stat, const char *file, int line) {
- if (stat != CURAND_STATUS_SUCCESS) {
- fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line);
- }
-}
-
-#include <mma.h>
-using namespace nvcuda;
-
-// Must be multiples of 16 for wmma code to work
-#define MATRIX_M (16)
-#define MATRIX_N (16)
-#define MATRIX_K (16)
-
-
-// The only dimensions currently supported by WMMA
-const int WMMA_M = 16;
-const int WMMA_N = 16;
-const int WMMA_K = 16;
-
-__global__ void v16p_example(int *a_int32, int *b_int4, int *c,int *d_int32, int M, int N, int K) {
-
- int registers_a[8];
- int registers_b[8];
- int registers_c[8];
- int registers_d[8];
- int register_b; //contains 8 4bit b elements
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
-
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.load.a.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" :
- "=r"(registers_a[0]), "=r"(registers_a[1]),"=r"(registers_a[2]),"=r"(registers_a[3]),
- "=r"(registers_a[4]),"=r"(registers_a[5]),"=r"(registers_a[6]),"=r"(registers_a[7]):
- "l"(a_int32),"r"(M)
- );
- asm("CPTX_END");
- asm("*/");
-
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.load.b16.sync.row.m16n16k16.s32 {%0,%1,%2,%3},[%4],%5;" :
- "=r"(registers_b[0]),"=r"(registers_b[1]),"=r"(registers_b[2]),"=r"(registers_b[3]):
- "l"(b_int4),"r"(M)
- );
- asm("CPTX_END");
- asm("*/");
-
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.load.c.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" :
- "=r"(registers_c[0]), "=r"(registers_c[1]),"=r"(registers_c[2]),"=r"(registers_c[3]),
- "=r"(registers_c[4]),"=r"(registers_c[5]),"=r"(registers_c[6]),"=r"(registers_c[7]):
- "l"(c),"r"(M)
- );
- asm("CPTX_END");
- asm("*/");
- //B4
- //asm("/*");
- //asm("CPTX_BEGIN");
- //asm("vp.mma.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16}, {%17, %18, %19, %20, %21, %22, %23, %24};" :
- //"=r"(registers_d[0]), "=r"(registers_d[1]),"=r"(registers_d[2]),"=r"(registers_d[3]),
- //"=r"(registers_d[4]),"=r"(registers_d[5]),"=r"(registers_d[6]),"=r"(registers_d[7]):
- //"r"(registers_a[0]),"r"(registers_a[1]),"r"(registers_a[2]),"r"(registers_a[3]),
- //"r"(registers_a[4]),"r"(registers_a[5]),"r"(registers_a[6]),"r"(registers_a[7]),
- //"r"(registers_b[0]),
- //"r"(registers_c[0]),"r"(registers_c[1]),"r"(registers_c[2]),"r"(registers_c[3]),
- //"r"(registers_c[4]),"r"(registers_c[5]),"r"(registers_c[6]),"r"(registers_c[7])
- //);
- //asm("CPTX_END");
- //asm("*/");
-
- //B8
- //asm("/*");
- //asm("CPTX_BEGIN");
- //asm("vp.mma.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16, %17}, {%18, %19, %20, %21, %22, %23, %24, %25};" :
- //"=r"(registers_d[0]), "=r"(registers_d[1]),"=r"(registers_d[2]),"=r"(registers_d[3]),
- //"=r"(registers_d[4]),"=r"(registers_d[5]),"=r"(registers_d[6]),"=r"(registers_d[7]):
- //"r"(registers_a[0]),"r"(registers_a[1]),"r"(registers_a[2]),"r"(registers_a[3]),
- //"r"(registers_a[4]),"r"(registers_a[5]),"r"(registers_a[6]),"r"(registers_a[7]),
- //"r"(registers_b[0]),"r"(registers_b[1]),
- //"r"(registers_c[0]),"r"(registers_c[1]),"r"(registers_c[2]),"r"(registers_c[3]),
- //"r"(registers_c[4]),"r"(registers_c[5]),"r"(registers_c[6]),"r"(registers_c[7])
- //);
- //asm("CPTX_END");
- //asm("*/");
-
- //B16
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.mma16.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16, %17, %18, %19}, { %20, %21, %22, %23, %24, %25, %26, %27};" :
- "=r"(registers_d[0]), "=r"(registers_d[1]),"=r"(registers_d[2]),"=r"(registers_d[3]),
- "=r"(registers_d[4]),"=r"(registers_d[5]),"=r"(registers_d[6]),"=r"(registers_d[7]):
- "r"(registers_a[0]),"r"(registers_a[1]),"r"(registers_a[2]),"r"(registers_a[3]),
- "r"(registers_a[4]),"r"(registers_a[5]),"r"(registers_a[6]),"r"(registers_a[7]),
- "r"(registers_b[0]),"r"(registers_b[1]),"r"(registers_b[2]),"r"(registers_b[3]),
- "r"(registers_c[0]),"r"(registers_c[1]),"r"(registers_c[2]),"r"(registers_c[3]),
- "r"(registers_c[4]),"r"(registers_c[5]),"r"(registers_c[6]),"r"(registers_c[7])
- );
- asm("CPTX_END");
- asm("*/");
-
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.store.d.sync.row.m16n16k16.s32 [%0], {%1,%2,%3,%4,%5,%6,%7,%8},%9;" :
- :"l"(d_int32)
- "r"(registers_d[0]), "r"(registers_d[1]),"r"(registers_d[2]),"r"(registers_d[3]),
- "r"(registers_d[4]),"r"(registers_d[5]),"r"(registers_d[6]),"r"(registers_d[7]),
- "r"(M)
- );
- asm("CPTX_END");
- asm("*/");
- //d_int32[0]=registers_d[0];
-}
-
-__global__ void convertFp32ToFp16 (half *out, float *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-__global__ void convertFp16ToFp32 (float *out, half *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-
-__global__ void convertInt32ToInt4 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n/8) {
- out[idx] =(in[8*idx]&0xf)|(in[8*idx+1]&0xf)<<4|(in[8*idx+2]&0xf)<<8|(in[8*idx+3]&0xf)<<12|
- (in[8*idx+4]&0xf)<<16|(in[8*idx+5]&0xf)<<20|(in[8*idx+6]&0xf)<<24|(in[8*idx+7]&0xf)<<28;
- }
-}
-__global__ void convertInt32ToInt8 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n/4) {
- out[idx] =(in[4*idx]&0xff)|(in[4*idx+1]&0xff)<<8|(in[4*idx+2]&0xff)<<16|(in[4*idx+3]&0xff)<<24;
- }
-}
-__global__ void convertInt32ToInt16 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n/2) {
- out[idx] =(in[2*idx]&0xffff)|(in[2*idx+1]&0xffff)<<16;
- }
-}
-
-__global__ void convertInt4ToInt32 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- int shft_amt=4*(idx%8);
- int shft_mask=0xf<<shft_amt;
- if (idx < n) {
- out[idx]= (in[idx/8]&shft_mask)>>shft_amt;
- }
-}
-__global__ void convertInt8ToInt32 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- int shft_amt=8*(idx%4);
- int shft_mask=0xff<<shft_amt;
- if (idx < n) {
- out[idx]= (in[idx/4]&shft_mask)>>shft_amt;
- }
-}
-__global__ void convertInt16ToInt32 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- int shft_amt=16*(idx%2);
- int shft_mask=0xffff<<shft_amt;
- if (idx < n) {
- out[idx]= (in[idx/2]&shft_mask)>>shft_amt;
- }
-}
-
-int main(int argc, char* argv[]) {
- int *a_int32;
- int *b_int32;
- int *c_int32;
- int *d_int32;
-
- int *a_int4;
- int *b_int4;
- int *a_int8;
- int *b_int8;
- int *a_int16;
- int *b_int16;
-
- int *a_host_wmma;
- int *b_host_wmma;
- int *c_host_wmma;
- int *d_host_wmma;
- int *d_cal_host_wmma;
-
- cudaEvent_t startWMMA;
- cudaEvent_t stopWMMA;
-
- srand(time(NULL));
- cudaErrCheck(cudaEventCreate(&startWMMA));
- cudaErrCheck(cudaEventCreate(&stopWMMA));
-
- // Use tensor cores
- cudaErrCheck(cudaMalloc((void**)&a_int32, MATRIX_M * MATRIX_K * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&b_int32, MATRIX_K * MATRIX_N * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&c_int32, MATRIX_K * MATRIX_N * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&d_int32, MATRIX_K * MATRIX_N * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&a_int4, MATRIX_M * MATRIX_K * sizeof(int)/8));
- cudaErrCheck(cudaMalloc((void**)&b_int4, MATRIX_K * MATRIX_N * sizeof(int)/8));
- cudaErrCheck(cudaMalloc((void**)&a_int8, MATRIX_M * MATRIX_K * sizeof(int)/4));
- cudaErrCheck(cudaMalloc((void**)&b_int8, MATRIX_K * MATRIX_N * sizeof(int)/4));
- cudaErrCheck(cudaMalloc((void**)&a_int16, MATRIX_M * MATRIX_K * sizeof(int)/2));
- cudaErrCheck(cudaMalloc((void**)&b_int16, MATRIX_K * MATRIX_N * sizeof(int)/2));
-
-
- a_host_wmma = (int *)malloc(MATRIX_M * MATRIX_K * sizeof(int));
- b_host_wmma = (int *)malloc(MATRIX_K * MATRIX_N * sizeof(int));
- c_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int));
- d_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int));
- d_cal_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int));
-
- printf("a_int32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_K;n++){
- a_host_wmma[m*MATRIX_K+n]= random()%5;
- printf("%d ",a_host_wmma[m*MATRIX_K+n]);
- }
- printf(";\n");
- }
-
- printf("b_int32\n");
- for(int m=0;m<MATRIX_K;m++){
- for(int n=0;n<MATRIX_N;n++){
- b_host_wmma[m*MATRIX_N+n]=random()%32;
- printf("%d ",b_host_wmma[m*MATRIX_N+n]);
- }
- printf(";\n");
- }
-
- printf("c_int32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- c_host_wmma[m*MATRIX_N+n]=random()%32;
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- printf("%d ",c_host_wmma[m*MATRIX_N+n]);
- }
- printf(";\n");
- }
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
-
-
- cudaErrCheck(cudaMemcpy(a_int32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(int), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(b_int32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(c_int32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice));
- #ifdef TEST16
- convertInt32ToInt16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int16, b_int32, MATRIX_M * MATRIX_K);
- convertInt16ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, b_int16, MATRIX_M * MATRIX_K);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost));
- #endif
- #ifdef TEST8
- convertInt32ToInt8 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int8, b_int32, MATRIX_M * MATRIX_K);
- convertInt8ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, b_int8, MATRIX_M * MATRIX_K);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost));
- #endif
- #ifdef TEST4
- convertInt32ToInt4 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int4, b_int32, MATRIX_M * MATRIX_K);
- convertInt4ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, b_int4, MATRIX_M * MATRIX_K);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost));
- #endif
- convertInt32ToInt16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int16, b_int32, MATRIX_M * MATRIX_K);
-
- //convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N);
- //convertFp32ToFp16 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (c_fp16, c_fp32, MATRIX_K * MATRIX_N);
-
-
-//AAMIR printf("\nM = %d, N = %d, K = %d. \n", MATRIX_M, MATRIX_N, MATRIX_K);
-//AAMIR
-//AAMIR printf("Running with wmma...\n");
- cudaErrCheck(cudaEventRecord(startWMMA));
- v16p_example <<< 1, 32>>> (a_int32, b_int16, c_int32, d_int32, MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
-
-
- // Error checking
- printf("\nChecking results...\n");
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
-
- float wmmaTime;
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma took %fms\n", wmmaTime);
-
- cudaErrCheck(cudaEventDestroy(startWMMA));
- cudaErrCheck(cudaEventDestroy(stopWMMA));
-
- int t=2000000;
- while(t-->0);
- printf("D_CALCULATED\n");
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%d,",d_cal_host_wmma[m*MATRIX_N+n]);
- }
- printf("\n");
- }
- printf("D_WMMA\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%d,",d_host_wmma[m*MATRIX_N+n]);
- }
- printf("\n");
- }
- int suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n]))
- {
- printf("ERROR:\n");
- suc=0;
- }
- }
- }
- if(suc==1)
- printf("COMPLETED_SUCCESSFULLY\n");
-
-
- cudaErrCheck(cudaFree(a_int32));
- cudaErrCheck(cudaFree(b_int32));
- cudaErrCheck(cudaFree(c_int32));
- cudaErrCheck(cudaFree(d_int32));
- cudaErrCheck(cudaFree(a_int8));
- cudaErrCheck(cudaFree(b_int8));
-
- free(a_host_wmma);
- free(b_host_wmma);
- free(c_host_wmma);
- free(d_host_wmma);
- cudaErrCheck(cudaDeviceReset());
- return 0;
-}
-
-
diff --git a/cuda-kernels/v4p_genericMatrixMultiply.cu b/cuda-kernels/v4p_genericMatrixMultiply.cu
deleted file mode 100644
index 42283c4..0000000
--- a/cuda-kernels/v4p_genericMatrixMultiply.cu
+++ /dev/null
@@ -1,387 +0,0 @@
-#include <stdio.h>
-#include <curand.h>
-#include<stdlib.h>
-
-// Define some error checking macros.
-#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); }
-void cudaErrCheck_(cudaError_t stat, const char *file, int line) {
- if (stat != cudaSuccess) {
- fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line);
- }
-}
-
-#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); }
-void curandErrCheck_(curandStatus_t stat, const char *file, int line) {
- if (stat != CURAND_STATUS_SUCCESS) {
- fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line);
- }
-}
-
-#include <mma.h>
-using namespace nvcuda;
-
-// Must be multiples of 16 for wmma code to work
-#define MATRIX_M (SIZE)
-#define MATRIX_N (SIZE)
-#define MATRIX_K (SIZE)
-
-
-// The only dimensions currently supported by WMMA
-const int WMMA_M = 16;
-const int WMMA_N = 16;
-const int WMMA_K = 16;
-
-
-
-__global__ void vp_example(int *a, int *b, int *c, int M, int N, int K ) {
- // Leading dimensions. Packed with no transpositions.
- int lda = M;
- int ldb = K;
- int ldc = M;
-
- // Tile using a 2D grid
- int warpM = (blockIdx.x * blockDim.x + threadIdx.x) / warpSize;
- int warpN = (blockIdx.y * blockDim.y + threadIdx.y);
-
- // Declare the fragments
- int a_frag[8];
- int b_frag[8];
- int c_frag[8];
- int acc_frag[8];
-
- acc_frag[0]=0;
- acc_frag[1]=0;
- acc_frag[2]=0;
- acc_frag[3]=0;
- acc_frag[4]=0;
- acc_frag[5]=0;
- acc_frag[6]=0;
- acc_frag[7]=0;
-
- // Loop over k
- for (int i = 0; i < K; i += WMMA_K) {
- int aRow = warpM * WMMA_M;
- int aCol = i;
-
- int bRow = i;
- int bCol = warpN * WMMA_N;
-
- // Bounds checking
- if (aRow < M && aCol < K && bRow < K && bCol < N) {
- // Load the inputs
- // vp::load_matrix_sync(a_frag, a + aRow * lda+ aCol , lda);
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.load.a.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" :
- "=r"(a_frag[0]), "=r"(a_frag[1]),"=r"(a_frag[2]),"=r"(a_frag[3]),
- "=r"(a_frag[4]),"=r"(a_frag[5]),"=r"(a_frag[6]),"=r"(a_frag[7]):
- "l"(a+aRow*lda+aCol),"r"(lda)
- );
- asm("CPTX_END");
- asm("*/");
- //vp::load_matrix_sync(b_frag, b + bRow * ldb+ bCol , ldb);
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.load.b4.sync.row.m16n16k16.s32 {%0},[%1],%2;" :
- "=r"(b_frag[0]):
- "l"(b+bRow*ldb/8+bCol/8),"r"(ldb)
- );
- asm("CPTX_END");
- asm("*/");
-
- // Perform the matrix multiplication
- //vp::mma_sync(acc_frag, a_frag, b_frag, acc_frag);
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.mma4.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16}, {%17, %18, %19, %20, %21, %22, %23, %24};" :
- "=r"(acc_frag[0]), "=r"(acc_frag[1]),"=r"(acc_frag[2]),"=r"(acc_frag[3]),
- "=r"(acc_frag[4]),"=r"(acc_frag[5]),"=r"(acc_frag[6]),"=r"(acc_frag[7]):
- "r"(a_frag[0]),"r"(a_frag[1]),"r"(a_frag[2]),"r"(a_frag[3]),
- "r"(a_frag[4]),"r"(a_frag[5]),"r"(a_frag[6]),"r"(a_frag[7]),
- "r"(b_frag[0]),
- "r"(acc_frag[0]),"r"(acc_frag[1]),"r"(acc_frag[2]),"r"(acc_frag[3]),
- "r"(acc_frag[4]),"r"(acc_frag[5]),"r"(acc_frag[6]),"r"(acc_frag[7])
- );
- asm("CPTX_END");
- asm("*/");
-
- }
- }
-
- // Load in the current value of c, scale it by beta, and add this our result scaled by alpha
- int cRow = warpM * WMMA_M;
- int cCol = warpN * WMMA_N;
-
- if (cRow < M && cCol < N) {
- //vp::load_matrix_sync(c_frag, c + cRow*ldc + cCol , ldc, wmma::mem_row_major);
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.load.c.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" :
- "=r"(c_frag[0]), "=r"(c_frag[1]),"=r"(c_frag[2]),"=r"(c_frag[3]),
- "=r"(c_frag[4]),"=r"(c_frag[5]),"=r"(c_frag[6]),"=r"(c_frag[7]):
- "l"(c+cRow*ldc+cCol),"r"(ldc)
- );
- asm("CPTX_END");
- asm("*/");
-
-
- for(int i=0; i < 8; i++) {
- c_frag[i] = acc_frag[i] + c_frag[i];
- }
-
- // Store the output
- //vp::store_matrix_sync(c + cRow *ldc + cCol , c_frag, ldc, wmma::mem_row_major);
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.store.d.sync.row.m16n16k16.s32 [%0], {%1,%2,%3,%4,%5,%6,%7,%8},%9;" :
- :"l"(c+cRow*ldc+cCol),
- "r"(c_frag[0]), "r"(c_frag[1]),"r"(c_frag[2]),"r"(c_frag[3]),
- "r"(c_frag[4]),"r"(c_frag[5]),"r"(c_frag[6]),"r"(c_frag[7]),
- "r"(ldc)
- );
- asm("CPTX_END");
- asm("*/");
- }
-}
-
-__global__ void convertFp32ToFp16 (half *out, float *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-__global__ void convertFp16ToFp32 (float *out, half *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-
-__global__ void convertInt32ToInt4 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n/8) {
- out[idx] =(in[8*idx]&0xf)|(in[8*idx+1]&0xf)<<4|(in[8*idx+2]&0xf)<<8|(in[8*idx+3]&0xf)<<12|
- (in[8*idx+4]&0xf)<<16|(in[8*idx+5]&0xf)<<20|(in[8*idx+6]&0xf)<<24|(in[8*idx+7]&0xf)<<28;
- }
-}
-__global__ void convertInt32ToInt8 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n/4) {
- out[idx] =(in[4*idx]&0xff)|(in[4*idx+1]&0xff)<<8|(in[4*idx+2]&0xff)<<16|(in[4*idx+3]&0xff)<<24;
- }
-}
-__global__ void convertInt32ToInt16 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n/2) {
- out[idx] =(in[2*idx]&0xffff)|(in[2*idx+1]&0xffff)<<16;
- }
-}
-
-__global__ void convertInt4ToInt32 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- int shft_amt=4*(idx%8);
- int shft_mask=0xf<<shft_amt;
- if (idx < n) {
- out[idx]= (in[idx/8]&shft_mask)>>shft_amt;
- }
-}
-__global__ void convertInt8ToInt32 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- int shft_amt=8*(idx%4);
- int shft_mask=0xff<<shft_amt;
- if (idx < n) {
- out[idx]= (in[idx/4]&shft_mask)>>shft_amt;
- }
-}
-__global__ void convertInt16ToInt32 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- int shft_amt=16*(idx%2);
- int shft_mask=0xffff<<shft_amt;
- if (idx < n) {
- out[idx]= (in[idx/2]&shft_mask)>>shft_amt;
- }
-}
-
-int main(int argc, char* argv[]) {
- int *a_int32;
- int *b_int32;
- int *c_int32;
- int *d_int32;
-
- int *a_int4;
- int *b_int4;
- int *a_int8;
- int *b_int8;
- int *a_int16;
- int *b_int16;
-
- int *a_host_wmma;
- int *b_host_wmma;
- int *c_host_wmma;
- int *d_host_wmma;
- int *d_cal_host_wmma;
-
- cudaEvent_t startWMMA;
- cudaEvent_t stopWMMA;
-
-
- srand (time(NULL));
- cudaErrCheck(cudaEventCreate(&startWMMA));
- cudaErrCheck(cudaEventCreate(&stopWMMA));
-
- // Use tensor cores
- cudaErrCheck(cudaMalloc((void**)&a_int32, MATRIX_M * MATRIX_K * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&b_int32, MATRIX_K * MATRIX_N * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&c_int32, MATRIX_K * MATRIX_N * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&d_int32, MATRIX_K * MATRIX_N * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&a_int4, MATRIX_M * MATRIX_K * sizeof(int)/8));
- cudaErrCheck(cudaMalloc((void**)&b_int4, MATRIX_K * MATRIX_N * sizeof(int)/8));
- cudaErrCheck(cudaMalloc((void**)&a_int8, MATRIX_M * MATRIX_K * sizeof(int)/4));
- cudaErrCheck(cudaMalloc((void**)&b_int8, MATRIX_K * MATRIX_N * sizeof(int)/4));
- cudaErrCheck(cudaMalloc((void**)&a_int16, MATRIX_M * MATRIX_K * sizeof(int)/2));
- cudaErrCheck(cudaMalloc((void**)&b_int16, MATRIX_K * MATRIX_N * sizeof(int)/2));
-
-
- a_host_wmma = (int *)malloc(MATRIX_M * MATRIX_K * sizeof(int));
- b_host_wmma = (int *)malloc(MATRIX_K * MATRIX_N * sizeof(int));
- c_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int));
- d_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int));
- d_cal_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int));
-
- printf("a_int32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_K;n++){
- a_host_wmma[m*MATRIX_K+n]= random()%4;
- //a_host_wmma[m*MATRIX_K+n]=m*MATRIX_K+n;
- printf("%d ",a_host_wmma[m*MATRIX_K+n]);
- }
- printf(";\n");
- }
-
- printf("b_int32\n");
- for(int m=0;m<MATRIX_K;m++){
- for(int n=0;n<MATRIX_N;n++){
- b_host_wmma[m*MATRIX_N+n]=random()%2;
- printf("%d ",b_host_wmma[m*MATRIX_N+n]);
- }
- printf(";\n");
- }
-
- printf("c_int32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- c_host_wmma[m*MATRIX_N+n]= random()%64;
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- printf("%d ",c_host_wmma[m*MATRIX_N+n]);
- }
- printf(";\n");
- }
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
-
-
- cudaErrCheck(cudaMemcpy(a_int32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(int), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(b_int32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(c_int32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice));
-
- #ifdef TEST16
- convertInt32ToInt16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_int16, a_int32, MATRIX_M * MATRIX_K);
- convertInt16ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, a_int16, MATRIX_M * MATRIX_K);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost));
- #endif
- #ifdef TEST8
- convertInt32ToInt8 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_int8, a_int32, MATRIX_M * MATRIX_K);
- convertInt8ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, a_int8, MATRIX_M * MATRIX_K);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost));
- #endif
- #ifdef TEST4
- convertInt32ToInt4 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int4, b_int32, MATRIX_M * MATRIX_K);
- convertInt4ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, b_int4, MATRIX_M * MATRIX_K);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost));
- #endif
- convertInt32ToInt4 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int4, b_int32, MATRIX_M * MATRIX_K);
-
- dim3 gridDim;
- dim3 blockDim;
-
- // blockDim.x must be a multple of warpSize
- // 128x4 means we have 16 warps and a block computes a 64x64 output tile
- blockDim.x = 64;
- blockDim.y = 2;
-
- gridDim.x = (MATRIX_M + (WMMA_M * blockDim.x / 32 - 1)) / (WMMA_M * blockDim.x / 32);
- gridDim.y = (MATRIX_N + WMMA_N * blockDim.y - 1) / (WMMA_N * blockDim.y);
- printf("GRID:X=%d,Y=%d\n",gridDim.x,gridDim.y);
- printf("BLOCK:X=%d,Y=%d\n",blockDim.x,blockDim.y);
-
-
- printf("Running with wmma...\n");
- cudaErrCheck(cudaEventRecord(startWMMA));
- vp_example <<< gridDim, blockDim >>> (a_int32, b_int4, c_int32, MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
-
- // Error checking
- printf("\nChecking results...\n");
- cudaErrCheck(cudaMemcpy(d_host_wmma, c_int32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
-
- float wmmaTime;
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma took %fms\n", wmmaTime);
-
- cudaErrCheck(cudaEventDestroy(startWMMA));
- cudaErrCheck(cudaEventDestroy(stopWMMA));
-
- int t=1000000;
- while(t-->0);
- printf("D_CALCULATED\n");
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%d,",d_cal_host_wmma[m*MATRIX_N+n]);
- }
- printf("\n");
- }
- printf("D_WMMA\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%d,",d_host_wmma[m*MATRIX_N+n]);
- }
- printf("\n");
- }
- int suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n]))
- {
- printf("ERROR:\n");
- suc=0;
- }
- }
- }
- if(suc==1)
- printf("COMPLETED_SUCCESSFULLY\n");
-
-
- cudaErrCheck(cudaFree(a_int32));
- cudaErrCheck(cudaFree(b_int32));
- cudaErrCheck(cudaFree(c_int32));
- cudaErrCheck(cudaFree(d_int32));
- cudaErrCheck(cudaFree(a_int8));
- cudaErrCheck(cudaFree(b_int8));
-
- free(a_host_wmma);
- free(b_host_wmma);
- free(c_host_wmma);
- free(d_host_wmma);
- cudaErrCheck(cudaDeviceReset());
- return 0;
-}
-
-
diff --git a/cuda-kernels/v4p_kernel.cu b/cuda-kernels/v4p_kernel.cu
deleted file mode 100644
index 053c07b..0000000
--- a/cuda-kernels/v4p_kernel.cu
+++ /dev/null
@@ -1,359 +0,0 @@
-#include <stdio.h>
-#include <stdlib.h>
-#include <curand.h>
-
-// Define some error checking macros.
-#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); }
-void cudaErrCheck_(cudaError_t stat, const char *file, int line) {
- if (stat != cudaSuccess) {
- fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line);
- }
-}
-
-#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); }
-void curandErrCheck_(curandStatus_t stat, const char *file, int line) {
- if (stat != CURAND_STATUS_SUCCESS) {
- fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line);
- }
-}
-
-#include <mma.h>
-using namespace nvcuda;
-
-// Must be multiples of 16 for wmma code to work
-#define MATRIX_M (16)
-#define MATRIX_N (16)
-#define MATRIX_K (16)
-
-
-// The only dimensions currently supported by WMMA
-const int WMMA_M = 16;
-const int WMMA_N = 16;
-const int WMMA_K = 16;
-
-__global__ void v4p_example(int *a_int32, int *b_int4, int *c,int *d_int32, int M, int N, int K) {
-
- int registers_a[8];
- int registers_b[8];
- int registers_c[8];
- int registers_d[8];
- int register_b; //contains 8 4bit b elements
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
-
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.load.a.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" :
- "=r"(registers_a[0]), "=r"(registers_a[1]),"=r"(registers_a[2]),"=r"(registers_a[3]),
- "=r"(registers_a[4]),"=r"(registers_a[5]),"=r"(registers_a[6]),"=r"(registers_a[7]):
- "l"(a_int32),"r"(M)
- );
- asm("CPTX_END");
- asm("*/");
-
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.load.b4.sync.row.m16n16k16.s32 {%0},[%1],%2;" :
- "=r"(registers_b[0]):
- "l"(b_int4),"r"(M)
- );
- asm("CPTX_END");
- asm("*/");
-
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.load.c.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" :
- "=r"(registers_c[0]), "=r"(registers_c[1]),"=r"(registers_c[2]),"=r"(registers_c[3]),
- "=r"(registers_c[4]),"=r"(registers_c[5]),"=r"(registers_c[6]),"=r"(registers_c[7]):
- "l"(c),"r"(M)
- );
- asm("CPTX_END");
- asm("*/");
- //B4
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.mma4.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16}, {%17, %18, %19, %20, %21, %22, %23, %24};" :
- "=r"(registers_d[0]), "=r"(registers_d[1]),"=r"(registers_d[2]),"=r"(registers_d[3]),
- "=r"(registers_d[4]),"=r"(registers_d[5]),"=r"(registers_d[6]),"=r"(registers_d[7]):
- "r"(registers_a[0]),"r"(registers_a[1]),"r"(registers_a[2]),"r"(registers_a[3]),
- "r"(registers_a[4]),"r"(registers_a[5]),"r"(registers_a[6]),"r"(registers_a[7]),
- "r"(registers_b[0]),
- "r"(registers_c[0]),"r"(registers_c[1]),"r"(registers_c[2]),"r"(registers_c[3]),
- "r"(registers_c[4]),"r"(registers_c[5]),"r"(registers_c[6]),"r"(registers_c[7])
- );
- asm("CPTX_END");
- asm("*/");
-
- //B8
- //asm("/*");
- //asm("CPTX_BEGIN");
- //asm("vp.mma.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16, %17}, {%18, %19, %20, %21, %22, %23, %24, %25};" :
- //"=r"(registers_d[0]), "=r"(registers_d[1]),"=r"(registers_d[2]),"=r"(registers_d[3]),
- //"=r"(registers_d[4]),"=r"(registers_d[5]),"=r"(registers_d[6]),"=r"(registers_d[7]):
- //"r"(registers_a[0]),"r"(registers_a[1]),"r"(registers_a[2]),"r"(registers_a[3]),
- //"r"(registers_a[4]),"r"(registers_a[5]),"r"(registers_a[6]),"r"(registers_a[7]),
- //"r"(registers_b[0]),"r"(registers_b[1]),
- //"r"(registers_c[0]),"r"(registers_c[1]),"r"(registers_c[2]),"r"(registers_c[3]),
- //"r"(registers_c[4]),"r"(registers_c[5]),"r"(registers_c[6]),"r"(registers_c[7])
- //);
- //asm("CPTX_END");
- //asm("*/");
-
- //B16
- //asm("/*");
- //asm("CPTX_BEGIN");
- //asm("vp.mma.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16, %17, %18, %19}, { %20, %21, %22, %23, %24, %25, %26, %27};" :
- //"=r"(registers_d[0]), "=r"(registers_d[1]),"=r"(registers_d[2]),"=r"(registers_d[3]),
- //"=r"(registers_d[4]),"=r"(registers_d[5]),"=r"(registers_d[6]),"=r"(registers_d[7]):
- //"r"(registers_a[0]),"r"(registers_a[1]),"r"(registers_a[2]),"r"(registers_a[3]),
- //"r"(registers_a[4]),"r"(registers_a[5]),"r"(registers_a[6]),"r"(registers_a[7]),
- //"r"(registers_b[0]),"r"(registers_b[1]),"r"(registers_b[2]),"r"(registers_b[3]),
- //"r"(registers_c[0]),"r"(registers_c[1]),"r"(registers_c[2]),"r"(registers_c[3]),
- //"r"(registers_c[4]),"r"(registers_c[5]),"r"(registers_c[6]),"r"(registers_c[7])
- //);
- //asm("CPTX_END");
- //asm("*/");
-
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.store.d.sync.row.m16n16k16.s32 [%0], {%1,%2,%3,%4,%5,%6,%7,%8},%9;" :
- :"l"(d_int32)
- "r"(registers_d[0]), "r"(registers_d[1]),"r"(registers_d[2]),"r"(registers_d[3]),
- "r"(registers_d[4]),"r"(registers_d[5]),"r"(registers_d[6]),"r"(registers_d[7]),
- "r"(M)
- );
- asm("CPTX_END");
- asm("*/");
- //d_int32[0]=registers_d[0];
-}
-
-__global__ void convertFp32ToFp16 (half *out, float *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-__global__ void convertFp16ToFp32 (float *out, half *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-
-__global__ void convertInt32ToInt4 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n/8) {
- out[idx] =(in[8*idx]&0xf)|(in[8*idx+1]&0xf)<<4|(in[8*idx+2]&0xf)<<8|(in[8*idx+3]&0xf)<<12|
- (in[8*idx+4]&0xf)<<16|(in[8*idx+5]&0xf)<<20|(in[8*idx+6]&0xf)<<24|(in[8*idx+7]&0xf)<<28;
- }
-}
-__global__ void convertInt32ToInt8 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n/4) {
- out[idx] =(in[4*idx]&0xff)|(in[4*idx+1]&0xff)<<8|(in[4*idx+2]&0xff)<<16|(in[4*idx+3]&0xff)<<24;
- }
-}
-__global__ void convertInt32ToInt16 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n/2) {
- out[idx] =(in[2*idx]&0xffff)|(in[2*idx+1]&0xffff)<<16;
- }
-}
-
-__global__ void convertInt4ToInt32 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- int shft_amt=4*(idx%8);
- int shft_mask=0xf<<shft_amt;
- if (idx < n) {
- out[idx]= (in[idx/8]&shft_mask)>>shft_amt;
- }
-}
-__global__ void convertInt8ToInt32 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- int shft_amt=8*(idx%4);
- int shft_mask=0xff<<shft_amt;
- if (idx < n) {
- out[idx]= (in[idx/4]&shft_mask)>>shft_amt;
- }
-}
-__global__ void convertInt16ToInt32 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- int shft_amt=16*(idx%2);
- int shft_mask=0xffff<<shft_amt;
- if (idx < n) {
- out[idx]= (in[idx/2]&shft_mask)>>shft_amt;
- }
-}
-
-int main(int argc, char* argv[]) {
- int *a_int32;
- int *b_int32;
- int *c_int32;
- int *d_int32;
-
- int *a_int4;
- int *b_int4;
- int *a_int8;
- int *b_int8;
- int *a_int16;
- int *b_int16;
-
- int *a_host_wmma;
- int *b_host_wmma;
- int *c_host_wmma;
- int *d_host_wmma;
- int *d_cal_host_wmma;
-
- cudaEvent_t startWMMA;
- cudaEvent_t stopWMMA;
-
- srand (time(NULL));
- cudaErrCheck(cudaEventCreate(&startWMMA));
- cudaErrCheck(cudaEventCreate(&stopWMMA));
-
- // Use tensor cores
- cudaErrCheck(cudaMalloc((void**)&a_int32, MATRIX_M * MATRIX_K * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&b_int32, MATRIX_K * MATRIX_N * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&c_int32, MATRIX_K * MATRIX_N * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&d_int32, MATRIX_K * MATRIX_N * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&a_int4, MATRIX_M * MATRIX_K * sizeof(int)/8));
- cudaErrCheck(cudaMalloc((void**)&b_int4, MATRIX_K * MATRIX_N * sizeof(int)/8));
- cudaErrCheck(cudaMalloc((void**)&a_int8, MATRIX_M * MATRIX_K * sizeof(int)/4));
- cudaErrCheck(cudaMalloc((void**)&b_int8, MATRIX_K * MATRIX_N * sizeof(int)/4));
- cudaErrCheck(cudaMalloc((void**)&a_int16, MATRIX_M * MATRIX_K * sizeof(int)/2));
- cudaErrCheck(cudaMalloc((void**)&b_int16, MATRIX_K * MATRIX_N * sizeof(int)/2));
-
-
- a_host_wmma = (int *)malloc(MATRIX_M * MATRIX_K * sizeof(int));
- b_host_wmma = (int *)malloc(MATRIX_K * MATRIX_N * sizeof(int));
- c_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int));
- d_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int));
- d_cal_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int));
-
- printf("a_int32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_K;n++){
- a_host_wmma[m*MATRIX_K+n]=random()%64;
- printf("%d ",a_host_wmma[m*MATRIX_K+n]);
- }
- printf(";\n");
- }
-
- printf("b_int32\n");
- for(int m=0;m<MATRIX_K;m++){
- for(int n=0;n<MATRIX_N;n++){
- b_host_wmma[m*MATRIX_N+n]=random()%16;
- printf("%d ",b_host_wmma[m*MATRIX_N+n]);
- }
- printf(";\n");
- }
-
- printf("c_int32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- c_host_wmma[m*MATRIX_N+n]= random()%64;
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- printf("%d ",c_host_wmma[m*MATRIX_N+n]);
- }
- printf(";\n");
- }
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
-
-
- cudaErrCheck(cudaMemcpy(a_int32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(int), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(b_int32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(c_int32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice));
-
- #ifdef TEST16
- convertInt32ToInt16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_int16, a_int32, MATRIX_M * MATRIX_K);
- convertInt16ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, a_int16, MATRIX_M * MATRIX_K);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost));
- #endif
- #ifdef TEST8
- convertInt32ToInt8 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_int8, a_int32, MATRIX_M * MATRIX_K);
- convertInt8ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, a_int8, MATRIX_M * MATRIX_K);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost));
- #endif
- #ifdef TEST4
- convertInt32ToInt4 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int4, b_int32, MATRIX_M * MATRIX_K);
- convertInt4ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, b_int4, MATRIX_M * MATRIX_K);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost));
- #endif
- convertInt32ToInt4 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int4, b_int32, MATRIX_M * MATRIX_K);
- //convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N);
- //convertFp32ToFp16 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (c_fp16, c_fp32, MATRIX_K * MATRIX_N);
-
-
-//AAMIR printf("\nM = %d, N = %d, K = %d. \n", MATRIX_M, MATRIX_N, MATRIX_K);
-//AAMIR
-//AAMIR printf("Running with wmma...\n");
- cudaErrCheck(cudaEventRecord(startWMMA));
- v4p_example <<< 1, 32>>> (a_int32, b_int4, c_int32, d_int32, MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
-
-
- // Error checking
- printf("\nChecking results...\n");
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
-
- float wmmaTime;
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma took %fms\n", wmmaTime);
-
- cudaErrCheck(cudaEventDestroy(startWMMA));
- cudaErrCheck(cudaEventDestroy(stopWMMA));
-
- int t=200000;
- while(t-->0);
- printf("D_CALCULATED\n");
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%d,",d_cal_host_wmma[m*MATRIX_N+n]);
- }
- printf("\n");
- }
- printf("D_WMMA\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%d,",d_host_wmma[m*MATRIX_N+n]);
- }
- printf("\n");
- }
- int suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n]))
- {
- printf("ERROR:\n");
- suc=0;
- }
- }
- }
- if(suc==1)
- printf("COMPLETED_SUCCESSFULLY\n");
-
-
- cudaErrCheck(cudaFree(a_int32));
- cudaErrCheck(cudaFree(b_int32));
- cudaErrCheck(cudaFree(c_int32));
- cudaErrCheck(cudaFree(d_int32));
- cudaErrCheck(cudaFree(a_int8));
- cudaErrCheck(cudaFree(b_int8));
-
- free(a_host_wmma);
- free(b_host_wmma);
- free(c_host_wmma);
- free(d_host_wmma);
- cudaErrCheck(cudaDeviceReset());
- return 0;
-}
-
-
diff --git a/cuda-kernels/v8p_genericMatrixMultiply.cu b/cuda-kernels/v8p_genericMatrixMultiply.cu
deleted file mode 100644
index d96b07c..0000000
--- a/cuda-kernels/v8p_genericMatrixMultiply.cu
+++ /dev/null
@@ -1,385 +0,0 @@
-#include <stdio.h>
-#include <curand.h>
-#include <stdlib.h>
-
-// Define some error checking macros.
-#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); }
-void cudaErrCheck_(cudaError_t stat, const char *file, int line) {
- if (stat != cudaSuccess) {
- fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line);
- }
-}
-
-#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); }
-void curandErrCheck_(curandStatus_t stat, const char *file, int line) {
- if (stat != CURAND_STATUS_SUCCESS) {
- fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line);
- }
-}
-
-#include <mma.h>
-using namespace nvcuda;
-
-// Must be multiples of 16 for wmma code to work
-#define MATRIX_M (SIZE)
-#define MATRIX_N (SIZE)
-#define MATRIX_K (SIZE)
-
-
-// The only dimensions currently supported by WMMA
-const int WMMA_M = 16;
-const int WMMA_N = 16;
-const int WMMA_K = 16;
-
-
-
-__global__ void vp_example(int *a, int *b, int *c, int M, int N, int K ) {
- // Leading dimensions. Packed with no transpositions.
- int lda = M;
- int ldb = K;
- int ldc = M;
-
- // Tile using a 2D grid
- int warpM = (blockIdx.x * blockDim.x + threadIdx.x) / warpSize;
- int warpN = (blockIdx.y * blockDim.y + threadIdx.y);
-
- // Declare the fragments
- int a_frag[8];
- int b_frag[8];
- int c_frag[8];
- int acc_frag[8];
-
- acc_frag[0]=0;
- acc_frag[1]=0;
- acc_frag[2]=0;
- acc_frag[3]=0;
- acc_frag[4]=0;
- acc_frag[5]=0;
- acc_frag[6]=0;
- acc_frag[7]=0;
-
- // Loop over k
- for (int i = 0; i < K; i += WMMA_K) {
- int aRow = warpM * WMMA_M;
- int aCol = i;
-
- int bRow = i;
- int bCol = warpN * WMMA_N;
-
- // Bounds checking
- if (aRow < M && aCol < K && bRow < K && bCol < N) {
- // Load the inputs
- // vp::load_matrix_sync(a_frag, a + aRow * lda+ aCol , lda);
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.load.a.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" :
- "=r"(a_frag[0]), "=r"(a_frag[1]),"=r"(a_frag[2]),"=r"(a_frag[3]),
- "=r"(a_frag[4]),"=r"(a_frag[5]),"=r"(a_frag[6]),"=r"(a_frag[7]):
- "l"(a+aRow*lda+aCol),"r"(lda)
- );
- asm("CPTX_END");
- asm("*/");
- //vp::load_matrix_sync(b_frag, b + bRow * ldb+ bCol , ldb);
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.load.b8.sync.row.m16n16k16.s32 {%0,%1},[%2],%3;" :
- "=r"(b_frag[0]),"=r"(b_frag[1]):
- "l"(b+bRow*ldb/4+bCol/4),"r"(ldb)
- );
- asm("CPTX_END");
- asm("*/");
-
- // Perform the matrix multiplication
- //vp::mma_sync(acc_frag, a_frag, b_frag, acc_frag);
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.mma8.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16, %17}, {%18, %19, %20, %21, %22, %23, %24, %25};" :
- "=r"(acc_frag[0]), "=r"(acc_frag[1]),"=r"(acc_frag[2]),"=r"(acc_frag[3]),
- "=r"(acc_frag[4]),"=r"(acc_frag[5]),"=r"(acc_frag[6]),"=r"(acc_frag[7]):
- "r"(a_frag[0]),"r"(a_frag[1]),"r"(a_frag[2]),"r"(a_frag[3]),
- "r"(a_frag[4]),"r"(a_frag[5]),"r"(a_frag[6]),"r"(a_frag[7]),
- "r"(b_frag[0]),"r"(b_frag[1]),
- "r"(acc_frag[0]),"r"(acc_frag[1]),"r"(acc_frag[2]),"r"(acc_frag[3]),
- "r"(acc_frag[4]),"r"(acc_frag[5]),"r"(acc_frag[6]),"r"(acc_frag[7])
- );
- asm("CPTX_END");
- asm("*/");
-
- }
- }
-
- // Load in the current value of c, scale it by beta, and add this our result scaled by alpha
- int cRow = warpM * WMMA_M;
- int cCol = warpN * WMMA_N;
-
- if (cRow < M && cCol < N) {
- //vp::load_matrix_sync(c_frag, c + cRow*ldc + cCol , ldc, wmma::mem_row_major);
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.load.c.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" :
- "=r"(c_frag[0]), "=r"(c_frag[1]),"=r"(c_frag[2]),"=r"(c_frag[3]),
- "=r"(c_frag[4]),"=r"(c_frag[5]),"=r"(c_frag[6]),"=r"(c_frag[7]):
- "l"(c+cRow*ldc+cCol),"r"(ldc)
- );
- asm("CPTX_END");
- asm("*/");
-
-
- for(int i=0; i < 8; i++) {
- c_frag[i] = acc_frag[i] + c_frag[i];
- }
-
- // Store the output
- //vp::store_matrix_sync(c + cRow *ldc + cCol , c_frag, ldc, wmma::mem_row_major);
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.store.d.sync.row.m16n16k16.s32 [%0], {%1,%2,%3,%4,%5,%6,%7,%8},%9;" :
- :"l"(c+cRow*ldc+cCol),
- "r"(c_frag[0]), "r"(c_frag[1]),"r"(c_frag[2]),"r"(c_frag[3]),
- "r"(c_frag[4]),"r"(c_frag[5]),"r"(c_frag[6]),"r"(c_frag[7]),
- "r"(ldc)
- );
- asm("CPTX_END");
- asm("*/");
- }
-}
-
-__global__ void convertFp32ToFp16 (half *out, float *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-__global__ void convertFp16ToFp32 (float *out, half *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-
-__global__ void convertInt32ToInt4 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n/8) {
- out[idx] =(in[8*idx]&0xf)|(in[8*idx+1]&0xf)<<4|(in[8*idx+2]&0xf)<<8|(in[8*idx+3]&0xf)<<12|
- (in[8*idx+4]&0xf)<<16|(in[8*idx+5]&0xf)<<20|(in[8*idx+6]&0xf)<<24|(in[8*idx+7]&0xf)<<28;
- }
-}
-__global__ void convertInt32ToInt8 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n/4) {
- out[idx] =(in[4*idx]&0xff)|(in[4*idx+1]&0xff)<<8|(in[4*idx+2]&0xff)<<16|(in[4*idx+3]&0xff)<<24;
- }
-}
-__global__ void convertInt32ToInt16 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n/2) {
- out[idx] =(in[2*idx]&0xffff)|(in[2*idx+1]&0xffff)<<16;
- }
-}
-
-__global__ void convertInt4ToInt32 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- int shft_amt=4*(idx%8);
- int shft_mask=0xf<<shft_amt;
- if (idx < n) {
- out[idx]= (in[idx/8]&shft_mask)>>shft_amt;
- }
-}
-__global__ void convertInt8ToInt32 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- int shft_amt=8*(idx%4);
- int shft_mask=0xff<<shft_amt;
- if (idx < n) {
- out[idx]= (in[idx/4]&shft_mask)>>shft_amt;
- }
-}
-__global__ void convertInt16ToInt32 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- int shft_amt=16*(idx%2);
- int shft_mask=0xffff<<shft_amt;
- if (idx < n) {
- out[idx]= (in[idx/2]&shft_mask)>>shft_amt;
- }
-}
-
-int main(int argc, char* argv[]) {
- int *a_int32;
- int *b_int32;
- int *c_int32;
- int *d_int32;
-
- int *a_int4;
- int *b_int4;
- int *a_int8;
- int *b_int8;
- int *a_int16;
- int *b_int16;
-
- int *a_host_wmma;
- int *b_host_wmma;
- int *c_host_wmma;
- int *d_host_wmma;
- int *d_cal_host_wmma;
-
- cudaEvent_t startWMMA;
- cudaEvent_t stopWMMA;
-
- srand(time(NULL));
- cudaErrCheck(cudaEventCreate(&startWMMA));
- cudaErrCheck(cudaEventCreate(&stopWMMA));
-
- // Use tensor cores
- cudaErrCheck(cudaMalloc((void**)&a_int32, MATRIX_M * MATRIX_K * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&b_int32, MATRIX_K * MATRIX_N * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&c_int32, MATRIX_K * MATRIX_N * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&d_int32, MATRIX_K * MATRIX_N * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&a_int4, MATRIX_M * MATRIX_K * sizeof(int)/8));
- cudaErrCheck(cudaMalloc((void**)&b_int4, MATRIX_K * MATRIX_N * sizeof(int)/8));
- cudaErrCheck(cudaMalloc((void**)&a_int8, MATRIX_M * MATRIX_K * sizeof(int)/4));
- cudaErrCheck(cudaMalloc((void**)&b_int8, MATRIX_K * MATRIX_N * sizeof(int)/4));
- cudaErrCheck(cudaMalloc((void**)&a_int16, MATRIX_M * MATRIX_K * sizeof(int)/2));
- cudaErrCheck(cudaMalloc((void**)&b_int16, MATRIX_K * MATRIX_N * sizeof(int)/2));
-
-
- a_host_wmma = (int *)malloc(MATRIX_M * MATRIX_K * sizeof(int));
- b_host_wmma = (int *)malloc(MATRIX_K * MATRIX_N * sizeof(int));
- c_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int));
- d_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int));
- d_cal_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int));
-
- printf("a_int32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_K;n++){
- a_host_wmma[m*MATRIX_K+n]=random()%5;
- printf("%d ",a_host_wmma[m*MATRIX_K+n]);
- }
- printf(";\n");
- }
-
- printf("b_int32\n");
- for(int m=0;m<MATRIX_K;m++){
- for(int n=0;n<MATRIX_N;n++){
- b_host_wmma[m*MATRIX_N+n]=random()%32;
- printf("%d ",b_host_wmma[m*MATRIX_N+n]);
- }
- printf(";\n");
- }
-
- printf("c_int32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- c_host_wmma[m*MATRIX_N+n]=random()%32;
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- printf("%d ",c_host_wmma[m*MATRIX_N+n]);
- }
- printf(";\n");
- }
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
-
-
- cudaErrCheck(cudaMemcpy(a_int32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(int), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(b_int32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(c_int32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice));
-
- #ifdef TEST16
- convertInt32ToInt16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_int16, a_int32, MATRIX_M * MATRIX_K);
- convertInt16ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, a_int16, MATRIX_M * MATRIX_K);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost));
- #endif
- #ifdef TEST8
- convertInt32ToInt8 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_int8, a_int32, MATRIX_M * MATRIX_K);
- convertInt8ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, a_int8, MATRIX_M * MATRIX_K);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost));
- #endif
- #ifdef TEST4
- convertInt32ToInt4 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int4, b_int32, MATRIX_M * MATRIX_K);
- convertInt4ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, b_int4, MATRIX_M * MATRIX_K);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost));
- #endif
- convertInt32ToInt8 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int8, b_int32, MATRIX_M * MATRIX_K);
-
- dim3 gridDim;
- dim3 blockDim;
-
- // blockDim.x must be a multple of warpSize
- // 128x4 means we have 16 warps and a block computes a 64x64 output tile
- blockDim.x = 64;
- blockDim.y = 2;
-
- gridDim.x = (MATRIX_M + (WMMA_M * blockDim.x / 32 - 1)) / (WMMA_M * blockDim.x / 32);
- gridDim.y = (MATRIX_N + WMMA_N * blockDim.y - 1) / (WMMA_N * blockDim.y);
- printf("GRID:X=%d,Y=%d\n",gridDim.x,gridDim.y);
- printf("BLOCK:X=%d,Y=%d\n",blockDim.x,blockDim.y);
-
-
- printf("Running with wmma...\n");
- cudaErrCheck(cudaEventRecord(startWMMA));
- vp_example <<< gridDim, blockDim >>> (a_int32, b_int8, c_int32, MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
-
- // Error checking
- printf("\nChecking results...\n");
- cudaErrCheck(cudaMemcpy(d_host_wmma, c_int32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
-
- float wmmaTime;
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma took %fms\n", wmmaTime);
-
- cudaErrCheck(cudaEventDestroy(startWMMA));
- cudaErrCheck(cudaEventDestroy(stopWMMA));
-
- int t=1000000;
- while(t-->0);
- printf("D_CALCULATED\n");
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%d,",d_cal_host_wmma[m*MATRIX_N+n]);
- }
- printf("\n");
- }
- printf("D_WMMA\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%d,",d_host_wmma[m*MATRIX_N+n]);
- }
- printf("\n");
- }
- int suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n]))
- {
- printf("ERROR:\n");
- suc=0;
- }
- }
- }
- if(suc==1)
- printf("COMPLETED_SUCCESSFULLY\n");
-
-
- cudaErrCheck(cudaFree(a_int32));
- cudaErrCheck(cudaFree(b_int32));
- cudaErrCheck(cudaFree(c_int32));
- cudaErrCheck(cudaFree(d_int32));
- cudaErrCheck(cudaFree(a_int8));
- cudaErrCheck(cudaFree(b_int8));
-
- free(a_host_wmma);
- free(b_host_wmma);
- free(c_host_wmma);
- free(d_host_wmma);
- cudaErrCheck(cudaDeviceReset());
- return 0;
-}
-
-
diff --git a/cuda-kernels/v8p_kernel.cu b/cuda-kernels/v8p_kernel.cu
deleted file mode 100644
index 9bfcea7..0000000
--- a/cuda-kernels/v8p_kernel.cu
+++ /dev/null
@@ -1,359 +0,0 @@
-#include <stdio.h>
-#include <curand.h>
-#include<stdlib.h>
-
-// Define some error checking macros.
-#define cudaErrCheck(stat) { cudaErrCheck_((stat), __FILE__, __LINE__); }
-void cudaErrCheck_(cudaError_t stat, const char *file, int line) {
- if (stat != cudaSuccess) {
- fprintf(stderr, "CUDA Error: %s %s %d\n", cudaGetErrorString(stat), file, line);
- }
-}
-
-#define curandErrCheck(stat) { curandErrCheck_((stat), __FILE__, __LINE__); }
-void curandErrCheck_(curandStatus_t stat, const char *file, int line) {
- if (stat != CURAND_STATUS_SUCCESS) {
- fprintf(stderr, "cuRand Error: %d %s %d\n", stat, file, line);
- }
-}
-
-#include <mma.h>
-using namespace nvcuda;
-
-// Must be multiples of 16 for wmma code to work
-#define MATRIX_M (16)
-#define MATRIX_N (16)
-#define MATRIX_K (16)
-
-
-// The only dimensions currently supported by WMMA
-const int WMMA_M = 16;
-const int WMMA_N = 16;
-const int WMMA_K = 16;
-
-__global__ void v4p_example(int *a_int32, int *b_int4, int *c,int *d_int32, int M, int N, int K) {
-
- int registers_a[8];
- int registers_b[8];
- int registers_c[8];
- int registers_d[8];
- int register_b; //contains 8 4bit b elements
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
-
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.load.a.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" :
- "=r"(registers_a[0]), "=r"(registers_a[1]),"=r"(registers_a[2]),"=r"(registers_a[3]),
- "=r"(registers_a[4]),"=r"(registers_a[5]),"=r"(registers_a[6]),"=r"(registers_a[7]):
- "l"(a_int32),"r"(M)
- );
- asm("CPTX_END");
- asm("*/");
-
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.load.b8.sync.row.m16n16k16.s32 {%0,%1},[%2],%3;" :
- "=r"(registers_b[0]),"=r"(registers_b[1]):
- "l"(b_int4),"r"(M)
- );
- asm("CPTX_END");
- asm("*/");
-
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.load.c.sync.row.m16n16k16.s32 {%0,%1,%2,%3,%4,%5,%6,%7},[%8],%9;" :
- "=r"(registers_c[0]), "=r"(registers_c[1]),"=r"(registers_c[2]),"=r"(registers_c[3]),
- "=r"(registers_c[4]),"=r"(registers_c[5]),"=r"(registers_c[6]),"=r"(registers_c[7]):
- "l"(c),"r"(M)
- );
- asm("CPTX_END");
- asm("*/");
- //B4
- //asm("/*");
- //asm("CPTX_BEGIN");
- //asm("vp.mma.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16}, {%17, %18, %19, %20, %21, %22, %23, %24};" :
- //"=r"(registers_d[0]), "=r"(registers_d[1]),"=r"(registers_d[2]),"=r"(registers_d[3]),
- //"=r"(registers_d[4]),"=r"(registers_d[5]),"=r"(registers_d[6]),"=r"(registers_d[7]):
- //"r"(registers_a[0]),"r"(registers_a[1]),"r"(registers_a[2]),"r"(registers_a[3]),
- //"r"(registers_a[4]),"r"(registers_a[5]),"r"(registers_a[6]),"r"(registers_a[7]),
- //"r"(registers_b[0]),
- //"r"(registers_c[0]),"r"(registers_c[1]),"r"(registers_c[2]),"r"(registers_c[3]),
- //"r"(registers_c[4]),"r"(registers_c[5]),"r"(registers_c[6]),"r"(registers_c[7])
- //);
- //asm("CPTX_END");
- //asm("*/");
-
- //B8
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.mma8.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16, %17}, {%18, %19, %20, %21, %22, %23, %24, %25};" :
- "=r"(registers_d[0]), "=r"(registers_d[1]),"=r"(registers_d[2]),"=r"(registers_d[3]),
- "=r"(registers_d[4]),"=r"(registers_d[5]),"=r"(registers_d[6]),"=r"(registers_d[7]):
- "r"(registers_a[0]),"r"(registers_a[1]),"r"(registers_a[2]),"r"(registers_a[3]),
- "r"(registers_a[4]),"r"(registers_a[5]),"r"(registers_a[6]),"r"(registers_a[7]),
- "r"(registers_b[0]),"r"(registers_b[1]),
- "r"(registers_c[0]),"r"(registers_c[1]),"r"(registers_c[2]),"r"(registers_c[3]),
- "r"(registers_c[4]),"r"(registers_c[5]),"r"(registers_c[6]),"r"(registers_c[7])
- );
- asm("CPTX_END");
- asm("*/");
-
- //B16
- //asm("/*");
- //asm("CPTX_BEGIN");
- //asm("vp.mma.sync.row.row.m16n16k16.s32 {%0, %1, %2, %3, %4, %5, %6, %7}, {%8, %9, %10, %11, %12, %13, %14, %15}, {%16, %17, %18, %19}, { %20, %21, %22, %23, %24, %25, %26, %27};" :
- //"=r"(registers_d[0]), "=r"(registers_d[1]),"=r"(registers_d[2]),"=r"(registers_d[3]),
- //"=r"(registers_d[4]),"=r"(registers_d[5]),"=r"(registers_d[6]),"=r"(registers_d[7]):
- //"r"(registers_a[0]),"r"(registers_a[1]),"r"(registers_a[2]),"r"(registers_a[3]),
- //"r"(registers_a[4]),"r"(registers_a[5]),"r"(registers_a[6]),"r"(registers_a[7]),
- //"r"(registers_b[0]),"r"(registers_b[1]),"r"(registers_b[2]),"r"(registers_b[3]),
- //"r"(registers_c[0]),"r"(registers_c[1]),"r"(registers_c[2]),"r"(registers_c[3]),
- //"r"(registers_c[4]),"r"(registers_c[5]),"r"(registers_c[6]),"r"(registers_c[7])
- //);
- //asm("CPTX_END");
- //asm("*/");
-
- asm("/*");
- asm("CPTX_BEGIN");
- asm("vp.store.d.sync.row.m16n16k16.s32 [%0], {%1,%2,%3,%4,%5,%6,%7,%8},%9;" :
- :"l"(d_int32)
- "r"(registers_d[0]), "r"(registers_d[1]),"r"(registers_d[2]),"r"(registers_d[3]),
- "r"(registers_d[4]),"r"(registers_d[5]),"r"(registers_d[6]),"r"(registers_d[7]),
- "r"(M)
- );
- asm("CPTX_END");
- asm("*/");
- //d_int32[0]=registers_d[0];
-}
-
-__global__ void convertFp32ToFp16 (half *out, float *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-__global__ void convertFp16ToFp32 (float *out, half *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n) {
- out[idx] = in[idx];
- }
-}
-
-__global__ void convertInt32ToInt4 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n/8) {
- out[idx] =(in[8*idx]&0xf)|(in[8*idx+1]&0xf)<<4|(in[8*idx+2]&0xf)<<8|(in[8*idx+3]&0xf)<<12|
- (in[8*idx+4]&0xf)<<16|(in[8*idx+5]&0xf)<<20|(in[8*idx+6]&0xf)<<24|(in[8*idx+7]&0xf)<<28;
- }
-}
-__global__ void convertInt32ToInt8 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n/4) {
- out[idx] =(in[4*idx]&0xff)|(in[4*idx+1]&0xff)<<8|(in[4*idx+2]&0xff)<<16|(in[4*idx+3]&0xff)<<24;
- }
-}
-__global__ void convertInt32ToInt16 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- if (idx < n/2) {
- out[idx] =(in[2*idx]&0xffff)|(in[2*idx+1]&0xffff)<<16;
- }
-}
-
-__global__ void convertInt4ToInt32 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- int shft_amt=4*(idx%8);
- int shft_mask=0xf<<shft_amt;
- if (idx < n) {
- out[idx]= (in[idx/8]&shft_mask)>>shft_amt;
- }
-}
-__global__ void convertInt8ToInt32 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- int shft_amt=8*(idx%4);
- int shft_mask=0xff<<shft_amt;
- if (idx < n) {
- out[idx]= (in[idx/4]&shft_mask)>>shft_amt;
- }
-}
-__global__ void convertInt16ToInt32 (int *out, int *in, int n) {
- int idx = blockDim.x * blockIdx.x + threadIdx.x;
- int shft_amt=16*(idx%2);
- int shft_mask=0xffff<<shft_amt;
- if (idx < n) {
- out[idx]= (in[idx/2]&shft_mask)>>shft_amt;
- }
-}
-
-int main(int argc, char* argv[]) {
- int *a_int32;
- int *b_int32;
- int *c_int32;
- int *d_int32;
-
- int *a_int4;
- int *b_int4;
- int *a_int8;
- int *b_int8;
- int *a_int16;
- int *b_int16;
-
- int *a_host_wmma;
- int *b_host_wmma;
- int *c_host_wmma;
- int *d_host_wmma;
- int *d_cal_host_wmma;
-
- cudaEvent_t startWMMA;
- cudaEvent_t stopWMMA;
- srand(time(NULL));
-
- cudaErrCheck(cudaEventCreate(&startWMMA));
- cudaErrCheck(cudaEventCreate(&stopWMMA));
-
- // Use tensor cores
- cudaErrCheck(cudaMalloc((void**)&a_int32, MATRIX_M * MATRIX_K * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&b_int32, MATRIX_K * MATRIX_N * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&c_int32, MATRIX_K * MATRIX_N * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&d_int32, MATRIX_K * MATRIX_N * sizeof(int)));
- cudaErrCheck(cudaMalloc((void**)&a_int4, MATRIX_M * MATRIX_K * sizeof(int)/8));
- cudaErrCheck(cudaMalloc((void**)&b_int4, MATRIX_K * MATRIX_N * sizeof(int)/8));
- cudaErrCheck(cudaMalloc((void**)&a_int8, MATRIX_M * MATRIX_K * sizeof(int)/4));
- cudaErrCheck(cudaMalloc((void**)&b_int8, MATRIX_K * MATRIX_N * sizeof(int)/4));
- cudaErrCheck(cudaMalloc((void**)&a_int16, MATRIX_M * MATRIX_K * sizeof(int)/2));
- cudaErrCheck(cudaMalloc((void**)&b_int16, MATRIX_K * MATRIX_N * sizeof(int)/2));
-
-
- a_host_wmma = (int *)malloc(MATRIX_M * MATRIX_K * sizeof(int));
- b_host_wmma = (int *)malloc(MATRIX_K * MATRIX_N * sizeof(int));
- c_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int));
- d_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int));
- d_cal_host_wmma = (int *)malloc(MATRIX_M * MATRIX_N * sizeof(int));
-
- printf("a_int32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_K;n++){
- a_host_wmma[m*MATRIX_K+n]=random()%10;
- printf("%d ",a_host_wmma[m*MATRIX_K+n]);
- }
- printf(";\n");
- }
-
- printf("b_int32\n");
- for(int m=0;m<MATRIX_K;m++){
- for(int n=0;n<MATRIX_N;n++){
- b_host_wmma[m*MATRIX_N+n]=random()%5;
- printf("%d ",b_host_wmma[m*MATRIX_N+n]);
- }
- printf(";\n");
- }
-
- printf("c_int32\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- c_host_wmma[m*MATRIX_N+n]=random()%64;
- d_cal_host_wmma[m*MATRIX_N+n]=0;
- printf("%d ",c_host_wmma[m*MATRIX_N+n]);
- }
- printf(";\n");
- }
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- for(int k=0;k<MATRIX_K;k++){
- d_cal_host_wmma[m*MATRIX_N+n]+= a_host_wmma[m*MATRIX_K+k]*b_host_wmma[k*MATRIX_K+n];
- }
- d_cal_host_wmma[m*MATRIX_N+n]+=c_host_wmma[m*MATRIX_N+n];
- }
- }
-
-
- cudaErrCheck(cudaMemcpy(a_int32,a_host_wmma, MATRIX_M * MATRIX_K * sizeof(int), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(b_int32,b_host_wmma, MATRIX_K * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice));
- cudaErrCheck(cudaMemcpy(c_int32,c_host_wmma, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyHostToDevice));
-
- #ifdef TEST16
- convertInt32ToInt16 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_int16, a_int32, MATRIX_M * MATRIX_K);
- convertInt16ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, a_int16, MATRIX_M * MATRIX_K);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost));
- #endif
- #ifdef TEST8
- convertInt32ToInt8 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (a_int8, a_int32, MATRIX_M * MATRIX_K);
- convertInt8ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, a_int8, MATRIX_M * MATRIX_K);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost));
- #endif
- #ifdef TEST4
- convertInt32ToInt4 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int4, b_int32, MATRIX_M * MATRIX_K);
- convertInt4ToInt32 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (d_int32, b_int4, MATRIX_M * MATRIX_K);
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(int), cudaMemcpyDeviceToHost));
- #endif
- convertInt32ToInt8 <<< (MATRIX_M * MATRIX_K + 255) / 256, 256 >>> (b_int8, b_int32, MATRIX_M * MATRIX_K);
- //convertFp32ToFp16 <<< (MATRIX_K * MATRIX_N + 255) / 256, 256 >>> (b_fp16, b_fp32, MATRIX_K * MATRIX_N);
- //convertFp32ToFp16 <<< (MATRIX_M * MATRIX_N + 255) / 256, 256 >>> (c_fp16, c_fp32, MATRIX_K * MATRIX_N);
-
-
-//AAMIR printf("\nM = %d, N = %d, K = %d. \n", MATRIX_M, MATRIX_N, MATRIX_K);
-//AAMIR
-//AAMIR printf("Running with wmma...\n");
- cudaErrCheck(cudaEventRecord(startWMMA));
- v4p_example <<< 1, 32>>> (a_int32, b_int8, c_int32, d_int32, MATRIX_M, MATRIX_N, MATRIX_K);
- cudaErrCheck(cudaEventRecord(stopWMMA));
- cudaErrCheck(cudaEventSynchronize(stopWMMA));
-
-
- // Error checking
- printf("\nChecking results...\n");
- cudaErrCheck(cudaMemcpy(d_host_wmma, d_int32, MATRIX_M * MATRIX_N * sizeof(float), cudaMemcpyDeviceToHost));
-
- float wmmaTime;
- cudaErrCheck(cudaEventElapsedTime(&wmmaTime, startWMMA, stopWMMA));
- printf("wmma took %fms\n", wmmaTime);
-
- cudaErrCheck(cudaEventDestroy(startWMMA));
- cudaErrCheck(cudaEventDestroy(stopWMMA));
-
- int t=2000000;
- while(t-->0);
- printf("D_CALCULATED\n");
-
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%d,",d_cal_host_wmma[m*MATRIX_N+n]);
- }
- printf("\n");
- }
- printf("D_WMMA\n");
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- printf("%d,",d_host_wmma[m*MATRIX_N+n]);
- }
- printf("\n");
- }
- int suc=1;
- for(int m=0;m<MATRIX_M;m++){
- for(int n=0;n<MATRIX_N;n++){
- if(abs(d_cal_host_wmma[m*MATRIX_N+n]-d_host_wmma[m*MATRIX_N+n]))
- {
- printf("ERROR:\n");
- suc=0;
- }
- }
- }
- if(suc==1)
- printf("COMPLETED_SUCCESSFULLY\n");
-
-
- cudaErrCheck(cudaFree(a_int32));
- cudaErrCheck(cudaFree(b_int32));
- cudaErrCheck(cudaFree(c_int32));
- cudaErrCheck(cudaFree(d_int32));
- cudaErrCheck(cudaFree(a_int8));
- cudaErrCheck(cudaFree(b_int8));
-
- free(a_host_wmma);
- free(b_host_wmma);
- free(c_host_wmma);
- free(d_host_wmma);
- cudaErrCheck(cudaDeviceReset());
- return 0;
-}
-
-