文章
全部文章列表。
-
WWW: What, When, Where to Compute-in-Memory
发布于:2,146 字约 9 分钟一些关于存内计算的验证与思考。
-
Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference
发布于:1,378 字约 6 分钟谷歌的,第一篇完整跑通 interger-only 量化推理流程的工作。
-
SpikeSim: An end-to-end Compute-in-Memory Hardware Evaluation Tool for Benchmarking Spiking Neural Networks
发布于:2,454 字约 10 分钟SNN 部署的硬件设计 or evaluation benchmark。
-
PowerInfer: Fast Large Language Model Serving with a Consumer-grade GPU
发布于:651 字约 3 分钟From IPADS, 利用模型预测 LLM 中需要激活的 MoE or Neuron,减少资源消耗。
-
Evaluating Spatial Accelerator Architectures with Tiled Matrix-Matrix Multiplication
发布于:2,635 字约 10 分钟GEMM data mapping 的介绍,主要是各种脉动阵列相关的加速器。
-
HAWQ: Hessian Aware Quantization of Neural Networks with Mixed-Precision
发布于:1,795 字约 7 分钟模型量化经典方法,基于黑森矩阵,一种二阶信息的量化方法。
-
Optimizing Bit-Serial Matrix Multiplication for Reconfigurable Computing
发布于:349 字约 2 分钟BISMO 优化。
-
TVM: An Automated End-to-End Optimizing Compiler for Deep Learning
发布于:2,010 字约 8 分钟TVM。
-
Roofline: An Insightful Visual Performance Model for Floating-Point Programs and Multicore Architectures
发布于:475 字约 2 分钟Roofline model,描述一个系统的性能是受内存制约还是受计算制约。
-
A Comprehensive Survey on Electronic Design Automation and Graph Neural Networks: Theory and Applications
发布于:1,508 字约 6 分钟图神经网络在 EDA 领域应用的综述。