@inproceedings{comet_asplos_2025,title={COMET: Towards Practical W4A4KV4 LLMs Serving},author={Liu, Lian and Cheng, Long and Ren, Haimeng and Xu, Zhaohui and Pan, Yudong and Wang, Mengdi and Li, Xiaowei and Han, Yinhe and Wang, Ying},booktitle={30th ACM International Conference on Architectural Support for Programming Languages and Operating Systems},year={2025},doi={10.1145/3676641.3716252},}
Make LLM Inference Affordable to Everyone: Augmenting GPU Memory with NDP-DIMM
Lian
Liu, Shixin
Zhao, Bing
Li, Haimeng
Ren, Zhaohui
Xu, Mengdi
Wang, Xiaowei
Li, Yinhe
Han, and Ying
Wang
In 2025 IEEE International Symposium on High Performance Computer ArchitectureCCF A
, 2025
@inproceedings{ndp_dimm_hpca_2025,title={Make LLM Inference Affordable to Everyone: Augmenting GPU Memory with NDP-DIMM},author={Liu, Lian and Zhao, Shixin and Li, Bing and Ren, Haimeng and Xu, Zhaohui and Wang, Mengdi and Li, Xiaowei and Han, Yinhe and Wang, Ying},booktitle={2025 IEEE International Symposium on High Performance Computer Architecture},year={2025},doi={10.1109/HPCA61900.2025.00129},}
2024
Drift: Leveraging Distribution-based Dynamic Precision Quantization for Efficient Deep Neural Network Acceleration
Lian
Liu, Zhaohui
Xu, Yintao
He, Ying
Wang, Huawei
Li, Xiaowei
Li, and Yinhe
Han
In 61st ACM/IEEE Design Automation ConferenceCCF A
, 2024
@inproceedings{drift_dac_2024,title={Drift: Leveraging Distribution-based Dynamic Precision Quantization for Efficient Deep Neural Network Acceleration},author={Liu, Lian and Xu, Zhaohui and He, Yintao and Wang, Ying and Li, Huawei and Li, Xiaowei and Han, Yinhe},booktitle={61st ACM/IEEE Design Automation Conference},year={2024},doi={10.1145/3649329.3655986},}