Schedule

Class calendar

To see the full list of papers and their details, please refer to the Reading List tab.

Explanations of the presenter, advocate, and critic group roles are available in the Resources tab.

This schedule is subject to change and currently serves as a placeholder while we finalize discussion-group assignments and a few remaining class activities.

Date Classroom Agenda Slide deck Presenter Group Advocate Group Critic Group
August 25
Instructor lecture - course overview
Slide deck
August 27
Instructor lecture - hardware for AI
Slide deck
September 1
Instructor lecture - language model basics
Slide deck
September 3
Paper discussion
Efficient Memory Management for Large Language Model Serving with PagedAttention
Slide deckzhong45, jinruih2, sehyeon2neilas3, yrao5, mfp7kaidifu2
September 8
Paper discussion
Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve
Slide deckxz105, cmo8tylerba2neilas3, yrao5, mfp7
September 10
Paper discussion
Splitwise: Efficient Generative LLM Inference Using Disaggregated Compute
Slide decknsatch3, bikrant2, dsun19qpang2, fl22, jinjig2, zhang430zhong45, jinruih2, sehyeon2
September 15
Paper discussion
Fast Inference from Large Language Models via Speculative Decoding
apandey8, evanhz2, enguang2, yehyas2siddc2, coibe2, aryanns2, boddeti2haorany7, mf46, hongyic5
September 17
Paper discussion
Triton: An Intermediate Language and Compiler for Tiled Neural Network Computations
neilas3, yrao5, mfp7javierd3, hieunn2, nikunjm2, kk103nsatch3, bikrant2, dsun19
September 22
No class
September 24
Paper discussion
Mirage Persistent Kernel: A Compiler and Runtime for Mega-Kernelizing Tensor Programs
qpang2, fl22, jinjig2, zhang430kaidifu2xz105, cmo8
September 29
Paper discussion
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
siddc2, coibe2, aryanns2, boddeti2apandey8, evanhz2, enguang2, yehyas2qpang2, fl22, jinjig2, zhang430
October 1
Google Guest Lecture
Suvinay Subramanian
October 6
Intel Guest Lecture
Mrittika Ganguli
October 8
Paper discussion
Parrot: Efficient Serving of LLM-Based Applications with Semantic Variable
hsutzut2, ambikas2, junyep2zhong45, jinruih2, sehyeon2dagraw2, ssashi2
October 13
Paper discussion
Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Architectures
devansh9, vinaykp2nsatch3, bikrant2, dsun19apandey8, evanhz2, enguang2, yehyas2
October 15
NVIDIA Guest Lecture
Vikram Sharma Mailthody
October 20
Midterm Project Review
October 22
Midterm Project Review
October 27
Gimlet Labs Guest Lecture
Ankita Nayak
October 29
Paper discussion
Patterns Behind Chaos: Forecasting Data Movement for Efficient Large-Scale MoE LLM Inference
javierd3, hieunn2, nikunjm2, kk103dagraw2, ssashi2siddc2, coibe2, aryanns2, boddeti2
November 3
Paper discussion
Timeloop: A Systematic Approach to DNN Accelerator Evaluation
lifan3, mjbove2, vpal2, cyz4hsutzut2, ambikas2, junyep2devansh9, vinaykp2
November 5
NVIDIA Guest Lecture
Benjamin Klenk
November 10
Paper discussion
SMEPilot: Characterizing and Optimizing LLM Inference with Scalable Matrix Extensions
kaidifu2xz105, cmo8tylerba2
November 12
Paper discussion
Corsair: An In-Memory Computing Chiplet Architecture for Inference-Time Compute Acceleration
tylerba2devansh9, vinaykp2lifan3, mjbove2, vpal2, cyz4
November 17
Paper discussion
Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC
haorany7, mf46, hongyic5lifan3, mjbove2, vpal2, cyz4hsutzut2, ambikas2, junyep2
November 19
Cerebras Guest Lecture
Ishita Chaturvedi
November 24
Fall break
November 26
Fall break
December 1
Paper discussion
DynamoLLM: Designing LLM Inference Clusters for Performance and Energy Efficiency
dagraw2, ssashi2haorany7, mf46, hongyic5javierd3, hieunn2, nikunjm2, kk103
December 3
AMD Guest Lecture
Muhammad Awad
December 8
Final project demonstration