Schedule
Class calendar
To see the full list of papers and their details, please refer to the Reading List tab.
Explanations of the presenter, advocate, and critic group roles are available in the Resources tab.
This schedule is subject to change and currently serves as a placeholder while we finalize discussion-group assignments and a few remaining class activities.
| Date | Classroom Agenda | Slide deck | Presenter Group | Advocate Group | Critic Group |
|---|---|---|---|---|---|
| August 25 | Instructor lecture - course overview | Slide deck | |||
| August 27 | Instructor lecture - hardware for AI | Slide deck | |||
| September 1 | Instructor lecture - language model basics | ||||
| September 3 | Paper discussion Efficient Memory Management for Large Language Model Serving with PagedAttention | zhong45, jinruih2, sehyeon2 | TBD | TBD | |
| September 8 | Paper discussion Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve | TBD | TBD | TBD | |
| September 10 | Paper discussion Splitwise: Efficient Generative LLM Inference Using Disaggregated Compute | nsatch3, bikrant2, pilarl2, dsun19 | TBD | TBD | |
| September 15 | Paper discussion Fast Inference from Large Language Models via Speculative Decoding | TBD | TBD | TBD | |
| September 17 | Paper discussion Triton: An Intermediate Language and Compiler for Tiled Neural Network Computations | TBD | TBD | TBD | |
| September 22 | No class | ||||
| September 24 | Paper discussion Mirage Persistent Kernel: A Compiler and Runtime for Mega-Kernelizing Tensor Programs | TBD | TBD | TBD | |
| September 29 | Paper discussion FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness | TBD | TBD | TBD | |
| October 1 | Google Guest Lecture Suvinay Subramanian | ||||
| October 6 | Intel Guest Lecture Mrittika Ganguli | ||||
| October 8 | Paper discussion Parrot: Efficient Serving of LLM-Based Applications with Semantic Variable | TBD | TBD | TBD | |
| October 13 | Paper discussion Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Architectures | TBD | TBD | TBD | |
| October 15 | NVIDIA Guest Lecture Vikram Sharma Mailthody | ||||
| October 20 | Midterm Project Review | ||||
| October 22 | Midterm Project Review | ||||
| October 27 | Gimlet Labs Guest Lecture Ankita Nayak | ||||
| October 29 | Paper discussion Patterns Behind Chaos: Forecasting Data Movement for Efficient Large-Scale MoE LLM Inference | TBD | TBD | TBD | |
| November 3 | Paper discussion Timeloop: A Systematic Approach to DNN Accelerator Evaluation | TBD | TBD | TBD | |
| November 5 | NVIDIA Guest Lecture Benjamin Klenk | ||||
| November 10 | Paper discussion SMEPilot: Characterizing and Optimizing LLM Inference with Scalable Matrix Extensions | TBD | TBD | TBD | |
| November 12 | Paper discussion Corsair: An In-Memory Computing Chiplet Architecture for Inference-Time Compute Acceleration | TBD | TBD | TBD | |
| November 17 | Paper discussion Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC | TBD | TBD | TBD | |
| November 19 | Cerebras Guest Lecture Ishita Chaturvedi | ||||
| November 24 | Fall break | ||||
| November 26 | Fall break | ||||
| December 1 | Paper discussion DynamoLLM: Designing LLM Inference Clusters for Performance and Energy Efficiency | TBD | TBD | TBD | |
| December 3 | |||||
| December 8 | Final project demonstration |