想在自己的電腦或自家 GPU 上跑開源大模型?八堂課把整條路走一遍: 先選對推理引擎,看懂 KV Cache 這條貫穿選型、計費、加速的主線, 再學會把服務看好、把模型調成你的。全部在瀏覽器裡互動模擬,不用先買顯卡。
同一台機器、兩種脾氣——拉一下請求長度分佈,親眼看見 9% 對 98% 的記憶體利用率, 順便拆穿「快 34 倍」那種標題數字。
開始上課 → SAMPLING · 02temperature、top_p、penalty 看起來各管各的,其實全部在調同一顆不公平的骰子—— 拉一下拉桿、擲二十次骰子,你就懂了。
開始上課 → KV CACHE · 03快取=存會被重複讀的東西。看懂注意力怎麼算,就知道為什麼只存 K、V 不存 Q, 也知道為什麼開頭多一行時間戳,後面幾千字的前綴就全部作廢。
開始上課 → BILLING · 04對話歷史只增不改,所以那段越來越長的歷史幾乎不要錢——三輪省 32%、二十輪省 68%; 真正燒錢的是你在中途換了模型,算給你看。
開始上課 → OFFLOAD · 05KV cache 放不下就往 SSD 丟,划算嗎?實測最高快 2.3 倍—— 但算完你可能會鬆一口氣:省下的是一筆採購。
開始上課 → SPEC DECODE · 06反正權重都要搬一次,順便多驗五個字幾乎免費——用閒置算力換體感速度, 數學保證輸出一字不差。拉接受率拉桿,找出什麼時候反而會虧。
開始上課 → OBSERVE · 07同一句「LLM 變慢了」,Grafana 告訴你為什麼慢、trace 告訴你慢在哪一步—— 轉一下告警旋鈕,親眼看誤報怎麼消失、代價是什麼。
開始上課 → FINETUNE · 08凍結整本教科書,只貼一張幾 MB 的便利貼——參數量縮小 128 倍,效果幾乎一樣好。 α/r 控制力道、SFT 學模仿、DPO 學分辨好壞。
開始上課 →