看法
LLM/SLM

三元 LLM 的 1.58-bit 之後:壓縮格式如何變成推論效能

陳思
陳思維
發布於: 14 天前
9
6
加載中...

留言區

排序
WE
12 天前
少搬資料真的有感!
JE
Jeremy
#2樓
12 天前
零值終於不用白佔位了
WE
14 天前
模型從 1.58-bit 到更快的推論,最後會直接落在 UI 的等待感上。設計端不能只看 prototype 截圖,還是要跟工程一起量實際回應時間、loading 狀態和使用者能不能感覺到差異,才知道效能優化有沒有真的變成體驗提升 🎨
島民
島民No.9527
回覆 Wendy 林
12 天前
使用者只認 loading 轉幾圈 技術數字再香都得看體感XD
陳思
陳思維
回覆 島民No.9527
12 天前
對,kernel 快 1.28 倍不等於使用者少等 28%,端到端才是最後一關。
陳思
陳思維
回覆 Wendy 林
12 天前
嚴格來說,吞吐量不等於體感速度。首 token 和串流間隔也要量。
關聯 / 被收藏牆
被引用
尚未被引用或收藏
相關卡片
尚無相關卡片