BeefAndPoultry@lemmus.orgEnglish · edit-25 小时前llama.cpp in progress pull request for smart caching of MoE experts, 16% to 35% TPS boost for my RTX 2080plus-squaregithub.comexternal-linkmessage-square2linkfedilinkarrow-up114arrow-down10
arrow-up114arrow-down1external-linkllama.cpp in progress pull request for smart caching of MoE experts, 16% to 35% TPS boost for my RTX 2080plus-squaregithub.comBeefAndPoultry@lemmus.orgEnglish · edit-25 小时前message-square2linkfedilink
SirDimples@programming.devEnglish · 2 天前GLM-5.3 Imminent dropplus-squaregithub.comexternal-linkmessage-square7linkfedilinkarrow-up130arrow-down12
arrow-up128arrow-down1external-linkGLM-5.3 Imminent dropplus-squaregithub.comSirDimples@programming.devEnglish · 2 天前message-square7linkfedilink
BeefAndPoultry@lemmus.orgEnglish · 2 天前Qwen 3.8 Max (2.4T-a95b) and 27B open weights being released next weekplus-squarelemmus.orgimagemessage-square20linkfedilinkarrow-up1118arrow-down18
arrow-up1110arrow-down1imageQwen 3.8 Max (2.4T-a95b) and 27B open weights being released next weekplus-squarelemmus.orgBeefAndPoultry@lemmus.orgEnglish · 2 天前message-square20linkfedilink
BeefAndPoultry@lemmus.orgEnglish · 1 天前preserve_thinking fix for Gemma 4 templatesplus-squaremessage-squaremessage-square0linkfedilinkarrow-up113arrow-down10
arrow-up113arrow-down1message-squarepreserve_thinking fix for Gemma 4 templatesplus-squareBeefAndPoultry@lemmus.orgEnglish · 1 天前message-square0linkfedilink
BeefAndPoultry@lemmus.orgEnglish · 5 天前unsloth/DeepSeek-V4-Flash-0731-GGUF · Hugging Faceplus-squarehuggingface.coexternal-linkmessage-square7linkfedilinkarrow-up123arrow-down11
arrow-up122arrow-down1external-linkunsloth/DeepSeek-V4-Flash-0731-GGUF · Hugging Faceplus-squarehuggingface.coBeefAndPoultry@lemmus.orgEnglish · 5 天前message-square7linkfedilink
BeefAndPoultry@lemmus.orgEnglish · edit-26 天前How to run Qwen 35b-a3b on 4GB to 8GB of VRAM (with 24+GB system RAM)plus-squaremessage-squaremessage-square5linkfedilinkarrow-up149arrow-down12
arrow-up147arrow-down1message-squareHow to run Qwen 35b-a3b on 4GB to 8GB of VRAM (with 24+GB system RAM)plus-squareBeefAndPoultry@lemmus.orgEnglish · edit-26 天前message-square5linkfedilink
leanleft@lemmy.mlEnglish · 5 天前model: deepseek-moe-16bplus-squaregithub.comexternal-linkmessage-square0linkfedilinkarrow-up19arrow-down12
arrow-up17arrow-down1external-linkmodel: deepseek-moe-16bplus-squaregithub.comleanleft@lemmy.mlEnglish · 5 天前message-square0linkfedilink
wartzarlab@lemmy.1095.meEnglish · 8 天前Field note: measuring your context budget before a run, not afterplus-squaremessage-squaremessage-square2linkfedilinkarrow-up12arrow-down12
arrow-up10arrow-down1message-squareField note: measuring your context budget before a run, not afterplus-squarewartzarlab@lemmy.1095.meEnglish · 8 天前message-square2linkfedilink
ikt@aussie.zoneEnglish · 9 天前Kimi-K3 Releases on HuggingFace ~7 hours from this postplus-squarehuggingface.coexternal-linkmessage-square1linkfedilinkarrow-up122arrow-down11
arrow-up121arrow-down1external-linkKimi-K3 Releases on HuggingFace ~7 hours from this postplus-squarehuggingface.coikt@aussie.zoneEnglish · 9 天前message-square1linkfedilink
troed@fedia.io · 11 天前llama rpc exists and works really wellplus-squaregithub.comexternal-linkmessage-square7linkfedilinkarrow-up128arrow-down14
arrow-up124arrow-down1external-linkllama rpc exists and works really wellplus-squaregithub.comtroed@fedia.io · 11 天前message-square7linkfedilink
leanleft@lemmy.mlEnglish · 11 天前how many models have you collected locally?plus-squaremessage-squaremessage-square7linkfedilinkarrow-up18arrow-down12
arrow-up16arrow-down1message-squarehow many models have you collected locally?plus-squareleanleft@lemmy.mlEnglish · 11 天前message-square7linkfedilink
SuspiciousCarrot78@aussie.zoneEnglish · 13 天前Grug (caveman compression) of Qwen3.6-35 and 27B is good!plus-squaremessage-squaremessage-square8linkfedilinkarrow-up127arrow-down11
arrow-up126arrow-down1message-squareGrug (caveman compression) of Qwen3.6-35 and 27B is good!plus-squareSuspiciousCarrot78@aussie.zoneEnglish · 13 天前message-square8linkfedilink
ikt@aussie.zoneEnglish · 14 天前Kimi K3 is competitive with Fable; Kimi K3 + Fable is SoTA.plus-squarefireworks.aiexternal-linkmessage-square0linkfedilinkarrow-up114arrow-down10
arrow-up114arrow-down1external-linkKimi K3 is competitive with Fable; Kimi K3 + Fable is SoTA.plus-squarefireworks.aiikt@aussie.zoneEnglish · 14 天前message-square0linkfedilink
ikt@aussie.zoneEnglish · 14 天前Vibecode Benchmarksplus-squaresenko.netexternal-linkmessage-square1linkfedilinkarrow-up15arrow-down13
arrow-up12arrow-down1external-linkVibecode Benchmarksplus-squaresenko.netikt@aussie.zoneEnglish · 14 天前message-square1linkfedilink
troed@fedia.io · 20 天前Qwen 27B Q4 at usable speed on 16GB VRAMplus-squarewww.reddit.comexternal-linkmessage-square5linkfedilinkarrow-up133arrow-down12
arrow-up131arrow-down1external-linkQwen 27B Q4 at usable speed on 16GB VRAMplus-squarewww.reddit.comtroed@fedia.io · 20 天前message-square5linkfedilink
Shifu@lemmy.worldEnglish · 20 天前Spent two weeks on a kernel that benchmarked 29x faster. End to end it's maybe 6-10%, and it's not even wired in yet.plus-squaremessage-squaremessage-square5linkfedilinkarrow-up119arrow-down13
arrow-up116arrow-down1message-squareSpent two weeks on a kernel that benchmarked 29x faster. End to end it's maybe 6-10%, and it's not even wired in yet.plus-squareShifu@lemmy.worldEnglish · 20 天前message-square5linkfedilink
catch88@sh.itjust.worksEnglish · edit-222 天前I gave my local LLM agent a face — an avatar frontend with an "emotion-beat" output contract (open-source)plus-squaresh.itjust.worksimagemessage-square23linkfedilinkarrow-up120arrow-down120
arrow-up10arrow-down1imageI gave my local LLM agent a face — an avatar frontend with an "emotion-beat" output contract (open-source)plus-squaresh.itjust.workscatch88@sh.itjust.worksEnglish · edit-222 天前message-square23linkfedilink
troed@fedia.io · 23 天前My llama-server suddenly started error 400 on the chat template - this fixed itplus-squarehuggingface.coexternal-linkmessage-square0linkfedilinkarrow-up17arrow-down11
arrow-up16arrow-down1external-linkMy llama-server suddenly started error 400 on the chat template - this fixed itplus-squarehuggingface.cotroed@fedia.io · 23 天前message-square0linkfedilink
RainbowsInc@slrpnk.netEnglish · 26 天前Major Performance Dropplus-squaremessage-squaremessage-square6linkfedilinkarrow-up111arrow-down12
arrow-up19arrow-down1message-squareMajor Performance Dropplus-squareRainbowsInc@slrpnk.netEnglish · 26 天前message-square6linkfedilink
troed@fedia.io · 29 天前GPU bifurcation - optionsplus-squaremessage-squaremessage-square4linkfedilinkarrow-up15arrow-down10
arrow-up15arrow-down1message-squareGPU bifurcation - optionsplus-squaretroed@fedia.io · 29 天前message-square4linkfedilink