News · Daily Briefing
Tuesday · 1 Sep 2026 · PT

课堂 agent 日增三千。
本地栈在抠毫秒。

周二开场:OpenMAIC 一天 +3,122,科研 skills 与 ECC harness 同榜。LocalLLaMA 一边测 GLM-5.3 / Qwen3.8 MTP,一边盯 Gemma 上 Arena。公开讨论里,廉价 ARC 实验、开源模型半年报,以及 world model 产品叙事一起上桌。

范围 AI / 科技,少量相关政经
来源 GitHub Trending、Reddit hot(浏览器)、HN / 官方博文
X 未走付费接口

GitHub 疯涨

Official trending · ~8:23 AM PT
Today+3,122
29.1k

THU-MAIC/OpenMAIC

一键开的多 agent 沉浸式课堂。

清华 MAIC 的 Open Multi-Agent Interactive Classroom。TypeScript,周趋势约 +5,014。今天是日榜最凶的 AI 向仓库:agent 不再只卖编排 SDK,而在卖可点开的垂直体验。教育和多角色辅导,成了「agent 产品化」最容易讲清价值的切口。

multi-agenteducationtypescript
Today+1,005
56.9k

jingyaogong/minimind

两小时从头训一个 64M LLM。

面向教学与实验的小模型全流程:把 pretrain → SFT 压到消费级时间预算里。日增过千说明「小而可复现」仍在回潮。和日榜上的 freellmapi、本地语音栈同一天出现,本地 / 便宜路线没有退潮。

llm-trainingeducationlocal
Today+914
41.3k

K-Dense-AI/scientific-agent-skills

把任意 coding agent 变成「AI 科学家」。

165 个已校验科研 skill,外加百余科学数据库入口;兼容 Cursor、Claude Code、Codex 与开放 Agent Skills 标准。周趋势约 +6,248。行业技能包继续按领域拆分:生物 / 化学 / 医药比再写一个巨型 agent 更可传播。

skillsscienceagents
Today+745
13.4k

debpalash/VoiceStudio

全本地的开源 ElevenLabs 替代。

声音克隆、音色设计、视频配音、听写、转写与有声书,README 写覆盖 646 种语言。和 browser-use/video-use(日增约 +509)同日上榜:agent 正在按模态铺开,音频与视频都不再是附属 demo。

voicelocalcreative
Today+621
246k

affaan-m/ECC

面向 Claude Code / Cursor / Codex 的 agent harness。

技能、本能、记忆、安全与 research-first 工作流捆在一起。体量已到二十四万星量级,今天仍日增六百多:大家不再只追模型名,而在追「怎么让 harness 稳定跑长任务」。和 scientific-agent-skills 并列,正好是 skills + harness 双叙事。

harnessskillssecurity
Today+545
17.7k

firecrawl/pdf-inspector

Rust 写的 PDF 分流器:扫描件还是可抽取文本。

先分类再路由抽取,避免把 OCR 和纯文本解析混在一条慢路径上。Firecrawl 系继续补 agent 的数据入口;boring infra 一旦进日榜,说明 RAG / 文档 agent 的吞吐瓶颈已经从「能不能读」变成「怎么读得聪明」。

ragpdfrust
Today+161
44.7k

Imbad0202/academic-research-skills

Claude Code 的学术写作流水线 skill。

research → write → review → revise → finalize。和专利交底书 skill(handsomestWei/patent-disclosure-skill,日增约 +502)一起说明:知识工作正在被拆成可安装的步骤包,而不是一次 prompt 碰运气。

skillsresearchwriting
Week+22.1k
41.3k

tt-a1i/archify

可校验架构图的 agent skill,周榜仍在烧。

产出带动效、可导出的独立 HTML。周趋势约 +22,095,总量约 41.3k。昨天还在日榜霸榜,今天让位给 OpenMAIC,但周动量说明「别瞎画 Mermaid」这类生产技能已经沉淀成默认依赖。同周还有 cursor/plugins(+1,479)与 anthropics/claude-plugins-community(+1,846)。

skillsdiagramsweekly

Reddit

r/LocalLLaMA hot · browser snapshot
Score576
98c

GLM 5.3 / Flash 本地跑通,还用 BlenderMCP 搭了顶层公寓

高端消费卡上的本地 agent 演示帖。

r/LocalLLaMA 热帖:在 RTX PRO 6000 WS 上跑 GLM 5.3 与 Flash,并接 BlenderMCP 做场景搭建。评论区焦点不在「能不能跑」,而在显存、量化与工具链是否稳到能当日常 agent。本地模型 + MCP 工具面,继续是这个社区的主线。

LocalLLaMAGLMMCP
Score354
73c

Qwen3.8-Flash-Next-GGUF 上线 MTP

多 token 预测把本地吞吐再往上拧。

社区在追 MTP(multi-token prediction)对 Flash-Next GGUF 的实际加速。同板还有「3090 上 Qwen3.8-27B 冲到约 2000 prefill / 132 decode」(57↑ / 51c)和「Q4_K_M oneshot Super Mario 克隆」(64↑ / 43c):Qwen3.8 系这几天几乎垄断本地性能炫耀帖。

QwenGGUFMTP
Score306
149c

Arena 上出现新的 Gemma 模型

盲测榜一有风吹草动,评论就炸。

149 条评论说明大家仍把 LMSYS / Arena 当「今天该下哪个权」的信号灯。本地玩家关心的不只是参数量,还有新 Gemma 变体在真实对话里是否压过手里的 Qwen / GLM 量化档。

GemmaArenaeval
Score191
87c

别低估 Vision 对写代码的帮助

截图进上下文,正在变成 coding agent 标配。

帖子劝人认真接视觉:UI 报错、设计稿、终端花屏,很多时候一张图比三段文字描述更省 token。和 DeepSeek-V4-Flash-Vision 权重开放的讨论叠在一起,本地 coding 栈的多模态入口明显变热。

visioncodingagents
Score133
75c

ExLlamaV3:CPU offload、GLM-5.3-FLASH、Qwen3.8-Flash…

推理引擎更新帖,比模型发帖更耐读。

CPU offload 与新模型适配说明:本地生态的瓶颈经常在引擎层。能把 GLM / Qwen 新权重快速接进 ExLlama,比再多一个「我也跑通了」截图更有杠杆。

ExLlamainferenceoffload
Score116
48c

Puget Systems 一份让人看懵的报告

硬件评测数字对不上社区体感时,就会变成长帖。

本地玩家对工作站 / 多卡方案极度敏感。当厂商报告与日常 llama.cpp / vLLM 体感冲突,评论区会迅速变成「测法、驱动、量化、批大小」的对质现场。买卡之前先读这种帖,能少交智商税。

hardwarebenchmarks
Score50
6c

新模型:Spark-X2.5-4B / 1.7B

端侧 1M 上下文叙事,刚落到 LocalLLaMA。

分数不高但时间新:科大讯飞系 Spark X2.5 小模型开源,宣传原生百万 token 上下文,面向端侧与工具调用。旗舰更大参数版本的预告也在公网写稿里出现。端侧长上下文是否「真能用」,要看量化后的延迟,而不是参数表。

Sparkon-devicelong-context

X 公开讨论

Public web / HN · no paid X API
HN231
65c

44% on ARC-AGI-1,大约 67 美分

小 transformer + test-time training,不是堆 LLM。

作者强调样本效率:在 5090 上约 1.5 小时从头训到公开评估约 44%,并称与 TRM/HRM 同档对比。文中提到此前结果曾在 X 上被 Lucas Beyer、Jeremy Howard 等人讨论。今天 HN 热度说明「便宜、可复现的 ARC」仍能点燃研究圈,争论点依旧是 TTT / metalearning 边界。

ARC-AGIsample-efficiencyresearch
HFblog
+170

State of Open Models: Summer 2026

半年报:中国前沿开源、Qwen 底座化、agent 成 Hub 用户。

模型仓约 2.43M→2.96M;Qwen 衍生约 151,448(文中约为 Meta 足迹的 2.6×)。七月带 agent 标记的流量里,Claude Code 约 44.4%(四月曾约 67.8%),未登记客户端仍占近四分之一。报告还写到一次疑似自主 agent 入侵事件,最终用开源量化模型完成分析。今天也出现在 HN 首页。

HuggingFaceopen-modelsagents
LaunchAug 31
EA

Runway Solaris:Interface World Model

不是 codegen,而是一帧帧生成可交互界面。

Runway 官方稿与后续报道称其建立在 Gen-4.5 与 GWM-1 之上,强调实时交互与会话一致性,目前早期访问。RuntimeWire 等转述其在 X 上的「Interface World Model」提法。世界模型叙事正从视频续写,扩到「操作系统感」的 UI 生成。

Runwayworld-modelUI
NewsSep 1
$10M

Visko Orbis:长视频「live」世界模型 + 千万级预种子

连续可交互视频,而不是切片问答。

SiliconANGLE 今天报道 Visko 完成约 $10M 预种子并公开 Orbis。宣传点是持久隐状态 / world clock,以及长时间 4K@24fps 的厂商说法。和 Runway Solaris 同一周出现,说明「world model」标签正在被产品与融资同时征用,独立验证仍要看公开 demo 与复现。

videofundingworld-model
HN469
534c

Apple 被 Mac mini / Studio 的 AI 需求打了个措手不及

本地跑大模型,正在改写桌面硬件节奏。

MacRumors 援引 The Information:企业侧对可串联的 Mac Studio / mini 需求强到影响发售节奏;高配缺货与内存紧缺叠在一起。HN 评论过五百,讨论本地 AI 是否把「开发者工作站」重新变成战略品类。和 LocalLLaMA 的 Mac↔Linux 盒子帖同一周,硬件叙事很一致。

Applelocal-AIhardware
EssayDEV
skills

Skills vs Plugins vs MCP:别再混着买

工具面、流程面、打包面,三层不是同义词。

DEV 长文把 MCP(工具访问)、Skill(可重复工作流)、Plugin(Skill+MCP+hooks)拆开。结论很实用:接外部系统用 MCP;固化团队习惯用 Skill;复杂后端一次装好用 Plugin。和 GitHub 上 scientific / academic skills、cursor/plugins 周涨相互印证:生态争论已经从「要不要 agent」变成「该装哪一层」。

MCPskillsplugins
HN337
202c

GPU World:假设 2026 年 9 月前沿停住,2040 人人有「一块 B300」

十万美金征文,逼你写「没有奇点」的日常。

前提写死:前沿能力停在 2026-09-01,只允许更快更便宜。评委会与奖金结构公开,截稿约 10 月底。今天冲上 HN,说明算力分配与「平凡未来」仍是公开讨论里耐读的长线话题,比再吵一轮排行榜更有余味。

computefuturesessay