29.1k
THU-MAIC/OpenMAIC
一键开的多 agent 沉浸式课堂。
清华 MAIC 的 Open Multi-Agent Interactive Classroom。TypeScript,周趋势约 +5,014。今天是日榜最凶的 AI 向仓库:agent 不再只卖编排 SDK,而在卖可点开的垂直体验。教育和多角色辅导,成了「agent 产品化」最容易讲清价值的切口。
周二开场:OpenMAIC 一天 +3,122,科研 skills 与 ECC harness 同榜。LocalLLaMA 一边测 GLM-5.3 / Qwen3.8 MTP,一边盯 Gemma 上 Arena。公开讨论里,廉价 ARC 实验、开源模型半年报,以及 world model 产品叙事一起上桌。
一键开的多 agent 沉浸式课堂。
清华 MAIC 的 Open Multi-Agent Interactive Classroom。TypeScript,周趋势约 +5,014。今天是日榜最凶的 AI 向仓库:agent 不再只卖编排 SDK,而在卖可点开的垂直体验。教育和多角色辅导,成了「agent 产品化」最容易讲清价值的切口。
两小时从头训一个 64M LLM。
面向教学与实验的小模型全流程:把 pretrain → SFT 压到消费级时间预算里。日增过千说明「小而可复现」仍在回潮。和日榜上的 freellmapi、本地语音栈同一天出现,本地 / 便宜路线没有退潮。
把任意 coding agent 变成「AI 科学家」。
165 个已校验科研 skill,外加百余科学数据库入口;兼容 Cursor、Claude Code、Codex 与开放 Agent Skills 标准。周趋势约 +6,248。行业技能包继续按领域拆分:生物 / 化学 / 医药比再写一个巨型 agent 更可传播。
全本地的开源 ElevenLabs 替代。
声音克隆、音色设计、视频配音、听写、转写与有声书,README 写覆盖 646 种语言。和 browser-use/video-use(日增约 +509)同日上榜:agent 正在按模态铺开,音频与视频都不再是附属 demo。
面向 Claude Code / Cursor / Codex 的 agent harness。
技能、本能、记忆、安全与 research-first 工作流捆在一起。体量已到二十四万星量级,今天仍日增六百多:大家不再只追模型名,而在追「怎么让 harness 稳定跑长任务」。和 scientific-agent-skills 并列,正好是 skills + harness 双叙事。
Rust 写的 PDF 分流器:扫描件还是可抽取文本。
先分类再路由抽取,避免把 OCR 和纯文本解析混在一条慢路径上。Firecrawl 系继续补 agent 的数据入口;boring infra 一旦进日榜,说明 RAG / 文档 agent 的吞吐瓶颈已经从「能不能读」变成「怎么读得聪明」。
Claude Code 的学术写作流水线 skill。
research → write → review → revise → finalize。和专利交底书 skill(handsomestWei/patent-disclosure-skill,日增约 +502)一起说明:知识工作正在被拆成可安装的步骤包,而不是一次 prompt 碰运气。
可校验架构图的 agent skill,周榜仍在烧。
产出带动效、可导出的独立 HTML。周趋势约 +22,095,总量约 41.3k。昨天还在日榜霸榜,今天让位给 OpenMAIC,但周动量说明「别瞎画 Mermaid」这类生产技能已经沉淀成默认依赖。同周还有 cursor/plugins(+1,479)与 anthropics/claude-plugins-community(+1,846)。
高端消费卡上的本地 agent 演示帖。
r/LocalLLaMA 热帖:在 RTX PRO 6000 WS 上跑 GLM 5.3 与 Flash,并接 BlenderMCP 做场景搭建。评论区焦点不在「能不能跑」,而在显存、量化与工具链是否稳到能当日常 agent。本地模型 + MCP 工具面,继续是这个社区的主线。
多 token 预测把本地吞吐再往上拧。
社区在追 MTP(multi-token prediction)对 Flash-Next GGUF 的实际加速。同板还有「3090 上 Qwen3.8-27B 冲到约 2000 prefill / 132 decode」(57↑ / 51c)和「Q4_K_M oneshot Super Mario 克隆」(64↑ / 43c):Qwen3.8 系这几天几乎垄断本地性能炫耀帖。
盲测榜一有风吹草动,评论就炸。
149 条评论说明大家仍把 LMSYS / Arena 当「今天该下哪个权」的信号灯。本地玩家关心的不只是参数量,还有新 Gemma 变体在真实对话里是否压过手里的 Qwen / GLM 量化档。
截图进上下文,正在变成 coding agent 标配。
帖子劝人认真接视觉:UI 报错、设计稿、终端花屏,很多时候一张图比三段文字描述更省 token。和 DeepSeek-V4-Flash-Vision 权重开放的讨论叠在一起,本地 coding 栈的多模态入口明显变热。
推理引擎更新帖,比模型发帖更耐读。
CPU offload 与新模型适配说明:本地生态的瓶颈经常在引擎层。能把 GLM / Qwen 新权重快速接进 ExLlama,比再多一个「我也跑通了」截图更有杠杆。
硬件评测数字对不上社区体感时,就会变成长帖。
本地玩家对工作站 / 多卡方案极度敏感。当厂商报告与日常 llama.cpp / vLLM 体感冲突,评论区会迅速变成「测法、驱动、量化、批大小」的对质现场。买卡之前先读这种帖,能少交智商税。
端侧 1M 上下文叙事,刚落到 LocalLLaMA。
分数不高但时间新:科大讯飞系 Spark X2.5 小模型开源,宣传原生百万 token 上下文,面向端侧与工具调用。旗舰更大参数版本的预告也在公网写稿里出现。端侧长上下文是否「真能用」,要看量化后的延迟,而不是参数表。
小 transformer + test-time training,不是堆 LLM。
作者强调样本效率:在 5090 上约 1.5 小时从头训到公开评估约 44%,并称与 TRM/HRM 同档对比。文中提到此前结果曾在 X 上被 Lucas Beyer、Jeremy Howard 等人讨论。今天 HN 热度说明「便宜、可复现的 ARC」仍能点燃研究圈,争论点依旧是 TTT / metalearning 边界。
半年报:中国前沿开源、Qwen 底座化、agent 成 Hub 用户。
模型仓约 2.43M→2.96M;Qwen 衍生约 151,448(文中约为 Meta 足迹的 2.6×)。七月带 agent 标记的流量里,Claude Code 约 44.4%(四月曾约 67.8%),未登记客户端仍占近四分之一。报告还写到一次疑似自主 agent 入侵事件,最终用开源量化模型完成分析。今天也出现在 HN 首页。
不是 codegen,而是一帧帧生成可交互界面。
Runway 官方稿与后续报道称其建立在 Gen-4.5 与 GWM-1 之上,强调实时交互与会话一致性,目前早期访问。RuntimeWire 等转述其在 X 上的「Interface World Model」提法。世界模型叙事正从视频续写,扩到「操作系统感」的 UI 生成。
连续可交互视频,而不是切片问答。
SiliconANGLE 今天报道 Visko 完成约 $10M 预种子并公开 Orbis。宣传点是持久隐状态 / world clock,以及长时间 4K@24fps 的厂商说法。和 Runway Solaris 同一周出现,说明「world model」标签正在被产品与融资同时征用,独立验证仍要看公开 demo 与复现。
本地跑大模型,正在改写桌面硬件节奏。
MacRumors 援引 The Information:企业侧对可串联的 Mac Studio / mini 需求强到影响发售节奏;高配缺货与内存紧缺叠在一起。HN 评论过五百,讨论本地 AI 是否把「开发者工作站」重新变成战略品类。和 LocalLLaMA 的 Mac↔Linux 盒子帖同一周,硬件叙事很一致。
工具面、流程面、打包面,三层不是同义词。
DEV 长文把 MCP(工具访问)、Skill(可重复工作流)、Plugin(Skill+MCP+hooks)拆开。结论很实用:接外部系统用 MCP;固化团队习惯用 Skill;复杂后端一次装好用 Plugin。和 GitHub 上 scientific / academic skills、cursor/plugins 周涨相互印证:生态争论已经从「要不要 agent」变成「该装哪一层」。
十万美金征文,逼你写「没有奇点」的日常。
前提写死:前沿能力停在 2026-09-01,只允许更快更便宜。评委会与奖金结构公开,截稿约 10 月底。今天冲上 HN,说明算力分配与「平凡未来」仍是公开讨论里耐读的长线话题,比再吵一轮排行榜更有余味。