All Content
发现最新的 AI 相关内容和资源
歸藏的深度长文
3月29日 周日
通过简化提升速度:一种用于快速音频-视频生成基础模型的单流架构
我们提出了 daVinci-MagiHuman,一种用于以人为中心生成的开源音视频生成基础模型。 daVinci-MagiHuman 使用单流 Transformer 共同生成同步的视频和音频,该模型仅通过自注意力在统一的令牌序列内处理文本、视频和音频。该单流设计避免了多流或交叉注意力架构的复杂性,同时仍可用标准训练和推理基础设施轻松优化。 daVinci-MagiHuman 在以人为中心的...
ARC-AGI-3 发布
ARC-AGI-3 发布,一个面向「交互式推理」的全新基准,通过让 AI 在全新环境里自行探索、持续学习和规划,从“按题答题”转向测试类人学习与适应能力,并作为 ARC Prize 2026 的核心轨道之一,用 100% 人类可解游戏来量化 AI 与人类智能的差距。
81,000 人对 AI 的期待
介绍了 Anthropic 使用名为 Anthropic Interviewer 的 AI 采访工具,在一周内与来自 159 个国家、70 种语言的 80,508 名 Claude 用户进行大规模开放式访谈的结果,描绘了当下人们对 AI 的真实期待与担忧。 人们最希望 AI 帮助实现的是: - 职业效率与成长(让 AI 处理琐碎事务、专注高价值工作) - 个人转变与情绪支持 - 生活管理与减...
传说 Anthropic 要推出一个非常强大的模型 Claude Mythos
传说 Anthropic 要推出一个非常强大的模型 Claude Mythos ,极其昂贵,主要先小范围开放给网络安全防御方,用来提前研究和应对即将到来的 AI 驱动网络攻击风险。
谷歌上线了 Gemini 3.1 Flash Live 预览版
谷歌上线了 Gemini 3.1 Flash Live 预览版,通过 Gemini Live API 支持超低延迟的实时语音 / 视觉对话Agent,能在嘈杂环境下更稳、更听话、更自然地多语言对话,并且直接接工具执行操作。
Claude Code 自动模式:一种更安全的跳过权限方式
Anthropic 为 Claude Code 推出的 auto mode,通过“两层防护 + 两阶段 Sonnet 4.6 转录分类器”,在尽量减少权限弹窗的前提下自动拦截危险操作。 输入侧防护:用提示注入探针扫描文件、网页和工具输出。一旦发现疑似“劫持”内容,就向主代理发出警告。 输出侧防护:对高风险动作(如 shell 命令、越界文件操作、数据外发、修改共享基础设施等)进行分级判定。只...
Claude Code 新增的 auto mode 会自动替你决定哪些文件写入和命令可以执行
Claude Code 新增的 auto mode 会自动替你决定哪些文件写入和命令可以执行,在每次工具调用前用安全分类器审查操作,安全的自动放行、风险操作自动拦截并换一种方式处理。
Claude 发布 Computer Use 功能
Claude 发布 Computer Use 功能,可以操作你电脑的所有软件,如果有 MCP 他会优先使用MCP,也可以通过手机 Claude 控制他操作电脑。
Code Storage:AI 优先的 Git 基础设施
面向机器和 AI 平台的“API 优先 Git 基础设施”:开发者可以用简单的 API 在自己的产品中批量、自动地创建和管理 Git 仓库,而不用再处理 GitHub 等平台的限流和复杂鉴权;底层采用分布式 Git 引用存储、冷热分层(7 天内访问为 Warm、之后为 Cold)和多副本架构,号称在克隆性能上比基于 r2/s3 的方案快 60 倍,并提供 99.99% SLA、透明故障切换和...
Cohere 开源 Cohere Transcribe
Cohere 开源 Cohere Transcribe,20 亿参数 Conformer 语音转文字模型,在 HuggingFace 的 Open ASR 榜单上以 5.42% 英文 WER 拿到第一名。
为 Agent 构建 CLI 工具
Cursor 的 Eric 写的,系统性总结了为 AI 代理设计 CLI 时需要遵守的原则:首先 CLI 应尽量非交互化,所有输入都能通过参数或 stdin 传入,避免在中途弹出需要人工选择的提示;帮助系统要按子命令拆分,并在每个 --help 中提供可直接照抄的示例,让代理可以通过模式匹配快速学会用法;参数设计要支持管道思维,既能用 flag 也能从 stdin 读写,错误要快速失败...
github 突然加了一个规定
github 突然加了一个规定,就是默认所有人同意将他们的代码放到训练里面用于 AI 训练,需要手动关闭才行。记得去关一下。
Google 翻译的“实时翻译”搭配耳机已正式登陆 iOS
Google 翻译的“实时翻译”搭配耳机已正式登陆 iOS,同时在更多国家推出,在网络好的时候这个东西挺好用的。
Hark:让 AI 已人类的方式跟人类互动
Figure 机器人 CEO Brett Adcock 创立的新的 AI 实验室,Hark 正在打造一种全新的「个人智能」平台:通过自研的多模态模型和原生硬件设备,让 AI 以人类的方式与世界互动——能听能说、能看能记、有持久记忆和主动性,能够在电脑上代你理解、操作和完成任务,逐渐学会像你甚至比你更早一步地思考,从而替你承担大量精神负担。
长期运行应用程序开发的 Harness design
Anthropic 工程师展示了如何通过「harness 设计」和多智能体结构,让 Claude 在前端设计与长时间全栈编码任务中的表现显著提升。 - 从前端设计入手:在这一高度主观的任务中,引入“生成器 + 评估器”的多智能体结构,把“设计好不好看”拆解为设计质量、原创性、工艺和功能性四个可打分维度。 - 形成闭环:用精调过、偏“挑剔”的评估 agent 借助 Playwright 实际操...
林俊旸:从推理型思维到Agent型思维
回顾了从 o1、R1 引发的“推理型思维”浪潮到如今“智能体式思维”的转变。早期大家用强化学习在数学、代码等可验证任务上拉高模型的推理能力,探索如何在同一模型里融合 thinking / instruct 两种模式,但实践发现两种模式在数据分布和行为目标上强烈拉扯,很多“混合模型”最后在思考和指令两端都不够好。 Anthropic 等团队提供了一个有益的纠偏视角:推理不应只是生成更长的思考轨...
从未实现的具象软件
Karri Saarinen 认为长期被推崇的“可塑软件”(用户像捏橡皮泥一样自由搭建自己工具)的愿景在智能体时代其实失去了根基:大多数人既没时间也没意愿持续“造工具”,他们需要的是稳定、可共享、可复用的成型产品,而不是不断调参的“系统工程”;智能体本身已经几乎“无限可塑”,可以在强结构、强观点的系统之上,根据用户自然语言意图在运行时动态编排操作,所以真正重要的不再是提供复杂的可视化积木、中...
lil agents:开源的桌面 AI 宠物
一个叫「lil agents」的 macOS 小工具:在 Dock 上方有两个叫 Bruce 和 Jazz 的小动画角色来回走动,点击后会弹出一个带主题风格的 AI 终端窗口,用你本地已安装的 Claude Code、OpenAI Codex、GitHub Copilot 或 Google Gemini CLI 来对话编程辅助;应用本身只负责播放 HEVC 透明视频动画、计算 Dock 尺寸...
Luma 发布了一个很厉害的图片模型 UN1
Luma 发布了一个很厉害的图片模型 UN1,类似 Nano Banana 和 Midjourney 的集合体,支持常识场景补全、空间关系理解和合理的画面变化;支持多图参考、风格迁移;支持各种文化、审美、风格的图像生成和理解,尤其是对当代视觉文化和梗图的生成。
谷歌发布 Lyria 3 Pro
谷歌发布 Lyria 3 Pro,现在支持最长 3 分钟、带段落结构(前奏/主歌/副歌/桥段等)的高保真 AI 音乐生成。
Siri 将变成一个 AI 中枢
有消息称在 iOS 27 里,Siri 将变成一个 AI 中枢,可以把请求转发给通过 App Store 安装的第三方大模型或 AI 助手,Siri 本身会迎来一次大改版,新增独立应用。
Cluade 发布 Claude Code 自动修复
Cluade 发布 Claude Code 自动修复,Web/移动会话现在可以自动跟踪拉取请求(PR)——修复持续集成(CI)失败并回应评论。
Omma:Spline 推出的 AI 3D 网页生成工具
Omma 是由 Spline 推出的 AI 创意工作室产品,主打「用自然语言描述,它就帮你搭建」,可以在几秒钟内生成 3D 场景、网站、交互式 Web 应用、游戏和演示文稿;它支持通过 CSV、JSON、DOC 等文档数据以及 3D 模型、图片、视频等素材,构建实时数据驱动的交互体验,并通过多个并行运行的 AI 代理协同完成代码生成、图像流水线、3D 建模与数据处理,大幅减少搭建复杂交互内容...
Anthropic 又 tm 改账号的额度消耗方式了
Anthropic 又 tm 改账号的额度消耗方式了,总额度是不变的,但是在高峰期,你的账号额度会消耗得更快。
ChatGPT 现在新增了一个跨对话共享的「文件库」
ChatGPT 现在新增了一个跨对话共享的「文件库」:上传过的文件都会集中到 Library 里,可以在任何聊天里快速引用、复用,不用一遍遍重新上传。
Codex 终于支持 Plugins 插件了
Codex 终于支持 Plugins 插件了,内置了不少有用的插件比如 Slack、Figma、Notion 等,插件在 Codex App、CLI 和 IDE 扩展中通用,而且也内置了插件创建的功能。
OpenClaw 憋了一周的更新发布了
OpenClaw 憋了一周的更新发布了,主要是插件系统的重构。现在支持在 ClawHub 里面安装插件。同时兼容 Codex、Claude 和 Cursor 的插件系统,这个版本顺便草台地把那个 UI 部分忘记打包了,导致整个网页用不了。
思考——快、慢与人工:人工智能如何重塑人类推理以及认知投降的兴起
人们在推理时越来越多地咨询生成式人工智能(AI)。 随着 AI 嵌入日常思维,人类判断将会如何变化? 我们提出三系统理论(Tri-System Theory),在双重加工理论的基础上扩展,假设 系统 3:在大脑之外运作的人工认知。系统 3 可以补充或取代内部过程,引入新的认知路径。 该理论的一个关键预测是 “认知投降”——以最少的审视接受 AI 输出,覆盖直觉(系统 1)和深思(系统 2)。...
Pretext:对于生成式 UI 非常有帮助的项目
上周最热的开源项目,纯 JS/TS 的多行文本测量与排版引擎,可以在完全不触发布局回流的前提下,精确计算任意语言(含 emoji、混合双向文本)的高度和逐行布局,方便你做虚拟列表、瀑布流、Canvas/SVG 文本渲染等高级 UI 布局。
AI 指数级增长背景下的产品管理
文章以 Anthropic 的 Claude Code 产品负责人 Cat Wu 的视角,讲述在模型能力呈指数级提升的背景下,产品经理如何重新设计自己的工作方式: - 从 Sonnet 3.5 到 Opus 4.6: - 她最初用 Sonnet 3.5 通过 Claude Code 连写代码都不亲自写,只靠提示就能完成原本需要大量工程资源的工具和评估。 - 到 Opus 4.6 已经可以可靠...
Cursor :通过实时 RL 改进 Composer & Composer 2 的技术报告
介绍了 Cursor 团队如何用“实时强化学习(实时 RL)来持续改进编程模型 Composer”。 它不是只在模拟环境里训练,而是把真实用户在 IDE 里与 Composer 的交互(数十亿真实推理 token)转成奖励信号,接入后端数据管道和快速部署链路。团队大约每五小时就能从生产数据中训练出一个新模型检查点,并通过评测(如 CursorBench)后上线,从而在一天内多次迭代。 相比传...
Sora 上周宣布即将关闭
Sora 上周宣布即将关闭,跟迪士尼的那项十亿协议也取消了。好像说是为了他们的下一个模型,正在集中力量搞那个事情,模型代号为 Spud。
Paper 发布 Paper Snapshot
Paper 发布 Paper Snapshot,可以截取网页指定的部分或者整个网页,并将其作为可编辑图层粘贴到 Paper 中。
Suno 发布 Suno v5.5 版本
Suno 发布 Suno v5.5 版本:更具表现力,更符合你的个性。
谷歌 Gemini 支持记忆导入功能
谷歌也加入了记忆导入的能力,可以把其他 AI 助手里已经积累的个人记忆和完整聊天记录一键导入 Gemini,让 Gemini 立刻理解你的偏好、关系和历史对话,在 Gmail、Photos、Search 等数据的加持下,直接延续原来的聊天上下文,给出更个性化、更连续的回答。
Figma 推出基于 MCP 的 use_figma 工具和可分享的 skills
Figma 推出基于 MCP 的 use_figma 工具和一组可分享的 markdown「skills」,让 Claude Code、Codex 等代理可以在 Figma 里读写文件、调用你的组件和变量,用自定义流程持续生成、对齐、修正设计,目前处于免费公测,未来会按使用量收费。
Claude Code 更新了新的 /init 命令
Claude Code 更新了新的 /init 命令,现在运行不只会帮你写 Claude.md 还会扫描你的代码库询问相关信息,帮你配置对应的 Skills 、插件、Hook。
TurboQuant:通过极致压缩重新定义 AI 效率
Google Research 提出的 TurboQuant 压缩算法及其两大核心组件 Quantized Johnson-Lindenstrauss(QJL)和 PolarQuant,解决高维向量在大模型 KV cache 和向量检索中占用内存过大的问题。 TurboQuant 通过两步实现高效无损压缩: - 首先用 PolarQuant 对向量进行随机旋转并转换为极坐标,只需精细表示半径...
Open AI 发布了 Codex Use Cases 用例库
Open AI 发布了 Codex Use Cases 用例库,里面有各种基于 Codex 的用法,重点展示了一系列可直接落地的工作流。

黄仁勋:英伟达——市值 4 万亿美元的公司与 AI 革命 | Lex Fridman 访谈录 #494
- 工程与战略:黄仁勋从工程和公司战略两个层面,系统讲清了 NVIDIA 如何从做单块 GPU 的“加速卡公司”,一路通过极端协同设计,把 GPU、CPU、网络、存储、电力、散热、软件和整个数据中心当成一个整体来设计,推动 AI 计算在十年内实现百万倍规模提升。 - 关键决策与护城河:他回顾了把 CUDA 放到 GeForce 上、用牺牲利润换装机量这一几乎“赌上公司”的决定,以及由此形成的...

Simon Willison:让编程智能体发挥作用的工程实践 - The Pragmatic Summit
Simon Willison 在这场 Pragmatic Summit 演讲里,结合自己几乎“只拿手机写代码”的实践,系统讲了他如何让编码代理真正可用: 首先,他把“没人写代码、没人读代码”的极端愿景落到工程现实里,用红–绿循环的 TDD 做核心可靠性框架,把“先写测试再写实现”的枯燥工作全部交给代理。 - 同时让代理在容器或远程沙箱里启动服务 - 用 curl 等工具做类似人工点点点的“手...

Tailwind 创始人如何用 Claude Code 进行设计
设计师 Steve Schoger 如何把 Claude Code 当成主力设计工具,用「先让 AI 生成一个还不错的初稿,再用一连串具体、带语气和偏好的自然语言指令不断打磨」的方式,从零开始搭建一个金融应用的营销首页,并在过程中示范了大量非常细腻的 UI 决策: - 用真实产品截图替代假 UI 来增强可信度 - 用更干净的灰度和外发光 ring 替代实心边框解决阴影“脏”的问题 - 统一字...
智谱发布了 GLM-5.1
智谱发布了 GLM-5.1,从放出来的测试看 Coding 得分又比 GLM-5 高了一大截,最给我比较大的惊喜是 GLM-5 Turbo,用来执行一些长链任务非常的好,比如说助理、频繁调用工具之类的。
3月22日 周日
1Password 推出了名为 Unified Access 的统一访问平台及其 Pro 版本
1Password 推出了名为 Unified Access 的统一访问平台及其 Pro 版本,专门用于在企业真实生产环境中安全部署 AI agent 和自动化工作流,帮助 Agent 获取你的登录信息。
人工智能必须通过超人适应性智能拥抱专业化
从人工智能高管和研究人员到末日论者、政治家和活动家,所有人都在讨论通用人工智能(AGI)。然而,他们往往对其确切定义并不一致。对 AGI 的一种常见定义是能够做任何人类能做的事情的人工智能,但人类真的是通用的吗?在本文中,我们讨论了我们对 AGI 观念存在的问题,以及为什么即使在其最连贯的表述中,AGI 也不是描述人工智能未来的一个恰当概念。我们探讨了最广泛接受的定义是否可信、有用并且真正通...
人工智能可以学会科学审美
伟大的科学家具有强烈的判断力和远见,这与我们所称的“科学品味”密切相关。在此,我们用该术语指代判断并提出具有高潜在影响力研究想法的能力。然而,大多数相关研究侧重于提高 AI 科学家的执行能力,而提升 AI 的科学品味仍然鲜有探索。在本工作中,我们提出了来自社区反馈的强化学习(RLCF)这一训练范式,使用大规模社区信号作为监督,并将科学品味学习表述为偏好建模与对齐问题。对于偏好建模,我们在 7...
深度混合注意力
扩展深度是大型语言模型(LLMs)发展的关键驱动力。然而,随着 LLMs 变得更深,它们常常遭遇信号退化问题:在浅层形成的信息性特征会被反复的残差更新逐渐稀释,导致在更深层更难恢复。我们提出了深度混合注意(mixture-of-depths attention,MoDA),一种机制允许每个注意力头同时关注当前层的序列 KV 对以及来自先前层的深度 KV 对。我们进一步描述了一种对硬件友好的 ...
SocialOmni:在全向模型中评估音视频社会互动能力的基准测试
全模态大型语言模型(OLMs)通过原生整合音频、视觉和文本,重新定义了人机交互。然而,现有的 OLM 基准测试仍局限于静态、以准确性为中心的任务,未能评估社交互动能力这一在自然对话中处理动态线索的基本能力。为此,我们提出了 SocialOmni,这是一个全面的基准,旨在将对话互动性的评估具体化,覆盖三大核心维度:(i)说话者分离与识别(谁在说话),(ii)打断时机控制(何时插话),以及(ii...
足够详细的规范即是代码
作者借 OpenAI 的 Symphony 项目批判“从规格自动生成代码”的 Agent 式编程幻想,指出要让规格文档精确到足以稳定产出实现,文档本身就会被“拗”成伪代码甚至代码(Symphony 的 SPEC.md 实际包含数据库模式、算法伪代码和“给模型看的作弊小抄”,并且疑似大量由 AI 生成的语句拼凑而成),既不比写代码省力,也无法保证质量;作者亲自用 Claude 按 SPEC 把...
Kimi:Attention Residuals(AttnRes)
AttnRes 把“残差连接 = 把所有层输出简单相加”改造成“沿深度做一次 softmax 注意力”: - 每一层引入一个仅依赖该层的伪 query w_l,对「embedding + 所有前面层输出」算注意力,再用注意力权重去加权这些表示,从而让模型可以按内容选择性地“回看”不同深度的特征,而不是被一个不断变大的统一残差流淹没。 为解决大模型训练中 Full AttnRes 需要跨...
Claude Code 推出了官方可以远程连接 Telegram 和 discord 的 MCP
Claude Code 推出了官方可以远程连接 Telegram 和 discord 的 MCP,直接设置就可以用手机远程控制 CC,但是只能给账号登录的用户用,看来 Anthropic 正在收紧配置环境变量这种方式。
Chops:Skills 管理客户端
Chops 是一款免费开源的 macOS 应用,用来统一管理和整理各种 AI 代码助手里的「技能」,支持 Claude Code、Cursor、Codex、Windsurf 和 Amp 等工具,让你在一个界面中浏览、编辑和管理这些技能,从而避免它们分散在不同 IDE 或产品里难以维护的问题,目前版本为 1.6.0,要求系统为 macOS Sequoia,并在 GitHub 上以 MIT 协议开源。
我的 Codepilot 也支持了
微信这次也是急了,第一次这么快的追热点,上线 Openclaw 官方插件,只支持私聊,在“我-设置-插件”中启用微信 Clawbot 插件,然后在 Openclaw 安装后,扫描展示的二维码就能启用,我的 Codepilot 也支持了。
Agent 编程飞轮
系统阐述了 Jeffrey Emanuel 的 “Agentic Coding Flywheel” 方法:先用 GPT Pro、Claude、Gemini 等多模型反复打磨出一份极其详细、可全局推理的 markdown 规划文档(计划空间),再将其完整且不丢信息地翻译成带依赖图的 “beads” 任务(珠子空间),最后用由 Claude Code、Codex、Gemini 组成的多 Agen...
Cursor 发布了一个自己训练的 Composer 2 编程模型
上周 Cursor 发布了一个自己训练的 Composer 2 编程模型,成绩非常亮眼,但后面大家发现这个模型居然是基于 K2.5 训练的,随后 Kimi 发了声明说 Cursor 走了授权,然后 Cursor 也保证下次不会不写基模了。
Daily Dispatch:个性化「每日简报」App
官网太好看了,一款个性化「每日简报」App,你先输入想关注的主题(公司、行业、人物、股票、趋势等),它每天早上从 X/Twitter、Reddit、Substack、公司博客、媒体和股市等数百个信息源中抓取最新信息,按时间和相关度过滤噪音,把相关动态聚合成结构化、可溯源的简短故事,用一份清晰、压缩的日报推送到你手机里;相比传统新闻 App、信息流或 RSS,它不提供无尽的刷屏,而是围绕你自己...
使用 GPT-5.4 设计令人愉悦的前端
介绍了 GPT-5.4 在前端设计上的整体能力提升: - 它在图像理解、工具调用(如 Playwright)、长链路任务和功能完备性方面都有明显进步,可以更自主地完成从情绪板、视觉风格到生产级 React/Tailwind 界面的完整设计开发; - 但模型如果缺乏约束会滑向训练集中常见的“模板化”设计,因此作者给出一整套实操方法,包括: - 先明确设计原则与系统(排版、色板、布局、动效、内容...
Google 发布 AI Studio 更新以及 Stich 更新 2.0
谷歌上周显示发布了 AI 设计工具 Stich 的 2.0 更新,整体方向是把 Stitch 变成一个真正的「AI-native 设计 IDE」。 很多改动都挺好的尤其那个 Design.md 文件,就是生成的结果依然太丑了。 现在 Stitch 是一个无限画布的设计环境:你可以在同一个 canvas 上丢图片、文字、代码片段、旧设计稿、竞争对手截图,然后 AI 设计 Agent (agen...
Agent 工程的工作原理
文章用通俗的方式讲清了现代编码 Agent 的基本工作原理:底层是只能“续写文本”的大语言模型,它把文字(甚至图片)转成 token 来处理,通过“聊天模板”把整段对话一次次重放进模型,因此对话越长每次调用越贵;Agent 在这个基础上加了一层“工具调用”机制和“系统提示词”,把诸如 get_weather、执行 Bash/Python 之类的函数暴露给模型,模型只需要按约定格式在回复...
Open AI 发布 GPT-5.4 Mini 和 Nano 两个模型
Open AI 发布了 GPT-5.4 Mini 和 Nano 两个模型,把 GPT‑5.4 能力下放到更快、更便宜的小模型,用来当“执行层”和子 Agent 主力。 GPT‑5.4 mini:定位即时响应的代码助手;大模型规划 + mini 并行执行的子智能体;解析复杂 UI 截图的 computer use;代码、推理、多模态、工具使用都有明显提升 GPT‑5.4 nano:定位速度 /...
小米发布三个模型
小米发布三个模型,前几天在 OpenRouter 的Hunter Alpha 就是 MiMo‑V2‑Pro,MiMo‑V2‑Pro 旗舰模型:主要在 Agent 能力和代码能力上很强。MiMo‑V2‑Omni:多模态感知模型,负责感知环境为 Agent 模型提供信息。MiMo‑V2‑TTS:TTS 语音模型负责 Agent 跟人类沟通。
Lightfield:AI 原生 CRM
Lightfield 是一款“AI‑native”CRM:它自动读取和整合你所有的客户交互(邮件、会议记录、笔记等),在无需预先配置复杂字段和流程的前提下,为每个客户构建完整的关系记忆和上下文“世界模型”,然后通过内置的智能 Agent 来完成会议前准备与会后总结、跨会话与结构化数据的检索问答、批量个性化邮件发送、基于真实对话内容的大规模管道编辑和数据补全、唤醒沉睡线索等任务,让原本需要手动...
Manus 发布了 My Computer
Manus 发布了 My Computer,可以在你本地运行 AI Agent,操纵你的本地文件、运行自动化工作流。有 Window 和 Mac OS 版本。
Midjourney V8 模型终于发布了
Midjourney V8 模型终于发布了,跑了几张图试了一下,发现基础的提示词风格跟 V7 有差别,但是不多。可能增强在那些定制化的审美表现上吧,提示词遵循提升、文本渲染能力提升、可以直出 2K 图片。
MiniMax 发布 MiniMax-M2.7 模型
MiniMax 发布 MiniMax-M2.7 模型,宣称这是首个在演化过程中“深度参与自我进化”的模型:在 OpenClaw 评测中接近 Claude Sonnet 4.6 的表现,并在专业知识与多轮高保真 Office 文档编辑等“工作场景”能力上达到 SOTA。
Nemotron-Cascade-2-30B-A3B
Nemotron-Cascade-2-30B-A3B 是英伟达发布的一款开源 30B MoE 大模型(激活参数仅 3B),在 Nemotron-3-Nano-30B-A3B-Base 的基础上通过 Cascade RL 和多领域 on-policy 蒸馏进行后训练,主打数学与代码推理,在 2025 IMO 与 IOI 上都拿到金牌成绩,并在 AIME、HMMT、LiveCodeBench 等...
OpenAI 宣布将收购开源 Python 工具团队 Astral
OpenAI 宣布将收购开源 Python 工具团队 Astral,把 uv(依赖与环境管理)、Ruff(极速 Lint/格式化)、ty(类型安全)等已经成为现代 Python 开发基础设施的一系列工具纳入 Codex 生态。
Codex 现在支持创建 Subagents
Codex 现在支持创建 Subagents,而且你还能切换窗口很便捷的跟踪每个Subagents 正在做的事情。
OpenOats:开源 AI 会议助手
OpenOats 是一款在你开会时“贴在旁边”的本地会议助手:它在 macOS 上通过 Apple 自带语音识别在本机实时转录你和对方的对话,并把事先指定文件夹中的 Markdown/文本笔记切块嵌入成知识库;通话中一旦检测到问题、决策或需要引用信息的关键节点,就会用本地 Ollama 或云端 OpenRouter + Voyage AI 等 OpenAI 兼容接口去检索、重排并让 LLM基...
Runway 和英伟达的联合研究
Runway 和英伟达的联合研究,训练了一个运行在 Vera Rubin 平台上的全新实时视频模型。高清视频可以即时生成,首帧生成时间低于 100 毫秒。
Silicon Friendly:评估网站对 Agent 的友好程度
「Silicon Friendly」提供了一个评估体系,用 30 个检查项和 5 个等级来衡量网站对 AI Agent 的友好程度:从 L1 的基础可读性( Agent 是否能读懂内容)、L2 的可发现性(是否能找到信息)、L3 的结构化交互(是否能和网站“对话”)、L4 的 Agent 集成( Agent 是否能在网站上执行操作),到 L5 的完全自治运行( Agent 是否能在网站上“生...
AI 产品定价与变现指南
文章系统梳理了 AI 产品定价与变现的思路:在每一次调用都有真实算力成本、毛利率普遍低于传统 SaaS 的前提下,创业者必须抛弃简单的“按座收费+成本加成”,围绕“完成的工作和交付的结果”来定价,在 Copilot、Agent 和 AI 服务三种模型中选择合适的计费单元(消耗、工作流、结果),并通过混合定价(订阅+用量/结果)、从一线销售摩擦中反复试价、用“收入vs效率、硬 ROI vs 软...
构建 Claude Code 的经验教训:我们如何使用技能(Skills)
Anthropic 这篇文章系统梳理了 Anthropic 在构建 Claude Code 过程中对「Skills」的实践经验: 首先将大量内部技能归纳成九大类型,从库与 API 参考、产品验证、数据获取分析、业务流程自动化、脚手架与模板、代码质量审查、CI/CD 与部署、Runbook、到基础设施运维,说明它们如何在真实工程场景中加速开发和运维; 接着从「怎么写好一个 Skill」展开,强...
和编码 Agent 一起试用 Git
介绍了在使用编码智能体(coding agents)时如何充分利用 Git: - 先从仓库、提交、分支、远程等基础概念出发,说明智能体已经非常熟悉 Git 命令和术语,因此人类只需要用自然语言下指令,比如: - “在这里新建 Git 仓库” - “提交这些更改” - “加上 GitHub 远程” - “查看今天的修改” - “从 main 集成最新变化” - 智能体就会自动选择合适的 git...

编程的终结:Andrej Karpathy 谈智能体、自动研究及 AI 的循环时代
这期访谈里,Karpathy 从自己“每天用 16 小时对着 Agent 倾泻意志”的 AI 精神亢奋状态聊起,认为高效编码不再是“写代码”,而是如何同时编排一群长期在线、有记忆的代码 Agent 和“claw”式自治系统,用宏观指令把软件开发、科研乃至家庭自动化外包给它们:工程师的瓶颈从打字速度变成“能指挥多少 tokens 以多高吞吐率为你工作”,一切做不出来更多是技能问题而不是模型能力...
智谱推出 GLM-5-Turbo 模型
智谱推出 GLM-5-Turbo 模型,GLM‑5 的高速变体,特别为 OpenClaw 这类 Agent (agent)环境优化,主打在复杂长流程里的低延迟与高吞吐。
