「AI 前沿」分类下共 47 篇文章。
ToolGrad 是一种面向大语言模型工具调用能力的数据生成框架,采用"先答案后问题"的思路,利用文本梯度迭代构建 API 调用链,可在更低成本下产出通过率近 100% 的高质量训练数据。基于该方法微调的较小参数模型在工具调用基准上具备与顶级闭源模型接近的表现。
本文介绍 Qwen3.8-2.4T-A95B 这款 2.4 万亿参数、每 token 激活 95B 的开源权重 MoE 大模型,包括其混合线性与全注意力架构、原生长上下文、内置推理与工具调用能力,以及在 SageMaker HyperPod 上借助 vLLM 与 NVFP4 量化进行单节点部署的关键配置、容量采购与上手路径。
GPT-6 Astra 是 OpenAI 当前在 Amazon Bedrock 上正式可用的最新一代模型,主打更深度的推理与判断,并强化在浏览器与软件界面内的执行能力。本文将梳理它的关键能力、与此前版本可见的差异、典型场景、接入与上手方式,以及仍需关注的边界。
OpenAI与AIRPPU、WAN-IFRA共同启动一项AI合作计划,聚焦乌克兰新闻机构的创新能力、运营韧性与独立新闻生产。本文梳理计划的目标方向、可能的落地形式、参与路径以及当前公开信息中的边界与待明确事项。
过去一年全球AI推理Token用量暴涨约25倍,AI基础设施以极短回收期和超高回报率吸干一级市场与债市资金,传统行业正面临融资成本飙升、资本被抽干的生存挑战。
现代 AI 平台已从单一登录入口演化为跨多个集群与服务的联邦工作流,用户身份需要同时穿越控制平面与数据平面。本文梳理了身份贯通的核心原理、与传统单点登录的差异、典型场景以及落地时的局限。
这是一份基于 TRL 与 OpenEnv 的开源水彩画代码模型训练复现方案,将 GRPO 强化学习作用于 JavaScript 代码生成过程,通过 p5.brush 库以程序化方式渲染水彩图像,并引入手工筛选的参考集与双重审美评分模型作为奖励信号,让 Qwen3.5-35B-A3B 学会根据文本提示输出可运行的水彩绘制脚本。
2026 年 8 月,Google 集中推出 Gemini 3.7 Flash、Gemini Omni 1.1 Flash、Gemini 3.5 Transcribe 等新模型,并发布搭载 Tensor G6 的 Pixel 11 系列,开放 Gemma 与 WeatherNext 2。本文系统梳理这些更新的关键能力、与上一代的差异、适用场景与上手方式。
本文介绍如何把 MCP 服务部署到 Amazon Bedrock AgentCore Runtime,并通过 AgentCore Gateway 安全接入 Amazon Quick 的聊天代理和工作流。重点讲清 MCP 服务的核心能力、Inbound/Outbound 双层鉴权机制、相对直接对接 API 与 Lambda 方案的差异、典型适用场景,以及从环境准备到部署、集成、测试、清理的完整上手步骤。
GPT-5.6 家族三档模型在 AWS Kiro 平台上线后,官方价格只降了 20%,但在 Terminal-Bench 2.1 编程智能体基准上,完成一个成功任务的成本却降低了约 82%。多省下的六成主要来自智能体框架、编排系统与模型本身的协同优化,同样的模型放进不同框架总成本可能相差接近 4 倍,编程场景的模型选型正在从只比分数转向比单任务花销。
前OpenAI推理模型核心人物认为,AI研究中的执行环节已大体由Agent接管,剩下大约两年属于仍能"出主意"的那三五十人。文章梳理他对Transformer局限性的判断、Core Automation的自动化实验室打法,以及他对AGI之后人类处境的两幅画面。
- 研究工作正在被劈成「出主意」与「干活」两段,后者已基本被Agent接管 - 全球真正端到端掌握前沿模型训练与部署的人,估计只有30到50个 - Transformer架构在过去7年里只被认真尝试替换3到4次 - 算力悖论(要算力先有结果,有结果先要算力)卡住了大多数前沿方向 - 未来人类的价值将转向方向判断、对卓越的追求,以及持续学习的能力