60+ 篇精选文章,覆盖大模型 API 选型、接入实战、成本优化、国产模型迁移。搜索关键词,快速找到你需要的答案。
围绕 AI 工具链中常见的循环工程、Ralph 循环、多智能体团队、套件工程、爬坡改进、模型开放度等术语,本文梳理它们对开发者的实际价值、典型适用场景、判断标准以及落地成本,帮助团队在选型与搭建时少走弯路。
这是一份基于 TRL 与 OpenEnv 的开源水彩画代码模型训练复现方案,将 GRPO 强化学习作用于 JavaScript 代码生成过程,通过 p5.brush 库以程序化方式渲染水彩图像,并引入手工筛选的参考集与双重审美评分模型作为奖励信号,让 Qwen3.5-35B-A3B 学会根据文本提示输出可运行的水彩绘制脚本。
BenchMIRT 是一种基于多维项目反应理论的大模型评测基准审计方法,可以在题目级别识别一个基准分数背后混合了哪些能力信号。研究者在 100 个大模型与 16 个基准、超过 3.4 万道题目的数据上验证了其有效性,并发现部分被归类为"安全"的基准实际上与"通用推理"能力相关性更强。本文面向使用与设计评测的人,介绍它的适用场景、选择标准与落地方式。
2026 年 8 月,Google 集中推出 Gemini 3.7 Flash、Gemini Omni 1.1 Flash、Gemini 3.5 Transcribe 等新模型,并发布搭载 Tensor G6 的 Pixel 11 系列,开放 Gemma 与 WeatherNext 2。本文系统梳理这些更新的关键能力、与上一代的差异、适用场景与上手方式。
一项覆盖9个基座模型、11种语言、超过200组对照实验的研究显示,用中文做GRPO强化学习推理训练,与用英文推理相比的性能差距约为1.1个百分点,远低于此前多项研究报告中超过10个百分点的水平。这一结果为中文推理模型从训练源头走独立路线提供了数据支撑,同时研究也揭示了跨语言迁移的收益边界和特定组合下的性能回退风险。
本文介绍如何把 MCP 服务部署到 Amazon Bedrock AgentCore Runtime,并通过 AgentCore Gateway 安全接入 Amazon Quick 的聊天代理和工作流。重点讲清 MCP 服务的核心能力、Inbound/Outbound 双层鉴权机制、相对直接对接 API 与 Lambda 方案的差异、典型适用场景,以及从环境准备到部署、集成、测试、清理的完整上手步骤。
滴滴自动驾驶与广汽埃安联合打造的Robotaxi R2在北京、广州部分示范区域开启无人载客测试服务。文章从用户视角出发,分析新车在乘坐体验、安全冗余和智能交互上的升级,并给出适用人群、选择标准与上手步骤,帮助读者判断这一新形态出行服务的实际价值。
GPT-5.6 家族三档模型在 AWS Kiro 平台上线后,官方价格只降了 20%,但在 Terminal-Bench 2.1 编程智能体基准上,完成一个成功任务的成本却降低了约 82%。多省下的六成主要来自智能体框架、编排系统与模型本身的协同优化,同样的模型放进不同框架总成本可能相差接近 4 倍,编程场景的模型选型正在从只比分数转向比单任务花销。
前OpenAI推理模型核心人物认为,AI研究中的执行环节已大体由Agent接管,剩下大约两年属于仍能"出主意"的那三五十人。文章梳理他对Transformer局限性的判断、Core Automation的自动化实验室打法,以及他对AGI之后人类处境的两幅画面。
围绕 Scientific Agent Skills 技能库,介绍其从 Claude 专属走向开放标准的变化、覆盖的科研领域、适用人群、选择评估维度与上手落地建议,帮助科研用户判断是否引入。
- 研究工作正在被劈成「出主意」与「干活」两段,后者已基本被Agent接管 - 全球真正端到端掌握前沿模型训练与部署的人,估计只有30到50个 - Transformer架构在过去7年里只被认真尝试替换3到4次 - 算力悖论(要算力先有结果,有结果先要算力)卡住了大多数前沿方向 - 未来人类的价值将转向方向判断、对卓越的追求,以及持续学习的能力
从自己用模型用烦了,到一咬牙自己搞了个API聚合平台。走下来,甜的少苦的多,坚持为客户提供可靠的服务。