OpenStarry Blog

探索 · 学习 · 实践

60+ 篇精选文章,覆盖大模型 API 选型、接入实战、成本优化、国产模型迁移。搜索关键词,快速找到你需要的答案。

全部行业分析AI 前沿API工程 实践服务升级AI行业观察行业观察成本与计费Coding PlanIDE 配置工具对比平台接入选型指南 + 效率实战对比评测场景对比 · 客观评测技术解读🔧 技术教程工程落地指南选型指南AI Agenttoken计费LLM 评估实践教程效率实战个人AI行业观察前沿趋势技术教程# 大模型订阅套餐工具教程套餐指南接入教程答疑AI Agent 平台CodexGLM-5.2, API, 错误码, 开发者, 教大模型 开发工具生成模型AI 基础RLHF/对齐RAG/检索训练优化IDE 接入教程ChatGPT 国内接入Claude 国内接入技术深度成本优化
📌 行业分析

读懂 AI 工程新名词:循环、套件、团队与爬坡

围绕 AI 工具链中常见的循环工程、Ralph 循环、多智能体团队、套件工程、爬坡改进、模型开放度等术语,本文梳理它们对开发者的实际价值、典型适用场景、判断标准以及落地成本,帮助团队在选型与搭建时少走弯路。

📅 2026-09-03
📌 AI 前沿

用强化学习训练代码模型画水彩:TRL 与 OpenEnv 实战复盘

这是一份基于 TRL 与 OpenEnv 的开源水彩画代码模型训练复现方案,将 GRPO 强化学习作用于 JavaScript 代码生成过程,通过 p5.brush 库以程序化方式渲染水彩图像,并引入手工筛选的参考集与双重审美评分模型作为奖励信号,让 Qwen3.5-35B-A3B 学会根据文本提示输出可运行的水彩绘制脚本。

📅 2026-09-03
📌 行业分析

BenchMIRT:用项目反应理论拆解大模型评测基准的真实信号

BenchMIRT 是一种基于多维项目反应理论的大模型评测基准审计方法,可以在题目级别识别一个基准分数背后混合了哪些能力信号。研究者在 100 个大模型与 16 个基准、超过 3.4 万道题目的数据上验证了其有效性,并发现部分被归类为"安全"的基准实际上与"通用推理"能力相关性更强。本文面向使用与设计评测的人,介绍它的适用场景、选择标准与落地方式。

📅 2026-09-02
📌 AI 前沿

Google 八月 AI 更新:Gemini 3.7 Flash、Omni 1.1 Flash、Pixel 11 与开源科学模型的全面梳理

2026 年 8 月,Google 集中推出 Gemini 3.7 Flash、Gemini Omni 1.1 Flash、Gemini 3.5 Transcribe 等新模型,并发布搭载 Tensor G6 的 Pixel 11 系列,开放 Gemma 与 WeatherNext 2。本文系统梳理这些更新的关键能力、与上一代的差异、适用场景与上手方式。

📅 2026-09-02
📌 行业分析

中文推理训练:与英文推理的性能差距已收窄到约1个百分点

一项覆盖9个基座模型、11种语言、超过200组对照实验的研究显示,用中文做GRPO强化学习推理训练,与用英文推理相比的性能差距约为1.1个百分点,远低于此前多项研究报告中超过10个百分点的水平。这一结果为中文推理模型从训练源头走独立路线提供了数据支撑,同时研究也揭示了跨语言迁移的收益边界和特定组合下的性能回退风险。

📅 2026-09-01
📌 AI 前沿

将托管在 AgentCore Runtime 上的 MCP 服务接入 Amazon Quick:架构、能力与上手要点

本文介绍如何把 MCP 服务部署到 Amazon Bedrock AgentCore Runtime,并通过 AgentCore Gateway 安全接入 Amazon Quick 的聊天代理和工作流。重点讲清 MCP 服务的核心能力、Inbound/Outbound 双层鉴权机制、相对直接对接 API 与 Lambda 方案的差异、典型适用场景,以及从环境准备到部署、集成、测试、清理的完整上手步骤。

📅 2026-09-01
📌 行业分析

滴滴自动驾驶新一代车型R2开启载客测试:用户价值与上手指南

滴滴自动驾驶与广汽埃安联合打造的Robotaxi R2在北京、广州部分示范区域开启无人载客测试服务。文章从用户视角出发,分析新车在乘坐体验、安全冗余和智能交互上的升级,并给出适用人群、选择标准与上手步骤,帮助读者判断这一新形态出行服务的实际价值。

📅 2026-08-31
📌 AI 前沿

GPT-5.6 入驻 AWS Kiro:单价仅降 20%,单任务成本却砍掉八成

GPT-5.6 家族三档模型在 AWS Kiro 平台上线后,官方价格只降了 20%,但在 Terminal-Bench 2.1 编程智能体基准上,完成一个成功任务的成本却降低了约 82%。多省下的六成主要来自智能体框架、编排系统与模型本身的协同优化,同样的模型放进不同框架总成本可能相差接近 4 倍,编程场景的模型选型正在从只比分数转向比单任务花销。

📅 2026-08-31
📌 AI 前沿

从o1到Core Automation:谁还在定义AI研究的航向

前OpenAI推理模型核心人物认为,AI研究中的执行环节已大体由Agent接管,剩下大约两年属于仍能"出主意"的那三五十人。文章梳理他对Transformer局限性的判断、Core Automation的自动化实验室打法,以及他对AGI之后人类处境的两幅画面。

📅 2026-08-30
📌 行业分析

Scientific Agent Skills:让 AI Agent 成为科研助手的技能合集

围绕 Scientific Agent Skills 技能库,介绍其从 Claude 专属走向开放标准的变化、覆盖的科研领域、适用人群、选择评估维度与上手落地建议,帮助科研用户判断是否引入。

📅 2026-08-30
📌 AI 前沿

两年倒计时:当Agent开始做AI研究

- 研究工作正在被劈成「出主意」与「干活」两段,后者已基本被Agent接管 - 全球真正端到端掌握前沿模型训练与部署的人,估计只有30到50个 - Transformer架构在过去7年里只被认真尝试替换3到4次 - 算力悖论(要算力先有结果,有结果先要算力)卡住了大多数前沿方向 - 未来人类的价值将转向方向判断、对卓越的追求,以及持续学习的能力

📅 2026-08-30
📌 API工程 实践

API 聚合平台服务供应商的酸甜苦辣

从自己用模型用烦了,到一咬牙自己搞了个API聚合平台。走下来,甜的少苦的多,坚持为客户提供可靠的服务。

📅 2026-08-28