AI Insight Feed
最具技术趋势的信息流,和你一起探索拥有了 AI 的有趣世界 🚀
a
Jilin University · King Abdullah University of Science and Technology (KAUST) · University of Alberta · The Swiss AI Lab IDSIA · USI · SUPSI
arXiv
Research source
Self-Improvements in Modern Agentic Systems: A Survey
现代自主代理的自我改进研究正从原型走向部署,但领域内术语碎片化且缺乏统一视角。本文提出一个系统级框架,将自我改进形式化为对基础模型参数或操作脚手架的自我诱导更新,并据此构建了涵盖两大改进路径的统一分类体系。文章系统梳理了从经典人工智能到现代大模型代理的历史脉络,整合了多领域应用与评估协议,为理解和设计可控演化的自主代理提供了清晰的认知框架与路线图。
F
Frontis.AI
Research source
Self-Improving Agents in the Era of Experience: A Survey of Self- to Meta-Evolution
该论文聚焦 self-improving agents 方向,但目前公开信息仅包含标题与少量关键词,缺少摘要、方法细节和实验结果,无法判断其技术路线、评测设置或量化结论,后续需补充完整论文内容才能提炼核心贡献与适用边界。值得关注的是,标题指向 self-improving agents 前沿方向,但完整内容尚未公开,适合持续追踪。
a
arXiv
Research source
Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editable
AI代理的能力常取决于其harness,但演化时定位分散的行为实现成为瓶颈。Harness Handbook通过静态分析与LLM辅助,自动合成行为中心手册,配合渐进披露工作流,让开发者从行为描述导航到源码,并自动重同步。在Codex和Terminus-2上,手册辅助规划胜率达更高水平(基线28.3%),规划器令牌消耗下降12.7%,跨模块和稀有路径修改收益最大。 首个将行为定位显式化为问题并给出系统解决方案的工作。 提出Harness Handbook,一种通过静态分析提取程序事实、LLM辅助行为组织合成的行为中心表示,将源码映射到执行阶段,形成三级文档树。提出BGPD工作流,从行为描述渐进导航至源码并验证。手册在代码变更后自动重同步。
a
arXiv
Research source
From Memory to Skills: Evidence-Grounded Co-Evolution Governance for Long-Horizon LLM Agents
长周期 LLM agent 常把历史轨迹当被动上下文,难以转化为稳定可复用的能力。本文提出 MSCE 框架,将经验组织为带证据的三级记忆,仅把增益为正且近期稳定的策略结晶为 skill。在 EvoAgentBench 上,MSCE 在 IR、Math、SE、KW 分别提升 4.61、4.00、15.39 和 5.17 个百分点,并展现跨域迁移与持续演化能力。
M
Moonshot AI
Research source
Kimi K3: Open Frontier Intelligence
开源大模型若停滞在 1T 参数级别,与闭源系统的差距将持续拉大。Kimi K3 将预训练规模扩展至 2.8T 总参数与 104B 激活参数,结合 Kimi Delta Attention 等架构创新及多强度强化学习,支持百万 token 上下文。其整体扩展效率较 Kimi K2 提升约 2.5 倍,在长程编码、Agent 与推理等任务上达到开源前沿,模型权重已完全开放。 首个开源 3T 级 MoE 模型,系统公开了百万 token Agent RL 训练基础设施与 2.5× 扩展效率提升的完整技术细节。 Kimi K3 是 2.8T 总参数、104B 激活参数的原生多模态 MoE 模型,支持百万 token 上下文。架构上采用 Kimi Delta Attention(KDA)与 Gated MLA 3:1 交替的混合注意力处理长序列,Attention Residuals 实现跨层选择性信息流,Stable LatentMoE 在 896 个路由专家中每 token 激活 16 个,并引入 SiTU-GLU 激活函数和 Quantile Balancing 路由策略稳定训练。后训练阶段在通用、Agent 和编码领域进行多推理强度强化学习,通过多教师 on-policy 蒸馏整合为统一模型。基础设施包括 MoonEP 专家并行、KDA 上下文并行、可恢复微虚拟机沙盒等。
a
arXiv
Research source
Do Context Files Help Coding Agents? A Two-Agent Ablation Study on Real Repositories
Original Abstract
AGENTS.md、CLAUDE.md 已成为 Coding Agent 的常见配置,但它们是否真的提高代码正确率并不清楚。论文在 Claude Code 和 Codex、3 个真实 Python 仓库、17 项任务和 288 次有效运行上进行受控消融;通用上下文文件没有带来可测量的正确率提升,失败主要来自功能设计、模式选择和精确接线,而不是缺少仓库知识。不过,包含高价值运行约束的上下文可以减少无效测试和执行时间。由于样本量较小,这一结论不应外推为“上下文文件完全无用”。
N
NVIDIA
Research source
NVIDIA-labs OO Agents: Native Python Object-Oriented Agents
当前构建 AI Agent 往往需要同时维护提示模板、工具模式、回调代码等多套抽象,开发流程分散且容易出错。NVIDIA 提出的 Object-Oriented Agents (NOOA) 通过原生 Python 类封装所有组件,力图用面向对象范式统一 Agent 开发。开发者仅需编写 Python 代码,无需在不同配置文件间切换。但截止目前,原文未给出具体实现细节与实验验证,框架的实际效果仍有待观察。 用原生的 Python 对象来定义 agent,可能大幅减少多组件分离带来的维护成本。 提出了 NVIDIA Object-Oriented Agents (NOOA),一个采用原生 Python 面向对象范式的框架。该框架将 agent 的组件封装为类,开发者只须写 Python 代码即可完成 agent 的构建,无需在不同的配置文件之间切换。