Shepherd

1周前发布 17 0 0

Shepherd 是一个面向 AI Agents 的平台,重点围绕 Agent 的创建、协作、调度和管理展开。它不是单纯的聊天机器人页面,而更像一个帮助你组织 AI 工作流的工具站。

收录时间:
2026-07-16
目前市面上的 Agent 框架(如 LangChain、AutoGPT)大多只提供”对话记录”和”环境快照”,这让更高层级的”元 Agent”(Meta-Agent)很难精确操控底层 Agent 的执行状态。
Shepherd

Shepherd 网站截图

Shepherd 的突破性在于:它将 Agent 的每一次 LLM 调用、每一次工具执行、每一次文件修改,都记录为一个结构化的、可逆的 Git 式执行轨迹(Execution Trace)。这意味着:
  • 可观测:Meta-Agent 能实时”旁观” Worker Agent 的每一步操作,而不干扰它
  • 可拦截:当检测到危险操作时,可以在执行前”截停”
  • 可回滚:任何历史状态都能精确还原,速度比 docker commit 快 5 倍
  • 可分叉:从任意历史节点 fork 出新分支,尝试不同策略

用 Python 写 Agent,像写普通函数一样自然

Shepherd 的 API 设计非常克制。你不需要学习复杂的 DSL,只需用 @task 装饰器标记函数:
Python
from shepherd import task, workspace
from shepherd.providers import claude

# 定义一个 Worker Agent
@task
def implement(repo, feature):
    "在代码库中实现某个功能"

# 定义一个 Meta-Agent 来监督它
@task
def oversee(worker, repo, feature):
    "如果测试失败,回滚 Worker 并重试"

# 在隔离的工作空间中运行
with workspace(model=claude("sonnet-4-5")):
    result = oversee(implement, repo, "login")
关键点在于:Worker Agent 的所有操作都被”托管”在 trace 中,不会直接修改你的本地文件。工作成果以”待确认提案”的形式返回,由你或 Meta-Agent 决定是否采纳。

三个实战场景,验证架构的通用性

论文中展示了 Shepherd 在三个典型场景下的表现:
1. 并行编码冲突检测(CooperBench)
多个 Agent 同时修改同一份代码库时,Meta-Agent 作为”监督者”实时检测冲突、拦截冲突提交,将 pair-coding 的通过率从 28.8% 提升至 54.7%
2. 反事实工作流修复(Terminal-Bench 2.0)
当 Agent 执行失败时,Meta-Agent 不必从头重跑,而是精确定位到”行为发生变化的节点”,提出修复方案并从该节点 replay。相比 MetaHarness,准确率提升 12.8%,耗时降低 58%
3. 长程强化学习的信用分配
在 Agentic RL 训练中,Meta-Agent 智能选择 fork 点,显著改善长周期任务中的信用分配问题,GRPO 的提升幅度翻倍
Shepherd

快速上手:一行命令体验”时间回溯”

bash
pip install shepherd-ai

# 初始化并运行一个真实 Demo
shepherd init
shepherd demo write agent-task > agent_task.py
python agent_task.py

# 查看完整执行轨迹
shepherd run trace --latest

# 选择接受或回滚
shepherd run select <run-ref>
没有 Claude CLI?项目仓库提供了离线快速启动方案,无需 API Key 即可体验核心机制。

总结:Agent 时代的”操作系统层”

如果说单个 LLM Agent 是应用,那么 Shepherd 试图成为的,是Agent 之间的”操作系统”——提供进程隔离、版本控制、中断处理和状态迁移等底层能力。
目前项目已开源(GitHub 搜索 shepherd-agents),包含完整文档、Notebook 教程和论文。对于正在构建复杂多 Agent 系统的开发者来说,这是一个值得深入研究的底层基础设施。

相关导航

暂无评论

none
暂无评论...