最近看了一个介绍 Pi Agent 的视频。视频没有把重点放在“哪个 Agent 的聊天效果最好”,而是展示了一条更有价值的路线:先用一个极简的 Agent 作为底座,再按自己的工作安装 Skill,最后把搜索、资料整理、文案、配音、配图和视频页面串成一条完整流水线。

这套方法不只适用于 Pi。只要一个 Agent 能够读写文件、执行脚本,并且可以调用外部工具,基本都能照着实现。区别在于:Pi 默认给你的底座很小,需要自己搭;Codex 等产品通常已经把很多工具和工作流预装好了。

先理解三个概念

Agent 是执行循环

模型本身只负责理解上下文、提出下一步行动或生成内容。Agent 负责把这些行动真正执行起来,例如读取文件、运行命令、调用搜索接口、生成音频,再把结果交回模型。

Skill 是操作手册

Skill 不一定是一个新的模型。它更像一份给 Agent 看的说明书,里面可以包含:

  • 什么时候使用这个能力
  • 需要哪些参数和环境变量
  • 先做什么、后做什么
  • 应该生成哪些文件
  • 出错时如何检查和重试

因此,Skill 的价值不只是“多一个按钮”,而是把一次性的提示词变成可复用的流程。

文件是工作流的接口

聊天窗口里的答案很容易消失,文件则可以被下一步继续处理。搜索结果保存成 news.md,文案保存成 script.md,音频保存成 voice.mp3,网页保存成 index.html,每一步都有明确的输入和输出,Agent 才能稳定地接力。

从四个基础工具开始

视频里把 Pi 的默认能力概括为四类:读文件、写文件、修改文件和运行命令。这个设计很克制,但已经足够完成大量本地工作:整理目录、批量改名、生成 Markdown、运行脚本和构建网页。

如果用伪代码表示,最小底座大概是这样:

read_file   读取资料
write_file 创建结果
edit_file 修改已有文件
bash 调用本地命令和脚本

Pi 的特点是“先少给一点,再由用户按需增加”。Codex 的路径相反:在当前环境中,文件、终端、浏览器、文档处理、图片生成等能力已经通过工具和 Skill 组织好了,所以可以直接从任务开始。

第一层:搜索和资料整理

先安装一个搜索 Skill,常见选择包括 Tavily Search 或 Brave Search。配置好 API Key 后,可以让 Agent 执行一个有明确交付物的任务:

搜索本周最重要的五条 AI 新闻。
按重要程度排序,说明发生了什么、为什么重要、是否适合做短视频。
给出来源链接,并保存为 news.md。

这里有一个关键区别:不要只让 Agent“帮我搜一下”,而要规定输出格式和保存位置。这样得到的不是一堆链接,而是一份可以被后续步骤继续引用的资料文件。

在 Codex 中,这一步可以使用浏览器、搜索连接器或研究类 Skill 完成。搜索方式可能不同,但原则相同:

  1. 明确问题和时间范围;
  2. 区分事实、推断和观点;
  3. 保存来源;
  4. 把结果落到文件中。

第二层:读取 PDF、Word、PPT 和表格

资料有了之后,再给 Agent 添加对应的文档 Skill。以 PDF 为例:

读取这份 PDF,提取核心结论、关键数字、原文依据和不确定项。
输出一份结构化摘要,保存为 report.md。

文字型 PDF 可以直接提取文本;扫描版 PDF 则需要 OCR 或图像输入能力。PPT、Word 和 Excel 也应当分别使用适合的处理流程,不要把“能打开文件”误认为“能正确理解文件结构”。

Codex 在这类任务上通常更省配置:当前环境有文档、PDF、表格和幻灯片相关的工作流,可以直接要求读取、分析、生成并验证文件。Pi 需要安装对应 Skill,并准备好 Python、Node、OCR 或 Office 解析依赖。

第三层:从资料到文案和音频

news.md 变成适合口播的脚本:

把 news.md 改成一分钟中文口播稿。
要求:短句、自然停顿、不夸大结论;每条新闻说明事实和影响。
保存为 script.md。

之后安装 Edge TTS 或其他语音合成 Skill:

把 script.md 转成中文语音,保存为 voice.mp3。
同时生成一个 index.html,页面中包含完整文稿和音频播放器。

这一段体现了 Agent 工作流和聊天机器人的差别:最终交付物不是一段回复,而是可以播放、修改和分享的文件。

在 Codex 中,可以用文档生成能力写稿,用本地脚本或已配置的语音工具生成音频,再用 HTML 把文字和音频组合起来。若当前环境没有某个 TTS 服务,就需要补充对应的 Skill、CLI 或 API,不能把 Skill 当成凭空产生的服务。

第四层:配图和视频

可以先为每条内容生成图片素材:

根据 script.md 的第一条新闻生成一张短视频封面。
要求:简洁、3D 科技感、主题明确,不要加入无法核实的文字。
保存为 cover-01.png。

视频里的做法很有代表性:不是直接让模型“生成一条完整视频”,而是先生成一个带动画的 HTML 页面,再按帧渲染或录制成视频。这样做的好处是页面可编辑、可预览,文字和动画也更容易控制。

推荐的文件结构可以是:

ai-news/
├── sources.md
├── report.md
├── script.md
├── voice.mp3
├── cover-01.png
├── presentation.html
└── render.sh

Pi 可以通过 HyperFrames、HTML 动画或 ffmpeg 相关 Skill 完成这一步。Codex 也可以用网页演示类 Skill、浏览器截图、脚本和视频工具完成类似流程;区别只是能力是否已经预装,以及是否需要自己维护脚本。

把步骤串成一个项目

最后可以把所有要求合并成一个任务,但仍然要让每一步生成文件:

研究一台 AI 服务器的成本构成。

要求:
1. 搜索官方规格和可靠的公开报道;
2. 把来源和关键数字保存到 sources.md;
3. 区分公开事实、估算值和未知项;
4. 生成中文两分钟演讲稿 script.md;
5. 生成配图和中文配音;
6. 制作可在浏览器打开的 presentation.html;
7. 不要直接渲染最终视频,先让我检查项目文件。

比较稳妥的执行顺序是:

搜索 → 记录来源 → 整理数据 → 写稿 → 审核 → 配音/配图 → 生成网页 → 渲染视频

不要一开始就要求 Agent “自动完成所有事情并直接发布”。先让它产出中间文件,人在关键节点确认事实、数字和权限,最后再渲染或发布。

Pi 和 Codex 在这条流水线上的差别

环节 Pi + Skill Codex + Skill
搜索 自己安装搜索 Skill 和 API 使用浏览器、搜索工具或研究 Skill
PDF/Office 需要配置解析依赖 通常有现成的文档工作流
TTS 通过 Edge TTS 等 Skill 接入 使用现有脚本、服务或对应 Skill
图片 通过 Skill 调用图像 API 可以直接使用图像生成工具
视频 HTML、HyperFrames、ffmpeg 等自行组合 可以使用网页演示、脚本和媒体工具组合
定制 可以直接写 TypeScript Extension 改运行时 主要通过 Skill、插件和项目规则定制

Pi 的优势是底座轻、模型自由、容易成为“自己的 Agent”;Codex 的优势是减少安装和连接工作,把更多时间放在任务本身。

成本和安全不能只看 Token

上下文短通常有利于速度和成本,但总成本还包括搜索 API、TTS、图片生成、视频渲染和失败重试。视频中提到的单次任务费用是作者环境下的体验,不应直接当成所有人的固定价格。

安全方面尤其要注意:

  • 不要把 API Key 直接写进公开文件或聊天记录;
  • 安装 Skill 前先看脚本会读取什么、上传什么、执行什么;
  • 搜索结果和 PDF 内容都要当作不可信输入;
  • 先生成文件,确认后再执行删除、发布、上传等有副作用的动作;
  • Pi 默认权限可能很宽,必要时使用容器或沙箱。

结语

这套方法最值得学习的不是某一个 Skill,而是一个工作方式:把 Agent 当成可组合的工作流引擎,把每一步都变成可检查的文件。

Pi 让你从一个极简底座开始,逐步长出自己的能力;Codex 则把很多常用能力提前准备好,让同一套思路更快落地。无论使用哪个 Agent,真正决定结果的仍然是任务拆解、输入输出设计、来源校验和最后的人工确认。

本文根据 Pi Agent 相关视频字幕整理,并结合 Pi 与 Codex 的实际使用方式补充。视频中的费用、Token 数字和第三方服务额度会随模型、版本和配置变化。