其实关于飞书加豆包的应用,我写过很多期,这篇没有广告,只是想聊一聊我自己用录音豆的具体的使用方式,也是一个我能够无限出选题,一天写两篇文章的核心秘诀吧。我也把这个Skill的生成思路公开出来,大家可以拿来爆改

这篇不讲“一键生成 Skill”。

那个我之前已经讲过很多次了。这次真正有意思的地方,是录音豆这个东西让我重新理解了 Skill 的入口

以前我做 Skill,入口大多是一句话指令。

比如:帮我写一条 X。帮我拆一篇文章。帮我生成一份报告。

但录音豆不一样。

它不是一个 prompt 入口。

它是一个生活入口。

我走路的时候说两句。

刷抖音的时候说两句。

早上规划今天干什么。

晚上复盘自己哪里没做好。

这些东西不是“我要调用 AI”时才出现的。

它们是在我还没准备好写作、还没坐到电脑前、还没打开任何工具的时候出现的。

所以这个 Skill 的核心问题不是:怎么把录音转成文字?

而是:怎么把生活里突然冒出来的想法,接进一个可以长期复用的内容系统?

我后来把它拆成了 5 层。

1. 捕捉层

录音豆只负责一件事:

在想法还热的时候,把它录下来。

这一步不能复杂。

如果我还要打开 App、找文档、建标题、想分类,这个想法大概率已经冷了。

所以录音豆在这个系统里的角色,不是“录音设备”。

我不要求它整理。我只要求它在我有感觉的那一刻,把声音留下来。

2. 转写真源层

这里我踩过一个很关键的点。

飞书里同一段录音,可能有 AI 总结,也可能有逐字稿。

如果你拿 AI 总结做真源,后面会很危险。

因为总结已经替你做过一次判断。

它会删掉口头停顿,会合并重复表达

会把一些看似没用、但其实很重要的情绪和犹豫抹掉

做内容的时候,很多有价值的东西恰恰藏在这些“废话”里

比如我说:“这个选题感觉不对,不是方向不对,是开头太像教学了。”

AI 总结可能只留下:“优化选题开头。”

这就废了,所以 recorder-diary (录音豆日记,这是我给Skill的命名)里我没有让它直接用视频会议纪要的整理版

我让它去飞书云文档里找对应的“文字记录”文档。

拉的是逐字稿原文

这就是这个 Skill 的第一个工程判断:转写可以机器做,但真源不能被机器先改写

3. 语义分流层

录音不是天然等于待办,这是很多工作流会做错的地方。

我录音豆里有几类东西:

一种是日记。比如今天状态怎么样,为什么有点累。

一种是规划。比如上午要处理什么,下午要发什么。

一种是闪念。比如突然想到一个 X 选题。

一种是拆解。比如刷到一条抖音,临时说它为什么好。

如果 Skill 把所有东西都变成待办,几天以后我一定不用了。

因为它会制造任务垃圾。

所以 recorder-diary 不是“录音转待办”。

它先判断这段录音是什么。

没有待办,就只存档。

有选题,就拆成选题卡。

有明确动作,再拆成任务。

有复盘,就追加到当天日记。

这一层是我觉得最值得开源的方法:先分流,再处理

不要把所有语音都塞进同一个输出模板

4. 内容加工层

录音豆最适合做内容,不是因为它能录得多清楚。

而是因为它能记录“我当时为什么有感觉”。

比如我刷到一条抖音,觉得它好。如果只收藏链接,我过两天基本忘了。

但如果我当场用录音豆说:它不是标题好。它好在先给了一个具体场景。

观众不是想学道理,是想知道自己下一条怎么拍。

那这段话后面就可以被加工成四种东西:

  • 这条内容的钩子为什么成立
  • 它击中了什么观众情绪
  • 这个结构能不能迁移到我的 X
  • 它能不能继续变成短视频口播

所以我给这个 Skill 设计输出时,没有只做“日记”和“任务”。

更重要的是选题卡。

选题卡里要保留四个字段:

  • 原始触发物:我当时看见了什么
  • 当场判断:我为什么觉得它有价值
  • 可迁移结构:它能不能套到我的内容系统
  • 下一步动作:写 X、拍视频、放进选题池,还是先观察

这比“总结一下录音内容”有用得多,因为内容生产真正缺的不是总结。

是把一个模糊感觉变成可复用结构。

5. 承接层

很多 AI 工作流死在最后一步

它能生成一段很漂亮的结果

然后结果就躺在聊天记录里。

第二天找不到。第三天忘了。

一周后重新问一遍。

所以 recorder-diary 里我把承接做得很重。

逐字稿进 Obsidian

选题进内容库

任务进当天仪表盘。

没完成的任务可以结转,桌面侧边栏会把今天要做的事挂出来。

AI 生成的东西如果没有承接面,就不算进入系统

它只是一次聊天。

这里面有几个具体设计,我现在回头看觉得挺关键。

第一,导入要去重。

录音豆每天会有多段录音。

飞书妙记也可能反复搜索到同一条。

所以 Skill 不能每次同步都重新写一遍。

它要看日期、标题、已有文件、minute token,判断这条是不是已经进库。

第二,原文不能乱修。

存到 Obsidian 的录音豆日记,必须保留逐字稿。

错别字、停顿、口语化,先不要动。

后面要改写,可以另开加工结果。

真源和加工物要分开。

第三,任务不能硬拆。

如果录音里只有情绪,就不要拆任务。

如果录音里说的是“我觉得这个账号不错”,也不要硬拆成“研究账号”。

只有出现时间、动作、对象、验收信号时,才进入任务系统。

第四,隐含任务要补问。

口语里经常出现这种句子:

“这个其实还得改一下。”“昨天那个还没处理。”“按理说今天应该补上。”

这些不是完整任务,但它们是心里挂着的事。

Skill 可以识别出来,但不能替我决定。

它应该问:

“这里提到的 X 要不要加进今天?”

第五,路径模糊才搜索。

如果我已经说清楚怎么做,就按我的原话拆。

如果我只说“查一下小红书违禁词”,但没说入口和步骤,它再去搜索补齐。

这样可以避免 AI 把我已经知道的东西重新包装一遍。

这个 Skill 最后其实形成了一个很清楚的对象模型。

一条录音进来,不直接生成文章。

它先变成 RecordingEntry。

里面有时间、标题、minute token、doc token、逐字稿。

然后分流成几种卡片:

DiaryNote,存日记。

IdeaCard,存选题。

TaskCard,进仪表盘。

ReviewNote,进复盘。

每张卡片都要能追溯回原始录音。

这也是我觉得它值得开源的地方。

很多人做语音工作流,只做到“录音转文字”。

但录音转文字只是第一步。

真正有用的是后面的协议:

一段语音进入系统以后,怎么判断它是什么?

怎么保留真源?

怎么拆出选题?

怎么避免任务垃圾?

怎么把结果放到第二天还看得见的地方?

这些才是录音豆 Skill 里新的东西。

如果我要开源,我不会只丢一个 SKILL.md。

我会拆成三层开源。

第一层是代码和命令链。

比如飞书妙记搜索、飞书文档拉取、Obsidian 写入、HTML 仪表盘生成。

第二层是工作流协议。比如 RecordingEntry、IdeaCard、TaskCard 这些对象怎么定义。

录音怎么分流。

什么情况下不处理。

什么情况下补问。

第三层是测试样例。

这很重要。

我要放一些脱敏后的真实口语样例。

有规划。有复盘。有纯闪念。有刷抖音时的内容拆解。有完全不该生成任务的废话。

一个 Skill 能不能用,不看它处理干净样例多漂亮。

要看它处理真实口语会不会乱来。

这次录音豆 Skill 给我的最大启发是:

AI 工作流不应该只围着聊天框设计。

人的想法很多时候不是在聊天框里发生的。

它发生在路上、饭桌上、刷视频时、准备睡觉前。

如果入口只在电脑里,很多东西永远进不了系统。

录音豆把入口挪到了生活里。

飞书把声音转成文字。

Skill 把文字变成结构。

Obsidian 和仪表盘把结构留到第二天。

这才是这条链路真正值得写的地方。

不是我做了一个“录音转待办”的小工具。

而是我把内容生产的第一步,从电脑前移到了想法发生的现场