AI 工具收藏¶
收藏值得关注、以后可能试用或集成到工作流里的 AI 工具。优先记录:它解决什么问题、适合放在哪个分类、什么时候值得用、有什么风险。
分类索引¶
- AI 语音 / TTS / 语音克隆:语音合成、声音克隆、听写、Agent 语音输出。
- AI Agent / 编程工作流:编码助手、MCP 工具、自动化执行环境。
- 内容创作:视频、播客、有声书、课程素材、角色对白。
- 本地优先工具:可离线、本机推理、数据不默认上传云端。
- 科研绘图 / 可编辑插图:把参考图复刻为 PPT、WPS 或 draw.io 中可编辑的形状、文字和连接线。
科研绘图 / 可编辑插图¶
Scientific Illustrator¶
- 地址:icebird1998/scientific-illustrator
- 旧项目:icebird1998/drawio-scientific-illustrator
- 归类:Codex 插件、MCP 工具、科研绘图、可编辑插图复刻、PowerPoint / WPS / draw.io 自动绘制。
- 一句话:把参考图上传给 Codex 后,插件会尽量用可编辑对象在 Microsoft PowerPoint、WPS 演示或 draw.io Desktop 中重新绘制,并自动检查和修正。
- 状态说明:用户给出的
drawio-scientific-illustrator已停止功能与兼容性更新;后续开发迁移到scientific-illustrator,新用户应优先使用新项目。 - 核心能力:
- 支持 PowerPoint、WPS 演示和 draw.io Desktop,输出可编辑 PPTX 或
.drawio文件。 - 通过插件内的 MCP 工具连接本地软件,按区域逐步绘制并截图检查。
- 优先使用文字、形状、连接线、表格、图表和分组对象;复杂纹理、显微照片等难以矢量化的区域才作为图片插入。
- 支持导出最终预览图,适合论文图、科研汇报图、机制示意图和流程图整理。
- 适合场景:
- 看到一张论文示意图或汇报图,想复刻成可编辑版本继续修改。
- 需要把杂乱截图重画为统一风格的 PPT / draw.io 插图。
- 想让 Codex 边绘制边检查,不只是生成一份静态图片。
- 不适合场景:
- 需要像素级复刻照片、显微图、热图或复杂纹理。
- 只想生成一张好看的图片,不需要后续编辑;这类任务更适合图像生成工具。
- 不想安装本地 PowerPoint、WPS 或 draw.io Desktop,也不想配置 Codex 插件。
- 安装提示:推荐安装
scientific-illustrator@scientific-illustrator-tools,安装或更新后需要重启 Codex 并新建任务。 - 记录日期:2026-08-01。
AI 语音 / TTS / 语音克隆¶
Voicebox¶
- 地址:voicebox.sh
- 源码:jamiepine/voicebox
- 官方文档:docs.voicebox.sh
- 归类:AI 语音工具、本地优先 TTS、声音克隆、听写、Agent 语音输出。
- 一句话:开源的本地优先 AI 语音工作室,可克隆声音、生成语音、语音转文字,并通过 MCP / REST API 让 AI Agent 发声。
- 核心能力:
- 声音克隆:从短音频样本创建 voice profile,用于文本转语音。
- 多 TTS 引擎:支持 Qwen3-TTS、Chatterbox、LuxTTS、Qwen CustomVoice、TADA、Kokoro 等模型。
- 听写输入:全局快捷键录音后转写到当前输入框或剪贴板,底层使用 Whisper 系列模型。
- Agent 语音:通过 MCP 工具
voicebox.speak,让 Claude Code、Cursor、Cline 等支持 MCP 的 Agent 用指定声音播报结果。 - 本地 API:运行后提供
http://127.0.0.1:17493的 REST 接口,可用于脚本、游戏、应用或自动化工作流。 - 适合场景:
- 给本地 AI Agent 增加语音播报,例如测试通过、构建完成、任务提醒。
- 生成课程、播客、游戏 NPC、旁白、有声内容等多角色语音素材。
- 使用本地听写替代云端语音输入,减少语音数据上传。
- 批量生成固定风格的语音片段,接入脚本或 Stream Deck 等工具。
- 不适合场景:
- 需要商业级 SLA、团队权限、云端协作和版权保障的生产语音服务。
- 不愿意处理本地模型下载、硬件性能、显卡兼容和磁盘占用的用户。
- 对声音肖像权、授权和合规要求很高但还没有明确流程的项目。
- 与 Codex 的关系:Voicebox 不是代码 Agent,而是语音能力层。它可以作为 Codex / Claude Code 这类 Agent 的 MCP 工具,让 Agent 把关键状态用语音说出来。
- 试用建议:先从“本机听写 + Agent 播报”两个低风险场景试起,再考虑声音克隆和内容生产。克隆他人声音前要确认授权,避免生成误导性或冒充性质的音频。
- 记录日期:2026-08-01。