帮助中心

玄镜(Lens)v5.5 能力感知路由系统 · 26 项工具能力 · 知识库 RAG 功能清单与使用手册 · 常见问题解答

26
工具能力
10
能力分类
8
意图路由
7
音频能力
📋 概述 🔀 意图路由 🖼️ 图片生成 🎨 图片编辑 🎬 视频生成 👤 数字人 🔊 语音合成 🎙️ 语音克隆 🔗 克隆数字人链路 🎤 语音识别 ✏️ 涂鸦转图片 👤 视频换人 ✂️ 视频编辑 📹 参考生视频 🎨 3D 模型生成 💻 代码执行 🔍 搜索能力 📚 知识库 RAG 📁 文件系统 ⚡ 命令执行 📦 tool_call 格式 ❓ 常见问题

📋 概述

玄镜(Lens)是思洋智脑的智能能力感知路由系统。它通过意图评分 → 上下文加成 → 能力门控 → 模型推荐的四级流程,自动识别用户需求并选择最合适的工具能力来执行。

核心流程:用户输入 → 意图评分(正则规则 + 否定规则)→ 上下文加成 → 多模态检测 → 置信度阈值 → 用户画像 → 能力门控 → 模型健康检查 → 技能检测 → 路由结果注入 Agent Loop → tool_call 执行
v5.5 特性:帮助中心新增「📚 知识库 RAG」完整章节(功能清单 + 使用手册 + API 速览);知识库 V2 支持多层级文件夹、个人/企业双空间、文件夹密码保护;检索升级为查询改写 + 重排序的搜索 V2;新增数据库/API/爬虫/文件同步 4 类数据连接器。
v5.4 特性:新增语音识别、涂鸦转图片、视频换人、视频编辑、参考生视频、3D 模型生成等 6 项能力,能力总数达到 26 项。路由系统持续优化,多模态识别能力进一步增强。

🔀 意图路由系统

系统内置 8 种意图类型,通过正则规则评分 + 否定规则扣分来自动路由:

意图默认模型触发示例否定规则示例
🎬 video 视频创作Doubao-Seedance-2.0-mini"生成视频""做数字人""写视频文案" → writing
🖼️ image 图片创作doubao-seedream5.0"画一张图""生成海报""分析图片" → reasoning
🧠 reasoning 深度推理deepseek-reasoner"算一下""深入分析""你好" → general
🔊 tts 语音合成Kimi-K2.5"读出来""语音播报""写语音文案" → writing
🎙️ voice_clone 语音克隆Kimi-K2.5"克隆声音""模仿语音""问克隆能力" → general
💻 code 代码编程deepseek-v4-flash"写代码""修复 bug"—
✍️ writing 写作创作GLM-5"写文章""翻译润色"—
💬 general 通用对话deepseek-v4-flash兜底意图—
否定规则:"看看数字人""评价视频""分析图片"等评价/查看类表达不会误路由到生成意图,而是走 reasoning 深度推理。

🖼️ 图片生成

generate_image 图片生成

通过自然语言描述生成图片。默认使用 doubao-seedream5.0 模型,多源降级。生成后自动保存到用户云盘。

参数类型必填说明
promptstring必填图片描述,含主体/场景/风格/色彩
modelstring可选doubao-seedream5.0(默认) | jimeng-seedream46 | qwen-image | gpt-image-2
negative_promptstring可选负面 prompt
widthnumber可选宽度 px,默认 1024
heightnumber可选高度 px,默认 1024
batch_sizenumber可选一次生成几张,默认 1,最大 4
用户:"画一只橘猫坐在窗台上,阳光温暖,写实风格"
多源降级:Doubao Seedream 5.0 Pro → 即梦 Seedream 4.6 → Qwen Image → GPT Image 2

🎨 图片编辑 v5.2 新增

edit_image 图片编辑 ⚠️ 需要附件

对已有图片进行编辑。需要上传图片附件。每种操作有差异化的 prompt 构造策略,编辑更精准。

参数类型必填说明
actionstring必填编辑操作
crop | resize | rotate | style_transfer | inpaint | bg_replace | enhance | filter
promptstring必填编辑描述
widthnumber可选目标宽度 px
heightnumber可选目标高度 px
操作说明示例
crop裁剪"裁剪为正方形"
resize缩放"缩小到 512x512"
rotate旋转"旋转 90 度"
style_transfer风格转换"转成油画风格"
inpaint局部重绘"把图里的文字去掉"
bg_replace换背景"背景换成海边"
enhance增强"提高清晰度"
filter滤镜"加复古滤镜"
用户上传图片后说:"把这张图的背景换成蓝色"

🎬 视频生成

generate_video 视频生成 异步任务

文生视频或图生视频。默认模型 Doubao-Seedance-2.0-mini。任务异步执行,完成后自动通知并保存到云盘。

参数类型必填说明
promptstring必填视频内容描述
modelstring可选Doubao-Seedance-2.0-mini(默认) | Doubao-Seedance-2.0 | e5e_video | Kling
refImageUrlstring可选参考图 URL(图生视频必填)
ratiostring可选16:9 | 9:16 | 1:1,默认 16:9
durationnumber可选时长秒,默认 5
用户:"生成一段5秒的日落海滩视频,16:9横屏"
任务追踪:任务进度持久化到磁盘,刷新页面不丢失。通过 GET /api/user/tasks/:taskId 随时查询。

👤 数字人视频

generate_digital_human 数字人 ⚠️ 需要附件 异步

数字人播报视频生成。支持图片数字人和视频数字人两种模式,支持批量生成(多音频)。

参数类型必填说明
typestring可选image(图片数字人,默认) | video(视频数字人)
modelstring可选
e5e_imgdigital | OmniHuman1.5 | e5e_Human2.5 | e5e_digitalHuman
promptstring可选动作表情描述
cloneTextstring可选★ 克隆语音链路:指定播报文字,自动剥离视频音频→语音克隆→数字人
ratiostring可选16:9 | 9:16 | 1:1,默认 9:16
audioIndexnumber可选多音频时指定第几个(从1开始)
模型选择:说"Pro""质量高"→ e5e_digitalHuman;说"Flash""快"→ e5e_Human2.5。Flash 失败自动降级到 Pro。

🔊 语音合成 (TTS) v5.2 新增

text_to_speech 语音合成

将文本转换为语音。基于 Edge TTS 引擎(微软免费高质量语音),支持 6 种中文音色。生成的音频自动保存到云盘。

参数类型必填说明
textstring必填要合成的文本
voicestring可选音色,默认 zh-CN-XiaoxiaoNeural
ratestring可选语速: "+0%" | "+20%" | "-10%"
pitchstring可选音调: "+0Hz" | "+5Hz" | "-5Hz"
音色 ID名称性别特点
zh-CN-XiaoxiaoNeural晓晓女默认,自然亲切
zh-CN-YunyangNeural云扬男沉稳大气
zh-CN-XiaochenNeural晓辰女清晰明亮
zh-CN-YunlongNeural云龙男浑厚有力
zh-CN-XiaoyiNeural晓伊女温柔甜美
zh-CN-YunxiNeural云希男少年音,活泼

🎙️ 语音克隆 v5.2.1 新增

voice_clone 语音克隆 ⚠️ 需要附件

使用 e5e_soundclone 模型,根据参考音频克隆声音并合成新文本的语音。需要上传参考音频(3-10秒清晰人声最佳)。

参数类型必填说明
textstring必填要合成的文本
refAudioUrlstring可选参考音频 URL,平台自动填入
modelstring可选e5e_soundclone(默认)
用户上传音频后说:"用这个声音说:你好,欢迎使用思洋智脑"

🔗 克隆语音数字人链路 v5.2.1 新增

用户只需上传一段人物视频 + 输入要播报的文字,系统全自动完成以下步骤:

1

🎬 视频剥离音频

用 ffmpeg 从用户上传的视频中提取音频(取前10秒,24kHz 单声道 WAV)

↓
2

🎙️ 语音克隆

调用 e5e_soundclone 模型,以剥离的音频为参考,克隆声音合成新语音

↓
3

👤 数字人生成

克隆音频 + 原视频 → 提交数字人模型(e5e_Human2.5 / e5e_digitalHuman)→ 生成数字人视频

↓
4

💾 自动保存

生成的克隆语音数字人视频自动保存到用户云盘

用户上传人物视频 + 打字:"用这个形象说:你好世界"
全自动:无需手动提取音频、无需单独克隆语音、无需拼接。一条消息完成全链路。

🎤 语音识别 v5.4 新增

speech_to_text 语音识别 ⚠️ 需要附件

将音频文件转换为文字。使用 qwen3-asr-flash 模型,支持 mp3/wav/m4a/ogg 格式。上传音频后自动识别并返回文字内容。

参数类型必填说明
audioUrlstring可选音频文件 URL,平台自动填入
modelstring可选qwen3-asr-flash(默认)
languagestring可选音频语言,默认自动检测
用户上传音频文件后说:"把这段语音转成文字"

✏️ 涂鸦转图片 v5.4 新增

sketch_to_image 涂鸦转图片 ⚠️ 需要附件

将手绘草图或涂鸦转化为精美图片。使用 wanx-sketch-to-image-lite 模型,保留涂鸦主体轮廓并自动补全细节、色彩和背景。

参数类型必填说明
imageUrlstring可选涂鸦图片 URL,平台自动填入
promptstring可选补充描述,如"变成油画风格"
modelstring可选wanx-sketch-to-image-lite(默认)
用户上传涂鸦图片后说:"把这张涂鸦变成精美图片"

👤 视频换人 v5.4 新增

video_face_swap 视频换人 ⚠️ 需要附件 异步

替换视频中的人物脸部。使用 wan2.2-animate-mix 模型,上传原始视频和目标人脸图片,自动完成人脸替换。

参数类型必填说明
videoUrlstring可选原始视频 URL,平台自动填入
faceImageUrlstring可选目标人脸图片 URL,平台自动填入
modelstring可选wan2.2-animate-mix(默认)
用户上传视频和目标人脸后说:"视频换人"

✂️ 视频编辑 v5.4 新增

edit_video 视频编辑 ⚠️ 需要附件 异步

对视频进行裁剪、拼接、调速、加滤镜等编辑操作。使用 wan2.7-videoedit 模型,支持多种视频编辑需求。

参数类型必填说明
videoUrlstring可选视频文件 URL,平台自动填入
actionstring必填编辑操作
crop | concat | speed | filter
promptstring可选编辑描述,如"裁剪掉前5秒"
modelstring可选wan2.7-videoedit(默认)
用户上传视频后说:"裁剪视频" 或 "视频拼接"

📹 参考生视频 v5.4 新增

reference_to_video 参考生视频 ⚠️ 需要附件 异步

参考已有视频的风格和内容生成新视频。使用 wan2.7-r2v 模型,上传参考视频并描述想要的内容,即可生成风格一致的新视频。

参数类型必填说明
refVideoUrlstring可选参考视频 URL,平台自动填入
promptstring必填新视频内容描述
modelstring可选wan2.7-r2v(默认)
用户上传参考视频后说:"参考这个视频的风格,生成一段夕阳海滩的视频"

🎨 3D 模型生成 v5.4 新增

generate_3d_model 3D 模型生成 异步

通过文本描述或图片生成3D 模型。使用 Tripo-P1.0 模型,支持文字转3D 和图片转3D 两种方式。

参数类型必填说明
promptstring可选3D 模型描述(文本生3D 时必填)
imageUrlstring可选参考图片 URL(图片生3D 时使用)
modelstring可选Tripo-P1.0(默认)
用户:"生成一个3D 模型" 或 "文字转3D"

💻 代码执行

execute_code 代码执行

在沙箱中执行 Python 或 Node.js 代码。预装 Matplotlib / Pandas / Numpy 等常用库。

参数类型必填说明
codestring必填完整可执行代码
languagestring必填
python | node

📚 知识库 RAG v5.5 完整手册

知识库 RAG(检索增强生成)是平台的专属 AI 知识引擎。上传文档后,系统自动完成解析 → 分块 → 向量化 → 混合检索 → 对话增强全链路,让 AI 基于你的私有文档精准作答。支持个人知识库与企业共享知识库双空间。

1

📄 文档解析

上传后自动提取纯文本(PDF / Word / Excel / 代码 / 标记语言等 27 种格式)

↓
2

🧩 智能分块

按段落/句子边界切分,每块最大 1000 字符、块间重叠 200 字符,保持语义完整

↓
3

🧮 向量化入库

批量 Embedding(1536 维),写入 SQLite + FTS5 全文索引 + sqlite-vec 向量索引双引擎

↓
4

🔀 混合检索

BM25 关键词检索 + 稠密向量语义检索双路并行,加权融合排序(BM25×0.4 + 语义相似度×0.6)

↓
5

💬 对话增强

检索结果注入对话上下文,AI 引用知识库原文作答并附出来源文档

🧾 功能清单 12 项核心功能
功能说明入口
📤 文档上传入库27 种格式自动解析、分块、向量化;支持按钮上传与拖拽上传,可附带标签知识库页「上传文档」
🔀 混合检索BM25 全文检索 + 向量语义检索双路召回,加权融合 Top-K知识库页搜索框 / API
🚀 搜索 V2LLM 查询改写(最多 3 个变体)→ 多查询并行 → 去重 → 重排序精排/api/kb/search-v2
💬 RAG 智能问答检索结果格式化为上下文,附来源文档与相关度评分对话 / /api/kb/ask
📂 多层级文件夹无限层级目录、面包屑导航、文件夹/文档移动、重命名、删除(文档自动移出)知识库页
🔒 文件夹密码保护scrypt 加盐哈希存储;搜索/问答/原文三级门控,未解锁自动过滤共享库文件夹「加密」
🏷️ 标签管理自定义彩色标签,上传时打标,按标签筛检文档知识库页 / API
👥 个人/企业双库个人空间私有;企业空间按租户(tenant)共享,成员共用、操作留痕知识库页 Tab 切换
👁️ 文档在线阅读双击在线查看解析原文,支持原始文件下载文档卡片 / 右键菜单
📎 引用到对话一键将文档/检索片段注入当前对话,AI 结合原文回答文档「引用」按钮
📊 统计面板文档总数、分块总数、占用空间实时统计知识库页顶部
🔌 数据连接器数据库 / REST API / 网页爬虫 / 文件同步 4 类连接器,cron 定时自动导入/api/kb/connectors
Agent 集成:对话中 AI 可通过内置 kb_search 工具主动检索知识库(见上方「搜索能力」章节),无需手动操作。
📖 使用手册 从入门到精通

一、上传文档,构建知识库

  1. 在工作台打开「知识库」页面,切换到「个人」或「共享」(企业)空间
  2. 点击「上传文档」按钮选择文件,或直接把文件拖拽到页面区域
  3. 等待状态变为「已就绪」— 系统已完成解析、分块与向量化
  4. 顶部统计面板实时显示文档数 / 分块数 / 占用空间
支持格式(27 种):txt、md、csv、json、xml、yaml、html、js、ts、jsx、tsx、py、java、c、cpp、h、css、sql、sh、pdf、docx、xlsx、xls 等。单个文档解析按 file_parse 计费。

二、用文件夹组织知识

  1. 点击「新建文件夹」创建目录,支持多层级嵌套
  2. 点击文件夹进入,顶部面包屑可随时跳回上级
  3. 文档卡片「移动」按钮可将文档归入任意文件夹;文件夹本身也可移动
  4. 删除文件夹不会删除文档,文档自动移回上级目录

三、检索与问答

  1. 在知识库页顶部搜索框输入自然语言问题,回车即出结果
  2. 结果按相关度排序,显示来源文档与内容片段
  3. 点击结果可查看原文,或「引用到对话」让 AI 结合片段作答
  4. 日常对话中直接提问,AI 会自动调用 kb_search 检索知识库
用户:"根据我们的产品手册,X-200 的最大功率是多少?" → AI 自动检索知识库 → 引用手册原文作答并标注来源

四、共享文件夹加密

  1. 在「共享」空间中,点击文件夹的「加密」按钮设置密码(可留密码提示)
  2. 加密后,其他成员访问该文件夹及其子级内容前需先「解锁」
  3. 未解锁的加密文档在搜索结果、RAG 问答、原文阅读中都会被自动过滤
  4. 再次进入「密码」管理可修改或移除密码
安全等级:密码经 scrypt 加盐哈希存储,解锁密钥独立保存(data/.kb-secret),不落明文。

五、企业知识库协作

  1. 切换到「共享」Tab 即进入企业(租户)知识库,全体成员可见
  2. 成员上传的文档自动归属企业空间,支持按文件夹分部门管理
  3. 上传 / 删除等操作自动写入企业活动日志,管理员可审计

六、数据连接器(自动导入)

  1. 创建连接器:选择类型(数据库 / REST API / 网页爬虫 / 文件同步)
  2. 配置数据源:如 MySQL 查询语句、API 地址与 JSON 字段路径、爬虫 URL 列表、同步目录与文件匹配模式
  3. 可选 cron 表达式定时执行(如 0 */6 * * * 每 6 小时)
  4. 手动「运行」立即拉取,导入文档自动进入指定文件夹并记录运行状态
⚙️ API 速览 /api/kb/*
接口方法说明
/api/kb/uploadPOST上传文档(multipart),参数:file、tags、folder_id、kb_type、tenant_id
/api/kb/documentsGET文档列表,分页 page / pageSize
/api/kb/documents/:idDELETE删除文档及其分块与向量
/api/kb/documents/:id/contentGET查看解析原文(加密门控)
/api/kb/documents/:id/downloadGET下载原始文件
/api/kb/documents/:id/movePOST移动文档到指定文件夹
/api/kb/searchPOST混合检索,参数:query、topK(默认 5)、tenant_id
/api/kb/search-v2POST增强检索:查询改写 + 多查询去重 + 重排序
/api/kb/askPOSTRAG 问答,返回上下文与来源列表
/api/kb/statsGET统计:文档数 / 分块数 / 总大小
/api/kb/listGET知识库(文件夹维度)列表,供路由选择
/api/kb/foldersGET/POST文件夹列表 / 创建(支持 parent_id 多层级)
/api/kb/folders/:id/contentsGET文件夹内容(子文件夹 + 文档)
/api/kb/folders/:idPATCH/DELETE重命名 / 删除(文档自动移出)
/api/kb/folders/:id/passwordPOST设置/修改/移除文件夹密码
/api/kb/folders/:id/unlockPOST验证密码,获取解锁令牌
/api/kb/tagsGET/POST/DELETE标签管理
/api/kb/connectorsGET/POST数据连接器列表 / 创建
/api/kb/connectors/:id/runPOST手动运行连接器,返回导入文档数
私有化部署:文档、分块、向量索引全部存储在本地 data/kb/ 目录(SQLite),数据不出域。

📁 文件系统操作

6 个工具提供完整的工作区文件管理能力。所有路径限制在工作区内。

read_file 读取文件
参数类型必填说明
pathstring必填文件路径
offsetnumber可选起始行号(1-indexed)
limitnumber可选最大读取行数
list_files 列出文件
参数类型必填说明
pathstring可选目录路径,默认根目录
write_file 写入文件
参数类型必填说明
pathstring必填文件路径
contentstring必填完整文件内容
replace_in_file 替换内容
参数类型必填说明
pathstring必填文件路径
oldTextstring必填原文(唯一匹配)
newTextstring必填替换后的文本
insert_in_file / delete_in_file 插入/删除

insert_in_file 在指定行后插入内容;delete_in_file 删除匹配文本。

模块化设计:文件系统工具已抽离到 lens-tools.ts 模块,独立于 server.ts。

⚡ 命令执行

execute_command 执行命令
参数类型必填说明
commandstring必填Shell 命令
workdirstring可选工作目录
timeoutnumber可选超时秒,默认 30
安全策略:rm -rf、chmod 777、curl|sh、nc -l 等危险命令自动拦截。

📦 tool_call 调用格式

所有能力通过 tool_call 格式调用:

```json {"tool_call":{"id":"能力 ID","arguments":{...}}} ```

调用规则

  1. id 大小写敏感,必须与能力清单中的 id 完全匹配
  2. arguments 必须包含所有 required 参数
  3. 类型必须匹配 Schema(string 有引号,number 无引号)
  4. 可选参数仅在需要时传递
  5. 一次只调用一个工具,等待结果后再决定下一步

调用示例

// 图片生成 ```json {"tool_call":{"id":"generate_image","arguments":{"prompt":"一只橘猫"}}} ```
// 语音克隆 ```json {"tool_call":{"id":"voice_clone","arguments":{"text":"你好世界"}}} ```
// 克隆数字人 ```json {"tool_call":{"id":"generate_digital_human","arguments":{"type":"video","cloneText":"你好世界"}}} ```

组织智慧工具 v11.0 新增

思洋智脑 v11.0 围绕《组织智慧跃迁理论》全面升级,新增整套企业提智工具链,从诊断到验证形成闭环。

诊智诊断(/diagnosis)
入口:用户中心 → 诊智诊断。10 个组织智慧维度 × 2 道锚定题,5 分钟生成企业智慧成熟度报告:五级判定、十维雷达图、短板与平台功能映射、90 天路径建议。免登录可测,企业成员可看本企业维度均分聚合。
决策留痕(/decisions)
入口:用户中心 → 决策留痕。重要决策记录方案、依据、风险、预期结果与关键假设,设复盘日;到期提醒复盘,逐条检验假设是否成立并沉淀教训。AI 辅助判断分析可自动输出机会、风险与盯梢点(人做最终决策)。假设成立率 = 组织决策质量的量化信号。入口:用户中心 → 决策留痕。
提智看板(/wisdom)
按升级三重判定呈现:能力是否形成、机制是否改变、结果是否持续。企业成员可见组织复盘知识库。
90天提智工程(/ninety)
诊智报告一键创建 90 天验证工程——四阶段(诊断定标/聚智设计/上线运行/验证复盘)带落地清单。第 61-90 天用三重判定验证表收口。决策可关联工程,工程详情汇聚关联决策供复盘对照。
经营场景包(/packs)
五个开箱即用的场景包(客服/销售/营销/行政/人事)——每个含 2 岗位智能体、1 带人审门的工作流、1 预设 90 天工程。企业管理员可一键安装到全企业。
流程模板库(/process-lib)
验证跑通的工作流一键转正为组织标准流程资产(广场或企业两作用域),含人审门的模板自动带安全标记。安装数全程留痕。
组织图谱(/org-graph)
六类资产节点(决策/组织记忆/工程/知识文档/智能体/审批单)按系统内真实引用关系自动连成图谱。力导向动态网图(可拖拽缩放)+ 分列布局切换;反链查询;JSON Canvas 导出。
审批中心(/wf-approvals)
工作流中的人工复核节点在此处理。批准后流程从断点续跑,驳回则终止。待办通过 IM 卡片直达(可一键审批),同步通知中心提醒。
组织记忆(企业共享智慧)
企业规则、复盘教训、经验沉淀后,全员对话(含智能体)按相关性自动注入(零相关不注入)。入口:认知中枢记忆区 + 决策复盘「沉淀到组织记忆」按钮。
每周提智简报
每周一 09:00,企业管理员 IM 收到提智数据简报:决策复盘、假设成立率、记忆增长、审批处理、工程进度、图谱规模。不入看板也能感知组织智慧变化。

❓ 常见问题

Q: 知识库支持哪些文件格式?
支持 27 种格式:PDF、Word(docx)、Excel(xlsx/xls)、TXT、Markdown、CSV、JSON、XML、YAML、HTML,以及 js/ts/py/java/c/cpp/css/sql/sh 等代码文件。上传后自动解析、分块、向量化。
Q: 文件夹加密后,搜索还能搜到里面的文档吗?
不能。加密文件夹实行三级门控:语义搜索、RAG 问答、原文阅读都会自动过滤未解锁的加密文档。其他成员需先在文件夹上「解锁」获得令牌后才能访问。密码使用 scrypt 加盐哈希存储,安全可靠。
Q: 个人知识库和企业(共享)知识库有什么区别?
个人知识库仅自己可见;企业知识库按租户共享,全体成员可上传、检索、问答,且上传/删除操作会自动写入企业活动日志供管理员审计。在知识库页面顶部 Tab 即可切换两个空间。
Q: 对话时如何让 AI 使用我的知识库?
两种方式:1) 直接提问,AI 会自动调用 kb_search 工具检索知识库并引用来源作答;2) 在知识库页面点击文档的「引用」按钮,将指定文档注入当前对话,AI 会结合原文精准回答。
Q: 删除文件夹会连文档一起删掉吗?
不会。删除文件夹时,其中的文档会自动移回上级目录,只有文档本身的「删除」操作才会彻底清除文档及其分块与向量数据。
Q: 任务提交后刷新页面,进度会丢失吗?
不会。任务状态和进度每次更新时写盘持久化。刷新后通过 GET /api/user/tasks/:taskId 可重新查询。
Q: 数字人任务失败提示"音频地址无效"怎么办?
v5.2 已修复。系统优先从本地文件系统读取用户上传的音频文件,不再依赖 HTTP 认证下载。
Q: 语音克隆和 TTS 有什么区别?
TTS 是固定音色的语音合成,提供 6 种预置音色。语音克隆使用 e5e_soundclone 模型,根据参考音频模仿声音来合成语音,可以复制任何人的声色。
Q: 如何实现"上传视频+文字→克隆语音数字人"?
只需上传一段人物视频并输入要播报的文字。系统会自动:1) 从视频中剥离音频 → 2) 用 e5e_soundclone 克隆声音 → 3) 提交给数字人模型生成视频。使用 cloneText 参数指定播报内容。
Q: Flash 模型和 Pro 模型有什么区别?
Flash(e5e_Human2.5)速度更快;Pro(e5e_digitalHuman)质量更高。Flash 失败会自动降级到 Pro。
Q: "看看这个数字人做得怎么样"会被路由到生成数字人吗?
不会。否定规则会将"看看""评价""分析"等表达路由到 reasoning 深度推理,而不是误路由到生成。
Q: 服务重启后正在运行的任务怎么办?
系统启动时会自动恢复卡住的任务。如果有外部任务 ID,会自动恢复轮询而不是重新提交。
Q: 图片编辑支持哪些操作?
支持 8 种操作:裁剪、缩放、旋转、风格转换、局部重绘、换背景、增强、滤镜。每种操作有差异化的 prompt 构造策略。

📝 版本日志

v5.5 2026-07-19
  • 帮助中心新增「📚 知识库 RAG」完整章节 — 功能清单(12 项核心功能)、分步使用手册(上传/文件夹/检索问答/加密/企业协作/连接器)、API 速览表及 5 条知识库常见问题
  • 知识库 V2 — 多层级文件夹 + 面包屑导航、个人/企业双空间、文件夹密码保护(scrypt 加盐哈希 + 解锁令牌三级门控)、拖拽上传、文档在线阅读/下载/引用到对话
  • 检索升级 — BM25 全文 + 向量语义混合检索加权融合;搜索 V2 支持 LLM 查询改写(最多 3 变体)→ 多查询并行 → 去重 → 重排序精排
  • 数据连接器框架 — 数据库(MySQL/PostgreSQL/SQLite)、REST API、网页爬虫、文件同步 4 类连接器,支持 cron 定时自动导入指定文件夹
v5.4 2026-07-19
  • 新增 6 项 AI 能力 — 语音识别(🎤 qwen3-asr-flash)、涂鸦转图片(✏️ wanx-sketch-to-image-lite)、视频换人(👤 wan2.2-animate-mix)、视频编辑(✂️ wan2.7-videoedit)、参考生视频(📹 wan2.7-r2v)、3D 模型生成(🎨 Tripo-P1.0),能力总数从 18 项增长至 26 项
  • 路由系统增强 — 新增 ASR 音频识别、涂鸦/草图、视频换人、视频编辑、参考视频、3D 模型等意图识别与路由规则,多模态感知覆盖面更广
  • 多模态文件支持 — 扩展附件处理逻辑,全面支持音频(.mp3/.wav/.m4a/.ogg)、涂鸦图片、多视频上传等新能力输入场景
  • 异步任务统一管理 — 新能力的异步任务统一纳入系统任务跟踪体系,持久化进度、刷新不丢失
v5.2.1 2026-06
  • 新增语音克隆能力(voice_clone)
  • 新增克隆数字人全自动链路:上传视频+文字 → 自动剥离音频 → 克隆语音 → 生成数字人
  • 音频地址修复:优先本地文件读取,不再依赖 HTTP 认证下载
v5.2 2026-05
  • 新增 TTS 语音合成能力(Edge TTS 引擎,6种中文音色)
  • 新增图片编辑能力(edit_image,8种编辑操作)
  • 路由结果直接注入 Agent Loop 初始消息
  • 全面使用模型广场 API,不再依赖 ComfyUI