很多团队做 AI 知识库时,第一反应是“把语雀全量上传”。这很危险。语雀里的文档原本靠空间、知识库、成员和加密文档控制访问;一旦导入 AI 知识库,内容会被切分、索引、检索和组合回答。原来的页面权限不一定会自然变成 AI 应用里的提问权限。
正确流程应该是先本地导出、再治理、再导入。YuqueOut 的价值在于把语雀内容批量导出到本地,并保持本地处理,不替你上传到第三方 AI 平台。你可以在上传前有机会做分级、脱敏和抽查。
AI 知识库为什么放大权限风险
- 检索会跨文档。用户问一个看似普通的问题,答案可能组合多个敏感片段。
- 来源不一定显眼。如果应用不展示引用,用户不知道答案来自哪个敏感文档。
- 旧文档会干扰。过期合同、旧报价、历史政策被检索到,可能生成错误答案。
- 截图也含隐私。图片、附件和表格中的手机号、邮箱、金额、Token 常被忽略。
- 角色边界容易丢失。原来只有管理层可看的内容,导入后可能被普通应用检索。
先导出到本地再治理
- 按团队空间导出。先从团队知识库、收藏夹和协作文档中拿到完整清单。
- 普通文档导出 Markdown。Markdown 便于全文检索、批量清理和版本管理。
- 图片本地化。敏感信息可能藏在截图里,不下载到本地就无法系统检查。
- 加密文档单独处理。需要密码验证后才能导出,并默认归为敏感资料包候选。
- 导出后先归档原始包。任何清洗和脱敏都在副本上做,保留原始导出用于审计和回滚。
团队空间导出可以参考 语雀团队空间知识库完整导出支持;加密文档处理可以参考 语雀加密文档导出指南。
三类资料分级模型
| 等级 | 典型内容 | AI 使用建议 |
|---|---|---|
| 公开资料 | 帮助中心、公开 FAQ、产品使用教程 | 可进入公开助手,但仍要检查图片和更新时间。 |
| 内部资料 | 内部 SOP、研发规范、销售话术、项目复盘 | 进入内部应用,需要账号和部门权限。 |
| 敏感资料 | 客户合同、财务、人事、密钥、未公开路线图 | 默认不导入,除非有专门权限、审计和脱敏流程。 |
导入前脱敏清单
脱敏不是只替换几个姓名。导入 AI 知识库前至少检查:
- 客户名称、联系人、手机号、邮箱、地址。
- 合同金额、报价、折扣、成本、回款信息。
- API Key、Token、Cookie、数据库账号、内网地址。
- 员工身份证明、薪酬、绩效、人事变动。
- 未发布产品计划、融资信息、战略讨论。
- 截图中的浏览器地址栏、侧边栏、聊天记录和文件名。
按 AI 应用分包
不要按“语雀原知识库”机械导入。AI 应用的权限边界应服务于使用场景:
| AI 应用 | 可导入资料 | 不应导入 |
|---|---|---|
| 公开客服助手 | 公开 FAQ、帮助文档、排障指南 | 内部 SOP、客户案例原文、价格底线。 |
| 销售内部助手 | 销售话术、产品手册、竞品说明 | 财务明细、人事资料、密钥和账号。 |
| 研发助手 | 接口说明、架构规范、发布流程 | 生产密钥、客户隐私、未授权业务数据。 |
| 管理层助手 | 经营复盘、策略讨论、重点项目 | 与当前决策无关的员工隐私和原始敏感附件。 |
权限验收问题集
导入后用不同角色账号验证,而不是只用管理员账号测试:
- 普通访客能否问到内部流程?答案应该不能。
- 客服账号能否问到价格底线或客户合同?答案应该不能。
- 研发账号能否命中正确接口文档?答案应该能,并显示来源。
- 管理层账号是否仍会引用过期战略文档?如果会,需要清理旧资料。
- 问一个敏感关键词,系统是否拒答或只返回允许范围内的泛化信息。
更新和责任人机制
AI 知识库不是一次性迁移。每个资料包都应有负责人、更新时间、适用应用、允许角色和回滚路径。语雀作为源文档继续更新时,建议固定导出和复核节奏,例如每周导出变更目录、每次产品发布后更新公开 FAQ、每月清理过期内部 SOP。
常见问题
语雀导入 AI 知识库前为什么要先做权限治理?
因为 AI 知识库会把文档变成可检索资料。如果把公开资料、内部资料和敏感资料混在同一个索引里,后续很难保证不同成员只能问到自己有权限看的内容。
YuqueOut 会绕过语雀权限导出敏感内容吗?
YuqueOut 只导出用户在浏览器中可访问的内容,不负责绕过语雀加密或访问权限。加密文档需要正确密码验证,导出后是否进入 AI 知识库由用户自行控制。
AI 知识库资料应该按什么维度分包?
建议按公开、内部、敏感三个等级分包,再按业务线、产品线、部门或应用场景拆分。每个包应该有明确负责人、更新时间和允许使用的 AI 应用范围。
导入 AI 知识库前需要脱敏哪些内容?
至少检查客户名称、联系方式、合同金额、账号密钥、内部链接、未发布计划、人事信息、财务细节和截图中的隐私字段。无法确认是否可公开的内容应先排除。
权限治理完成后怎么验收?
用不同角色账号分别提问,确认普通用户不能检索到敏感知识库,内部用户能命中正确资料,来源引用可追溯,过期文档不会优先出现在答案里。