Problem
需要从技术文档中检索可追溯答案的售后支持与知识维护场景。- 原始流程
- 资料从不同目录或人工导入后,使用者依赖文件名、记忆或全文搜索定位答案,再手工确认来源与版本。
- 核心痛点
- 文档重复、产品归属与版本不清,检索结果缺少页码和可信状态。
- 业务影响
- 错误或过期资料可能进入回答,搜索质量难以回归测试,也无法稳定解释答案来源。
- 原方案不足
- 直接做聊天问答或向量检索会跳过资料准入、版本、激活和证据不足等基础治理问题。
TRACEABLE KNOWLEDGE GOVERNANCE & RETRIEVAL
可追溯技术支持知识引擎
将分散的厂商技术文档转化为可治理、可检索、可追溯到原始文档和页码,并可持续评测的知识资产。
当前公开范围:资料治理、页级检索与评测机制;页面数据为虚构或抽象内容。
查看系统架构、设计依据与交互演示。
证据来源:v0.3.1-corpus-pilot / main@010e5cb;PROJECT_FACTS、EVIDENCE_INDEX、CONTENT_GAPS 与版本化虚构评测记录。
证据来源按项目所有者确认、源码、测试、仓库资产或 Demo 行为分别标注;外部验证单独说明。
Next Step / 当前是传统检索基线。下一阶段若接入 embedding / reranker / LLM,应先使用当前评测集做对照验证,记录质量变化、失败模式与性能代价;这些能力尚未实现。
PROJECT POSITIONING / 项目定位
不是自动回答问题,而是先把来源、版本、产品、页码与可信状态治理清楚。
不是上传即生效;受控获取、资料导入、人工修订与生命周期是分开的责任节点。
不是向量知识库;当前检索依赖 SQLite FTS5 trigram 与显式规则。
BUSINESS CONTEXT / 业务背景
技术支持资料的难点不只是找到关键词,而是确认这份资料来自哪里、适用于哪个产品、是否已过期,以及结论能否回到原始页。
把分散文档转成结构化、可追溯的本地知识资产。
让人工修订不覆盖原始提取值,并保留完整变更证据。
让失败查询、版本冲突和过期资料成为可复盘的质量信号。
BEFORE / 原始知识问题
公开目录、本地文件与临时下载缺少统一授权和获取边界。
同一内容可能以不同文件名出现,重复索引会放大噪声。
标题、产品、版本和日期依赖文件名或人工记忆,难以复核。
替代关系和生命周期不清,旧文档可能被当成当前依据。
搜索结果不能回到具体文档和页码,人工无法快速核实。
失败查询、串库和无答案误返没有稳定指标或日志。
CONSTRAINTS / 设计约束
数据库与文件留在本机,不依赖云端知识服务。
只处理清单或已下载目录中的明确资料,不抓取整站。
授权、元数据和生命周期由人工确认,获取不等于导入。
歧义或证据不足时返回空结果,不填充低相关内容。
每个结果保留文档、页码、状态与原文片段。
作品集不承载真实资料、查询、路径与运行数字。
TWO SOURCE PATHS / 两条资料入口
只读目录适配,不负责网站抓取。
不发现链接,不处理登录或验证码。
共享底层:SHA-256 → PDF 页级解析 → 元数据治理 → 产品与生命周期 → FTS5 → 日志与评测
PDF & PAGE MAPPING / PDF 导入与页码映射
当前不做 OCR;纯扫描件或无法提取文本的文档进入失败记录。
CONTENT IDENTITY / SHA-256 去重
THREE-VALUE GOVERNANCE / 元数据三值治理
解析或清单提供的值,作为不可丢失的来源证据。
维护者给出的修订值,要求原因与操作者。
人工值存在时优先,否则回退原始值。
PRODUCT & ALIAS / 产品和别名
规范产品维护标准名称与系列。
中英文名、缩写和常见写法作为显式别名。
英文别名大小写无关;未配置的模糊猜测不自动发生。
同一别名属于多个产品时暂停自动关联并标记歧义。
DOCUMENT LIFECYCLE / 文档生命周期
缺失或冲突字段需要人工处理。
当前可优先检索的有效资料。
保留历史并指向替代文档。
尚未成为正式检索依据。
默认不优先,但可按状态追溯。
替代关系禁止指向自身或形成循环;人工变更写入 append-only 审计。
PAGE-LEVEL RETRIEVAL / 页级检索
当前没有向量数据库、embedding、RAG 或 LLM 自动问答。
QUERY NORMALIZATION / 查询规范化
TRUST STATES / 检索可信状态
唯一产品 + 生效文档页命中。
有页级原文,但缺少更明确约束。
别名属于多个产品,返回空结果。
同类新旧状态同时命中,要求核对。
保留历史证据并突出风险。
不填充低相关结果。
SEARCH LOGS & AUDIT / 搜索日志与审计
公开页面不展示真实查询、操作者、路径、哈希或审计原文。
BACKUP & RECOVERY / 备份与恢复
EVALUATION / 检索评测
以下为虚构语料自动化评测,不代表真实生产业务效果。
v0.3.1 发布验证
v0.3.1 发布验证
SYSTEM ARCHITECTURE / 系统架构
没有 OCR、向量数据库、RAG、LLM 自动问答、登录、多租户或云同步。
INTERACTIVE MOCK DEMO / 交互式检索模拟
当前验证范围:前端内存中的虚构来源、元数据治理、查询、页级证据与评测记录。
TRACEABLE RETRIEVAL LAB
REPOSITORY EVIDENCE / 仓库证据
稳定主线为 main@010e5cb,并建立 v0.3.1-corpus-pilot 标签;v0.3.0 保留为功能整合基线。
代码最高 schema migration 3;未读取真实数据库。
稳定版本包含 39 项 unittest,v0.3.1 发布记录为 39/39 通过。
基础虚构评测 13/13、corpus pilot 虚构评测 84/84 已进入 v0.3.1 发布记录;不代表真实生产效果。
README 候选分支矛盾和 favicon 404 已修复;/favicon.ico 发布回归为 HTTP 200、image/svg+xml。
两条资料入口、跨入口去重、可信状态、日志和备份恢复均有当前代码与测试覆盖。
页级 FTS5 检索可以回到文档、页码与原文片段。
OPEN VERIFICATION / 开放验证事项
真实资料目录和受控来源的正式授权、全量导入与人工验收。
后续代码变化后的 39 项 unittest 与两套虚构评测持续复验。
真实数据库当前 migration 版本与备份恢复演练。
正式人工盲测、真实用户试点、生产运维和业务收益。
OCR、向量检索、RAG 与 LLM 问答均未实现。
Phase 4.0 / 4.1、A/B/C、3,567 片段和 45 项测试未被当前 Git 证明。
CAREER CONVERSATION / 求职与合作
我目前关注企业 AI 应用实施、企业解决方案、业务需求分析与数字化实施方向。如果你的团队正在寻找能够连接业务现场、流程、数据与 AI 应用落地的人,欢迎继续查看我的求职信息或直接联系我。