WebMark
采集与原始归档
通过 WorkBuddy 接收 URL,抓取正文及元数据、完成基础分类,生成可追溯的 Raw Markdown,并同步到乐享及原始资料 Web 站点(当前为内部站点)。
输出:Raw Markdown →MyWorkflow · Markdown Flow
mdFlow工作流
本工作流主要实现从网络上抓取特定页面信息并纳入个人知识库的全部流程。
当前版本(v1)的工作流以 WorkBuddy 为人机交互入口,以乐享(lexiangla.com)为知识库,使用 WebMark、CleanMark 两个 WorkBuddy Skill 处理信息提取和知识清洗,并连接自主维护的 Raw 与 Clean 两个内容站点。
mdFlow 为 WorkBuddy、WebMark、CleanMark 和 PublishMark 提供共同遵守的内容分类、元数据与处理规范,让采集、沉淀与发布稳定衔接。
CONTENT WORKFLOW
三个相互独立的处理阶段依次处理同一份资料。每个阶段只负责一个明确环节,并通过 mdFlow 约定的 Markdown 与 Front Matter 向下游流转。
采集与原始归档
通过 WorkBuddy 接收 URL,抓取正文及元数据、完成基础分类,生成可追溯的 Raw Markdown,并同步到乐享及原始资料 Web 站点(当前为内部站点)。
输出:Raw Markdown →深度整理与规范化
基于原始资料(Raw Markdown),定期开展清洗,组织结构、清理噪声、补充规范元数据,形成与 Raw 内容相互独立的 Clean 版本。
输出:Clean Markdown →内容发布与知识分享
接收清洗后的资料(Clean Markdown),写入 PublishMark 项目文档库并提交至 GitHub,由 Cloudflare 自动构建生成阅读站点。
输出:PublishMark WebsiteCURRENT V1 ARCHITECTURE
mdFlow v1 运行在 WorkBuddy、乐享知识库与自托管站点组成的个人工作空间。
入口包括 WorkBuddy App、微信、QQ 或飞书等。当用户输入裸链接(URL),或表达“保存、收藏、记录、归档 URL”等意图时,启动本工作流,由 WorkBuddy 调用 WebMark 完成采集。
WorkBuddy 负责理解用户意图并调度 Skill;WebMark 抓取网页正文,提取标题、作者和日期,完成基础清洗、分类与 Front Matter 标注。
原始内容首先写入本地文件夹,保留来源与可追溯信息。Raw 是后续清洗的事实底稿,不会被 Clean 内容覆盖。
WebMark 通过 WorkBuddy 已配置的乐享 MCP,将资料写入指定的知识空间。导入成功后返回该条记录的乐享 URL。用户可以直接打开 URL 查看,也可以通过乐享 MCP 在 WorkBuddy 中检索、阅读与沉淀知识。乐享也提供 Agent 工具,支持通过微信、飞书等通道直接检索和对话。
Raw Markdown 同步到站点内容目录,由一个 FolderMark 应用即时解析展示,形成自主维护的原始资料站。鉴于这些资料尚未经过甄别和深度整理,Raw 站点作为内部站点使用。乐享导入和 Raw 站点同步完成后,WorkBuddy 向用户返回乐享 URL 与 Raw 站点 URL,供即时检索和查看。
定期开展数据整理,调用 CleanMark 进行深度清洗、结构重组和规范化,生成完全独立的 Clean Markdown,并写入本地文件夹。Clean Markdown 是后续 RAG Agent、Deep Research 等工作流的重要数据来源。
成熟内容进入 PublishMark 仓库并提交 Git,Cloudflare 自动构建和部署,形成自主维护的正式资料站。
SINGLE SOURCE OF TRUTH
mdFlow 是本工作流的统一规范与配置中心,负责让不同 Skill、应用和站点对同一份内容形成一致理解,避免规则散落在各个组件中。
各环节在首次初始化、缓存缺失或明确升级时,读取 mdFlow 项目的统一配置文件;日常运行使用本地配置,不主动联网更新配置。
DESIGN PRINCIPLES
正式规则集中维护,WebMark、CleanMark 与 PublishMark 不各自复制一套版本。
日常任务读取本地缓存;远程配置中心不是每次运行都必须在线的依赖。
只有用户或安装流程明确指定新版本时才升级,既有行为不会静默漂移。
公开规范可以远程分发;凭据、密钥和敏感环境信息只保存在本地。