# link-reader-openclaw **Repository Path**: woipanda/link-reader-openclaw ## Basic Information - **Project Name**: link-reader-openclaw - **Description**: Unified link content reader for OpenClaw with China-oriented platform fetchers - **Primary Language**: Unknown - **License**: MIT - **Default Branch**: main - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-03-28 - **Last Updated**: 2026-03-28 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # Link Reader 面向 OpenClaw 的统一链接读取 skill,用于把公开网页、文章页、文档页、资讯页、图文笔记页等内容,转换成结构化文本结果。 ## 这个仓库做什么 它提供一个统一入口: ```bash python3 scripts/read_url.py "" ``` 输入一个链接,输出: - 标题 - 作者 / 来源(若可提取) - 发布时间(若可提取) - 正文 Markdown - 图片列表 - 结构化质量指标 - 抓取路径 / 回退路径 ## 当前能力边界(公开口径) ### 已支持的能力类型 - 若干公开文章页 / 资讯页 / 文档页读取 - 若干动态 H5 / payload 型页面读取 - 图文笔记页读取 - 图文型图片 OCR(前几张图) - 视频笔记的**识别与地址提取** - 普通网页 generic fallback ### 当前明确边界 - “视频笔记支持”仅表示: - 可识别该内容是视频型笔记 - 可提取视频地址 / 元信息 - **不表示**已支持: - 视频转文字 - 字幕抽取 - 完整视频正文恢复 - generic fallback 成功,不等于某站点已经进入专用支持矩阵。 ## 安装 ### 方式一:手动 clone ```bash git clone https://gitee.com/woipanda/link-reader-openclaw.git cd link-reader-openclaw bash scripts/install.sh ``` ### 方式二:作为本地 skill 使用 将仓库放入 OpenClaw 的 `skills/` 目录后,通过: ```bash python3 scripts/read_url.py "" ``` 开始调用。 ## 快速用法 ```bash python3 scripts/read_url.py "https://example.com/post" python3 scripts/read_url.py "https://example.com/post" --format markdown python3 scripts/read_url.py "https://example.com/post" --format json python3 scripts/read_url.py "https://example.com/post" --output /tmp/article.md ``` ## 输出格式 ### JSON 适合上层 agent / 小龙虾编排: - `success` - `status` - `platform` - `url` - `final_url` - `title` - `author` - `source` - `publish_time` - `cover_image` - `content_markdown` - `images` - `fetch_method` - `quality_metrics` - `decision_path` - `attempts` 某些内容类型还会补充: - `content_type` - `tags` - `engagement` - `image_items` - `image_ocr` - `videos` - `video_meta` - `video_downloadable` - `video_text` 其中 `video_text` 当前只是“视频文本分析结果容器”,**不等于已正式支持视频转文字**。 ## 渐进披露建议 ### 默认 只调用: ```bash python3 scripts/read_url.py "" ``` ### 质量不好或失败时 再调用: ```bash python3 scripts/read_url.py "" --debug --artifacts-dir /tmp/link-reader-debug python3 scripts/check_env.py ``` ## 依赖 ### 基础 - Python 3.10+ - requests - beautifulsoup4 - lxml - playwright ### 可选但推荐 - tesseract(OCR 兜底) - Node + npm(generic fallback 某些策略需要) ## 环境预检 ```bash python3 scripts/check_env.py ``` ## 最小回归集 仓库内提供: - `tests/fixtures/smoke_urls.json` - `scripts/run_regression.py` 用于快速验证主链是否仍然可用。 当前回归覆盖: - 若干文章页样本 - 若干动态资讯页样本 - 图文笔记样本(验证 metadata / 图片 / OCR) - 视频笔记样本(验证 `note_video` / `videos` / `video_meta`;当前**不要求** `asr_text` 非空) - generic 示例页 运行方式: ```bash python3 scripts/run_regression.py python3 scripts/run_regression.py --debug ```