# document_title_dispose **Repository Path**: bluesky79/document_title_dispose ## Basic Information - **Project Name**: document_title_dispose - **Description**: 红头文件标题提取网页部署(ngrok) - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 1 - **Forks**: 0 - **Created**: 2026-07-24 - **Last Updated**: 2026-07-24 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # 📄 PDF / Word 识别导出 Excel 工具 基于 Streamlit 的智能文档处理工具,自动识别 PDF 和 Word 文档中的红头标题,填充到 Excel 模板中,支持批量处理。 --- ## ✨ 功能特点 - 🔍 **PDF 识别**:利用 OCR 技术识别 PDF 页面中的文字,并自动定位红色分隔线(红头横线),提取标题1和标题2。 - 📝 **Word 识别**: - 若 Word 中包含图片,则对图片进行 OCR 识别,同样支持红头解析。 - 若 Word 为纯文本,则根据字号大小自动提取标题(最大字号为标题1,次大为标题2)。 - 📊 **Excel 模板填充**:支持自定义占位符(如 `{{title1}}`、`{{title2}}`、`{{receive_time}}`),将识别结果自动填入模板。 - 📦 **批量处理**:可一次性上传多个文件或通过文件名检索服务器文件,批量生成 Excel 结果。 - 📈 **进度与日志**:实时显示处理进度条,详细日志记录每个文件的处理状态,错误隔离不影响其他文件。 - ⚙️ **高级功能**: - 自定义模板占位符名称 - 自定义输出文件名前缀/后缀 - 🗂️ **结果下载**:支持单个下载或打包下载全部生成的 Excel 文件。 - **项目特点**:本项目配备了streamlit和ngrok,让你可以创建一个所有人都可以访问的网页,可供多人使用办公处理 - **提示**:本项目只适用于麒麟v10操作系统,代码由ai生成 --- ## 🚀 快速开始 ### 1. 安装依赖 确保 Python 版本 >= 3.8,推荐使用 Conda 管理环境。 ```bash # 克隆仓库(或下载源码) git clone https://gitee.com/bluesky79/document_title_dispose.git cd document_title_dispose # 安装所需包(若使用 requirements.txt) pip install -r requirements.txt ``` 如果未提供 `requirements.txt`,可手动安装以下核心依赖: ```bash pip install streamlit openpyxl pandas numpy opencv-python-headless PyMuPDF rapidocr_onnxruntime python-docx configparser ``` ### 2. 运行应用 ```bash streamlit run tool.py ``` 应用将自动在浏览器中打开(默认端口 8501)。 --- ## 🧩 使用指南 1. **配置检索目录**(可选):在侧边栏设置文件搜索路径,用于“检索服务器文件”模式。 2. **选择文件来源**: - 批量上传本地文件(支持多选,可同时上传 PDF 和 DOCX) - 根据文件名在配置目录中检索 3. **选择 Excel 模板**:可上传本地模板或从配置目录中检索。 4. **(可选)展开高级功能**:自定义模板中的占位符名称(如将 `{{title1}}` 改为 `{{subject}}`)以及输出文件的前缀/后缀。 5. **点击“开始批量转换”**:等待进度条完成,查看处理日志。 6. **下载结果**:支持单个下载或打包下载全部生成的 Excel 文件。 --- ## 🛠️ 技术栈 - **Streamlit** – 构建 Web 界面 - **OpenCV** – 图像处理(红头分隔线检测) - **PyMuPDF (fitz)** – PDF 解析和图像提取 - **RapidOCR** – 光学字符识别(OCR) - **python-docx** – Word 文档解析 - **openpyxl** – Excel 模板填充 --- ## 📁 项目结构 ``` . ├── tool.py # 主程序 ├── config.ini # 配置文件(可自动生成) ├── requirements.txt # 依赖列表 └── .streamlit/ └── config.toml # Streamlit 主题配置(可选) ``` --- ## 🤝 贡献与反馈 欢迎提交 Issue 或 Pull Request,帮助改进本项目。 --- ## 📄 许可 本项目基于 MIT 许可证开源,可自由使用和修改。 --- **开发**:云天 **日期**:2026年7月