智能工作流 是 AI Skill Hub 本期精选Agent工作流之一。已获得 5.2k 颗 GitHub Star,综合评分 8.0 分,整体质量较高。我们强烈推荐将其纳入你的 AI 工具库,帮助提升工作效率。
智能工作流 是一套完整的 AI Agent 自动化工作流方案。通过可视化的节点编排,将复杂的多步骤任务拆解为清晰的自动化流程,实现全程无人值守的智能处理。支持与数百种外部服务和 API 无缝集成,适合构建数据处理管线、业务自动化和 AI 辅助决策系统。
智能工作流 是一套完整的 AI Agent 自动化工作流方案。通过可视化的节点编排,将复杂的多步骤任务拆解为清晰的自动化流程,实现全程无人值守的智能处理。支持与数百种外部服务和 API 无缝集成,适合构建数据处理管线、业务自动化和 AI 辅助决策系统。
# 方式一:pip 安装(推荐)
pip install sparrow
# 方式二:虚拟环境安装(推荐生产环境)
python -m venv .venv
source .venv/bin/activate # Windows: .venv\Scripts\activate
pip install sparrow
# 方式三:从源码安装(获取最新功能)
git clone https://github.com/katanaml/sparrow
cd sparrow
pip install -e .
# 验证安装
python -c "import sparrow; print('安装成功')"
# 命令行使用
sparrow --help
# 基本用法
sparrow input_file -o output_file
# Python 代码中调用
import sparrow
# 示例
result = sparrow.process("input")
print(result)
# sparrow 配置文件示例(config.yml) app: name: "sparrow" debug: false log_level: "INFO" # 运行时指定配置文件 sparrow --config config.yml # 或通过环境变量配置 export SPARROW_API_KEY="your-key" export SPARROW_OUTPUT_DIR="./output"
Structured data extraction, instruction calling and agentic workflows with ML, LLM and Vision LLM
Sparrow is an API-first platform for enterprise document intelligence. It combines accurate structured extraction from documents (invoices, statements, tables) with workflow agents and decision agents.
<p align="center"> <img width="300" height="300" src="https://github.com/katanaml/sparrow/blob/main/sparrow-ui/assets/sparrow_logo_5.png"> </p>
<p align="center"> <strong>🚀 <a href="https://sparrow.katanaml.io">Try Sparrow Online</a> | 📖 <a href="#-quickstart">Quick Start</a> | 🛠️ <a href="#️-installation">Installation</a> | 📚 <a href="#-examples">Examples</a> | 🤖 <a href="#-sparrow-agent">Agents</a></strong> </p>
---
The web UI provides a visual interface on top of the same API:
🎯 Universal Document Processing: Handle invoices, receipts, forms, bank statements, tables 🔧 Pluggable Architecture: Mix and match different pipelines (Sparrow Parse, Instructor, Agents) 🖥️ Multiple Backends: MLX, Ollama, vLLM, Docker, Hugging Face Cloud GPU, Mistral OCR 📱 Multi-format Support: Images (PNG, JPG) and multi-page PDFs 🎨 Schema Validation: JSON schema-based extraction with automatic validation 🌐 API-First Design: RESTful APIs for easy integration 💬 Instruction Calling: Text processing, validation, decision making with Gemma, Mistral, Qwen 3.6, etc. 📊 Visual Monitoring: Built-in dashboard and agent workflow tracking 🔒 Enterprise Ready: Rate limiting, usage analytics, commercial licensing available 🚀 Local Vision LLMs: Mistral, Qwen 3.6, DeepSeek OCR, dots.ocr, Gemma 4, etc. ☁️ Cloud OCR Backend: Mistral OCR for cloud document extraction
pyenv for version management)```bash
pyenv install 3.12.10 pyenv global 3.12.10
git clone https://github.com/katanaml/sparrow.git cd sparrow/sparrow-ml/llm pip install -r requirements_sparrow_parse.txt
brew install poppler
```bash
python api.py --port 8002
pip install --upgrade pip pip install mlx-vlm --no-cache-dir
bash
pdftoppm -h
</details>
<details>
<summary>🔧 Runtime Issues</summary>
**Memory Errors:**
- Use smaller or MoE models to reduce VRAM footprint
- Enable image cropping: `--crop-size 100`
- Process single pages instead of entire PDFs
**Model Loading Fails:**bash
./sparrow.sh assistant --pipeline "stocks" --query "Oracle"
**JSON Output:**json { "company": "Oracle Corporation", "ticker": "ORCL" }
**Additional Output:** The stock price of the Oracle Corporation is 186.3699951171875. USD ```
```bash
```bash
python -m venv .env_sparrow_parse source .env_sparrow_parse/bin/activate # Linux/Mac
#### Sparrow Parse (Vision LLM) ```bash
pyenv install 3.12.10 pyenv global 3.12.10
**MLX Installation (Apple Silicon):**bash
python api.py ```
Before running pip install -r requirements_sparrow_parse.txt, check your platform. If you are on macOS and want to run MLX backend, go to requirements_sparrow_parse.txt and make sure sparrow-parse[mlx] libary reference is defined. If you are running Sparrow on Linux/Windows, make sure to use sparrow-parse library reference, this will skip MLX related libraries.
```
/inference)curl -X POST 'http://localhost:8002/api/v1/sparrow-llm/inference' \
-H 'Content-Type: multipart/form-data' \
-F 'query=[{"field_name":"str", "amount":0}]' \
-F 'pipeline=sparrow-parse' \
-F 'options=mlx,mlx-community/Qwen2.5-VL-72B-Instruct-4bit' \
-F 'file=@document.pdf'
/instruction-inference)curl -X POST 'http://localhost:8002/api/v1/sparrow-llm/instruction-inference' \
-H 'Content-Type: application/x-www-form-urlencoded' \
-d 'query=instruction: analyze data, payload: {...}' \
-d 'pipeline=sparrow-instructor' \
-d 'options=mlx,mlx-community/Qwen3.6-35B-A3B-8bit'
Visit http://localhost:8002/api/v1/sparrow-llm/docs for interactive Swagger documentation.

| Component | Purpose | Use Case |
|---|---|---|
| **[Sparrow ML LLM](https://github.com/katanaml/sparrow/tree/main/sparrow-ml/llm)** | Main API engine | Document processing pipelines |
| **[Sparrow Parse](https://github.com/katanaml/sparrow/tree/main/sparrow-data/parse)** | Vision LLM library | Structured JSON extraction |
| **[Sparrow Agents](https://github.com/katanaml/sparrow/tree/main/sparrow-ml/agents)** | Workflow orchestration | Complex multi-step processing |
| **[Sparrow OCR](https://github.com/katanaml/sparrow/tree/main/sparrow-data/ocr)** | Text recognition | OCR preprocessing |
| **[Sparrow UI](https://github.com/katanaml/sparrow/tree/main/sparrow-ui/)** | Web interface | Interactive document processing |
| Feature | Sparrow Parse | Sparrow Instructor | Sparrow Agents |
|---|---|---|---|
| **Input** | Documents + JSON schema | Text instructions | Complex workflows |
| **Output** | Structured JSON | Free-form text | Multi-step results |
| **Use Cases** | Data extraction, forms | Summarization, analysis | Enterprise workflows |
| **Validation** | Schema-based | Manual | Custom rules |
| **Complexity** | Simple | Medium | High |
| **Best For** | Invoices, tables, forms | Text processing | Multi-document flows |
Sparrow 是一个强大的通用文档处理框架,旨在通过视觉大语言模型(Vision LLM)实现对发票、收据、表单及银行账单等复杂文档的高精度解析。它不仅支持图像和多页 PDF 格式,还具备高度的可扩展性,能够将文档解析、信息提取与验证流程无缝集成。
Sparrow 提供了一套完整的文档处理解决方案。其 Web UI 支持拖拽上传、实时处理进度查看及结果标注(Bounding Boxes),并能输出结构化的 JSON 数据。核心功能包括插件化架构(支持 Sparrow Parse、Instructor 和 Agents 组合)、多后端支持(涵盖 MLX、Ollama、vLLM、Docker 及 Hugging Face Cloud GPU)以及基于 JSON Schema 的严格数据校验,支持构建复杂的多步工作流。
运行 Sparrow 需要 Python 3.12.10 或更高版本(建议使用 pyenv 进行版本管理)。操作系统方面,若需使用 MLX 后端则必须在 macOS 环境下运行,其他后端支持 Linux 或 Windows。此外,用户需确保 GPU 拥有足够的显存来承载所选的 Vision LLM 模型。
安装过程非常快速。首先通过 pyenv 安装并切换至 Python 3.12.10 环境;随后克隆 Sparrow 源码仓库,进入 `sparrow-ml/llm` 目录,并根据平台需求安装对应的依赖文件 `requirements_sparrow_parse.txt`。如果是 macOS 用户,请务必检查该文件以确保正确引用了 `sparrow-parse[mlx]` 库。
Sparrow 支持通过命令行进行快速测试。例如,你可以使用 `assistant` 模式配合指定的 `pipeline`(如 stocks)进行 Function calling 实验。系统会根据你的查询自动执行逻辑,并返回结构化的 JSON 结果及相关的文本描述,非常适合开发者进行原型验证。
项目通过配置文件和环境变量进行管理。在运行前,建议为 Sparrow Parse 创建独立的虚拟环境(venv)以隔离依赖。用户可以通过配置 Pipeline Options 来选择不同的后端模型(如 mlx-community 提供的量化模型),实现灵活的推理控制。
Sparrow 提供基于 FastAPI 的标准 API 服务。启动 API 服务器后,开发者可以通过访问 `http://localhost:8002/api/v1/sparrow-llm/docs` 查看完整的 Swagger 文档。核心接口 `/inference` 支持通过 multipart/form-data 格式上传文档,并结合 query 参数实现精准的字段提取。
Sparrow 的核心由多个模块组成:`Sparrow ML LLM` 作为主 API 引擎,负责驱动整个文档处理流水线;`Sparrow Parse` 则专注于视觉解析任务,将非结构化文档转化为结构化数据,两者协同工作以实现从文档输入到高质量数据输出的完整闭环。
在遇到问题时,请优先检查当前运行平台与依赖库的匹配情况。特别是 macOS 用户在配置 MLX 后端时,需确认 `requirements_sparrow_parse.txt` 中的库引用是否正确。对于显存不足导致的报错,建议根据硬件情况调整 Vision LLM 的量化版本。
sparrow是一个高质量的开源AI工作流项目,支持多种AI任务
AI Skill Hub 为第三方内容聚合平台,本页面信息基于公开数据整理,不对工具功能和质量作任何法律背书。
建议在沙箱或测试环境中充分验证后,再部署至生产环境,并做好必要的安全评估。
⚠️ GPL 3.0 — 强 Copyleft,衍生作品须开源,含专利保护条款,不可闭源使用。
经综合评估,智能工作流 在Agent工作流赛道中表现稳健,质量优秀。如果你已有明确的使用需求,可以直接上手体验;如果还在评估阶段,建议对比同类工具后再做决策。
| 原始名称 | sparrow |
| 原始描述 | 开源AI工作流:Structured data extraction, instruction calling and agentic workflows with ML, L。⭐5.2k · Python |
| Topics | agentic-aicomputer-visiondocumentaihuggingface-transformersllmpython |
| GitHub | https://github.com/katanaml/sparrow |
| License | GPL-3.0 |
| 语言 | Python |
收录时间:2026-06-02 · 更新时间:2026-06-02 · License:GPL-3.0 · AI Skill Hub 不对第三方内容的准确性作法律背书。
选择 Agent 类型,复制安装指令后粘贴到对应客户端