AI Skill Hub 强烈推荐:自适应分块 是一款优质的Agent工作流。AI 综合评分 8.0 分,在同类工具中表现稳健。如果你正在寻找可靠的Agent工作流解决方案,这是一个值得深入了解的选择。
自适应分块 是一套完整的 AI Agent 自动化工作流方案。通过可视化的节点编排,将复杂的多步骤任务拆解为清晰的自动化流程,实现全程无人值守的智能处理。支持与数百种外部服务和 API 无缝集成,适合构建数据处理管线、业务自动化和 AI 辅助决策系统。
自适应分块 是一套完整的 AI Agent 自动化工作流方案。通过可视化的节点编排,将复杂的多步骤任务拆解为清晰的自动化流程,实现全程无人值守的智能处理。支持与数百种外部服务和 API 无缝集成,适合构建数据处理管线、业务自动化和 AI 辅助决策系统。
# 方式一:pip 安装(推荐)
pip install adaptive-chunking
# 方式二:虚拟环境安装(推荐生产环境)
python -m venv .venv
source .venv/bin/activate # Windows: .venv\Scripts\activate
pip install adaptive-chunking
# 方式三:从源码安装(获取最新功能)
git clone https://github.com/ekimetrics/adaptive-chunking
cd adaptive-chunking
pip install -e .
# 验证安装
python -c "import adaptive_chunking; print('安装成功')"
# 命令行使用
adaptive-chunking --help
# 基本用法
adaptive-chunking input_file -o output_file
# Python 代码中调用
import adaptive_chunking
# 示例
result = adaptive_chunking.process("input")
print(result)
# adaptive-chunking 配置文件示例(config.yml) app: name: "adaptive-chunking" debug: false log_level: "INFO" # 运行时指定配置文件 adaptive-chunking --config config.yml # 或通过环境变量配置 export ADAPTIVE_CHUNKING_API_KEY="your-key" export ADAPTIVE_CHUNKING_OUTPUT_DIR="./output"
pip install -e ".[paper]"
Some metrics require spaCy models:
bash python -m spacy download en_core_web_sm ```
chunks = chunk_files("path/to/pdfs/", chunk_size=600, chunk_overlap=50)
git clone https://github.com/ekimetrics/adaptive-chunking.git
cd adaptive-chunking
pip install -e ".[dev]"
Or install only what you need:
```bash
```python from adaptive_chunking import chunk_files
pip install -e ".[coref]"
pip install -e .
JINA_API_KEY=... ```
</details>
adaptive-chunking 是一个专为高质量文档处理设计的智能分块工具。它能够自动解析 PDF 文件并将其转化为适合大模型(LLM)处理的文本块,通过自适应策略确保分块过程既符合预设的 size 限制,又能最大限度地保留文档的语义完整性,是构建 RAG 应用的关键组件。
本项目具备强大的核心功能:提供 Adaptive recursive splitter,支持自定义分隔符、合并模式及���叠度(overlap),并能根据文档自动选择策略;内置 5 项 intrinsic quality metrics 质量指标,涵盖 size compliance、intrachunk cohesion、contextual coherence、block integrity 及 filtered missing reference error,确保分块质量;同时支持 Docling(默认开源)、PyMuPDF(轻量级)及 Azure Document Intelligence(云端)三种 PDF 解析后端。
为了实现论文复现及完整功能,请确保安装了所有依赖项。通过 `pip install -e ".[paper]"` 进行安装。需要注意的是,部分质量评估指标依赖 spaCy 模型,请务必运行 `python -m spacy download en_core_web_sm` 来下载必要的英文语言模型包。
您可以通过克隆仓库并进行本地开发安装:首先执行 `git clone` 获取源码,进入目录后运行 `pip install -e ".[dev]"`。如果您希望按需安装,也可以根据功能模块选择性安装,例如仅安装核心包或包含特定功能的扩展包。
本项目提供了极简的 Quick Start 体验。开发者只需通过 `from adaptive_chunking import chunk_files` 导入函数,即可实现“解析 PDF 并分块”的一站式操作。只需指定文件路径、chunk_size 和 chunk_overlap 参数,即可快速获取处理后的文本块,无需手动编写��杂的解析逻辑。
在进行质量评估指标计算时,建议配置 Jina AI 服务。如果配置了相关参数,系统将调用 Jina REST API 而非在本地加载 jina-embed 模型,这有助于在保持高性能的同时降低本地计算资源的消耗,是优化评估流程的推荐做法。
本项目支持高级 API 功能,例如通过安装 `pip install -e ".[coref]"` 来启用指代消解(coreference resolution)功能。这使得处理后的文本在语义上更加连贯,能够更好地处理文档中的代词指代问题,提升下游任务的准确度。注意其授权协议为 CC BY-NC-SA 4.0。
项目的核心工作流由 Core package 驱动,主要包含两个关键模块:splitter(分块器)负责执行智能分块逻辑,metrics(指标评估)负责对分块质量进行多维度的量化评估。通过这种模块化设计,开发者可以灵活地将分块与质量检测集成到现有的数据处理流水线中。
AI Skill Hub 为第三方内容聚合平台,本页面信息基于公开数据整理,不对工具功能和质量作任何法律背书。
建议在沙箱或测试环境中充分验证后,再部署至生产环境,并做好必要的安全评估。
✅ MIT 协议 — 最宽松的开源协议之一,可自由商用、修改、分发,仅需保留版权声明。
总体来看,自适应分块 是一款质量优秀的Agent工作流,在同类工具中具备一定竞争力。AI Skill Hub 将持续追踪其更新动态,建议收藏备用,结合自身场景选择合适时机引入使用。
| 原始名称 | adaptive-chunking |
| 原始描述 | 开源AI工作流:Adaptive Chunking: automatically select the best chunking method per document fo。⭐365 · Python |
| Topics | nlpinformation-retrievalllmrag |
| GitHub | https://github.com/ekimetrics/adaptive-chunking |
| License | MIT |
| 语言 | Python |
收录时间:2026-07-06 · 更新时间:2026-07-11 · License:MIT · AI Skill Hub 不对第三方内容的准确性作法律背书。
选择 Agent 类型,复制安装指令后粘贴到对应客户端