能力标签
chinese-llm-benchmark Agent工作流
⚙️
Agent工作流

chinese-llm-benchmark Agent工作流

无代码搭建完整 AI 自动化流程
英文名:chinese-llm-benchmark
⭐ 6.0k Stars 🍴 243 Forks 📄 未公布协议 🏷 AI 8.2分
8.2AI 综合评分
大模型评测基准测试中文NLP性能对标
✦ AI Skill Hub 推荐

chinese-llm-benchmark Agent工作流 是 AI Skill Hub 本期精选Agent工作流之一。已获得 6.0k 颗 GitHub Star,综合评分 8.2 分,整体质量较高。我们强烈推荐将其纳入你的 AI 工具库,帮助提升工作效率。

📚 深度解析

chinese-llm-benchmark Agent工作流 是一套完整的 AI Agent 自动化工作流方案。随着 AI 能力的不断提升,基于 Agent 的自动化工作流正在成为提升个人和团队效率的核心方式。区别于传统的 RPA 自动化(模拟鼠标键盘操作),AI Agent 工作流通过理解任务意图、动态规划执行路径,能够处理更复杂的非结构化任务。

chinese-llm-benchmark Agent工作流 工作流的设计遵循"最小配置,最大复用"原则:核心逻辑已经封装好,用户只需配置自己的 API Key 和业务参数即可快速上手。工作流内置错误处理和重试机制,在网络波动或 API 限速等情况下仍能稳定运行,适合作为生产环境的自动化基础设施。

在实际部署时,建议先在测试环境中运行 3-5 次,验证各个环节的输出结果符合预期,再部署到生产环境。AI Skill Hub 评分 8.2 分,是同类 Agent 工作流中的精选推荐。

📋 工具概览

chinese-llm-benchmark Agent工作流 是一套完整的 AI Agent 自动化工作流方案。通过可视化的节点编排,将复杂的多步骤任务拆解为清晰的自动化流程,实现全程无人值守的智能处理。支持与数百种外部服务和 API 无缝集成,适合构建数据处理管线、业务自动化和 AI 辅助决策系统。

GitHub Stars
⭐ 6.0k
开发语言
多语言
支持平台
Windows / macOS / Linux
维护状态
持续维护,定期更新
开源协议
未公布
AI 综合评分
8.2 分
工具类型
Agent工作流
Forks
243

📖 中文文档

以下内容由 AI Skill Hub 根据项目信息自动整理,如需查看完整原始文档请访问底部「原始来源」。

chinese-llm-benchmark Agent工作流 是一套完整的 AI Agent 自动化工作流方案。通过可视化的节点编排,将复杂的多步骤任务拆解为清晰的自动化流程,实现全程无人值守的智能处理。支持与数百种外部服务和 API 无缝集成,适合构建数据处理管线、业务自动化和 AI 辅助决策系统。

📌 核心特色
  • 可视化 Agent 工作流编排,无需编写复杂代码
  • 支持多步骤自动化任务链,实现全流程无人值守
  • 与外部 API、数据库和第三方服务无缝集成
  • 内置错误处理与自动重试机制,保障稳定运行
  • 提供可复用的自动化模板,快速在同类场景部署
🎯 主要使用场景
  • 自动化日常重复性工作,将精力集中于创造性任务
  • 构建数据采集 → 处理 → 输出的完整自动化管线
  • 实现跨平台、跨系统的数据流转和业务协同
以下安装命令基于项目开发语言和类型自动生成,实际以官方 README 为准。
安装命令
# 克隆仓库
git clone https://github.com/jeinlee1991/chinese-llm-benchmark
cd chinese-llm-benchmark

# 查看安装说明
cat README.md

# 按 README 完成环境依赖安装后即可使用
📋 安装步骤说明
  1. 访问 GitHub 仓库获取工作流文件
  2. 在对应平台(Dify / Flowise / Make 等)中找到「导入工作流」功能
  3. 上传工作流文件
  4. 按照提示配置必要的环境变量和 API Key
  5. 运行测试确认流程正常后投入使用
以下用法示例由 AI Skill Hub 整理,涵盖最常见的使用场景。
常用命令 / 代码示例
# 查看帮助
chinese-llm-benchmark --help

# 基本运行
chinese-llm-benchmark [options] <input>

# 详细使用说明请查阅文档
# https://github.com/jeinlee1991/chinese-llm-benchmark
以下配置示例基于典型使用场景生成,具体参数请参照官方文档调整。
配置示例
# chinese-llm-benchmark 配置说明
# 查看配置选项
chinese-llm-benchmark --config-example > config.yml

# 常见配置项
# output_dir: ./output
# log_level: info
# workers: 4

# 环境变量(覆盖配置文件)
export CHINESE_LLM_BENCHMARK_CONFIG="/path/to/config.yml"
📑 README 深度解析 真实文档 完整度 28/100 查看 GitHub 原文 →
以下内容由系统直接从 GitHub README 解析整理,保留代码块、表格与列表结构。

非线智能 NoneLinear - ReLE评测:中文AI大模型能力评测(持续更新)

- ReLE (Really Reliable Live Evaluation for LLM),原名CLiB - 目前已囊括398个大模型,覆盖chatgpt、gpt-6、gpt-5.6、谷歌gemini-3.1-pro、Claude-5、grok-4.6、文心ERNIE-X1.1、ERNIE-5.1、qwen3.8-max、商汤senseChat等商用模型, 以及hy3、step3.7-flash、kimi-k3、ernie4.5、MiniMax-M3、deepseek-v4、Qwen3.8、llama4、智谱GLM-5.3、MiMo-V2、LongCat、gemma4、mistral等开源大模型。 - 支持多维度能力评测,包括教育、医疗与心理健康、金融、法律与行政公务、推理与数学计算、语言与指令遵从、agent与工具调用等7个领域,以及细分的~300个维度(比如牙科、高中语文…)。详见我们的技术报告ReLE: A Scalable System and Structured Benchmark for Diagnosing Capability Anisotropy in Chinese LLMs 媒体报道(机器之心):全球304个中文大模型实测:没有“全能王者”,ReLE凭70%降本方案破解评估困局 - 不仅提供排行榜,也提供规模超200万的大模型缺陷库!方便广大社区研究分析、改进大模型。 - 为您的私有大模型提供免费评测服务,联系我们(非线智能 ReLE benchmark团队):加微信

1、综合能力排行榜

“综合能力”计分方式:“综合能力”改为“专业能力”和“通用能力”的加权分,权重分别为0.3,0.7;其中“专业能力”为“教育”、“医疗与心理健康”、“金融”、“法律与行政公务”4大领域平均分,“通用能力”为“推理与数学计算”、“语言与指令遵从”、“agent与工具调用”、“coding” 4大领域平均分。 link

类别机构大模型【总分】准确率平均耗时平均消耗token花费/千次(元)排名(准确率)
商用阿里巴巴qwen3.7-max76.9%51s292099.01
商用anthropicclaude-opus-5(new)76.8%15s1216168.82

详细数据见:综合能力排行榜 | 通用能力排行榜 | 专业能力排行榜 <br><br>

#### 1.1 推理模型排行榜 见推理模型排行榜<br> <br> #### 1.2 商用大模型排行榜(含开源模型的付费API) 输出价格5元及以上商用大模型 | 输出价格1~5元商用大模型 | 输出价格1元以下商用大模型<br> DIY自定义维度筛选榜单:☛ link <br> <br> #### 1.3 开源大模型排行榜 5B以下开源大模型 | 5B~20B开源大模型 | 20B以上开源大模型<br> DIY自定义维度筛选榜单:☛link

<br><br>

6.4 算术能力

考查大模型的数学基础能力之算数能力,测试题目为1000以内的整数加减法、不超过2位有效数字的浮点数加减乘除。 举例:166 + 215 + 53 = ?,0.97 + 0.4 / 4.51 = ?

完整排行榜见算术能力<br> ☛查看算术能力:badcase <br><br>

GitHub热门大模型评测项目

repostarareaabout
[langfuse](https://github.com/langfuse/langfuse)32.9k国外Open source LLM engineering platform: LLM Observability, metrics, evals, prompt management, playground, datasets. Integrates with OpenTelemetry, Langchain, OpenAI SDK, LiteLLM, and more. 🍊YC W23
[opik](https://github.com/comet-ml/opik)21.3k国外Debug, evaluate, and monitor your LLM applications, RAG systems, and agentic workflows with comprehensive tracing, automated evaluations, and production-ready dashboards.
[promptfoo](https://github.com/promptfoo/promptfoo)24.2k国外Test your prompts, agents, and RAGs. AI Red teaming, pentesting, and vulnerability scanning for LLMs. Compare performance of GPT, Claude, Gemini, Llama, and more. Simple declarative configs with command line and CI/CD integration.
[deepeval](https://github.com/confident-ai/deepeval)17.5k国外The LLM Evaluation Framework
……………………
[⭐chinese-llm-benchmark(我们)](https://github.com/jeinlee1991/chinese-llm-benchmark)5.7k**国内**ReLE中文大模型能力评测(持续更新)
……………………

详见hot50 <br><br>

大模型基本信息

- 每周最新模型 - 8月3~8月9 - 7月27~8月2 - 7月20~7月26 - 7月13~7月19 - 更多信息详见模型列表 <br><br>

🚀 大模型统一网关

隆重推出 一站式 AI 模型超市 🛒,提供当下最全的大模型,让您永远快人一步。 - 🌐 全球模型,一网打尽:GPT-5.6、Gemini-3.1-Pro、Claude-5、DeepSeek-v4、Kimi-k3…… - ⚖️ 智能负载与高并发:我们聚合了多家顶级供应商,通过智能路由实现自动负载均衡。您从此可以告别烦人的 Rate Limit 报错,轻松应对任何流量洪峰! - 🔀 自动故障切换:单一供应商的 API 临时“抽风”?没关系!我们的系统会毫秒级无感切换到健康的备用渠道,确保您的服务 99.9999% 高可用,让您的用户远离“服务不可用”的尴尬。 - 🛡️在线监控与智能选型:无缝衔接在线效果监测工具,打通模型选型评测闭环。用真实数据说话,助您轻松找到性能最佳、性价比最高的模型方案。 如何接入在线效果监测如何接入模型选型评测 - 💰 超高性价比!☛查看所有模型及价格

from openai import OpenAI
base_url = "https://api.nonelinear.com/v1"
api_key = "<your api key>" # 获取https://nonelinear.com/static/apikey.html
client = OpenAI(api_key=api_key, base_url=base_url)
client.chat.completions.create(
    model="<model id>", # 模型列表https://nonelinear.com/static/models.html
    messages=[{"role": "user", "content": "<your prompt>"}],
)
<br><br>

💥模型选型:目标降本90%

拒绝“盲选”大模型🎉!上传你的【专属测试数据】📊,5分钟🔍测出哪个模型在你的场景下效果最好🏆、最划算💰!选择最合适模型,成本或降90%💥!去体验>> link <video controls src="docs/modelSelection/img/modelsel.mp4"></video>

示例: - 微信文章撰写之表格总结 - MathML转LaTeX格式 <br><br>

6.5 表格问答

专门考查大模型对表格的理解分析能力,常用于数据分析。 评测样本举例: > 姓名,年龄,性别,国籍,身高(cm),体重(kg),学历 张三,28,男,中国,180,70,本科 Lisa,33,女,美国,165,58,硕士 Paulo,41,男,巴西,175,80,博士 Miyuki,25,女,日本,160,50,大专 Ahmed,30,男,埃及,175,68,本科 Maria,29,女,墨西哥,170,65,硕士 Antonio,36,男,西班牙,182,75,博士 基于这个表格回答:学历最低的是哪国人? >

完整排行榜见表格问答<br> ☛查看表格问答:badcase <br><br>

🎯 aiskill88 AI 点评 A 级 2026-05-21

全面专业的中文大模型评测平台,覆盖面广、更新及时,为用户提供权威对标数据,是模型选型的重要参考工具

📚 实用指南(长尾问题)
适合谁
  • 构建多智能体协作系统的 Agent 开发者
  • 构建企业知识库 / RAG 检索应用的团队
  • 跨境业务、多语言内容运营团队
最佳实践
  • 生产部署优先使用 Docker Compose 隔离依赖,并挂载 volume 持久化数据
  • 分块大小建议 256-512 tokens,向量库优选 pgvector 或 Qdrant
  • Agent 任务先做 dry-run 验证工具调用链,再开启自主执行
常见错误
  • API key 直接提交到 git 仓库(请用 .env 并加入 .gitignore)
  • 容器内无法访问宿主机 localhost — 使用 host.docker.internal
  • embedding 模型与查询模型不一致导致检索失效
部署方案
  • Docker:chinese-llm-benchmark 提供官方镜像,docker compose up 一键启动
  • CLI:直接 npm install -g / pip install,命令行调用
  • 云端托管:可放在 Vercel / Railway / Fly.io 等 PaaS 平台
相关搜索
chinese-llm-benchmark 中文教程chinese-llm-benchmark 安装报错怎么办chinese-llm-benchmark Docker 部署chinese-llm-benchmark Agent 工作流chinese-llm-benchmark 与同类工具对比chinese-llm-benchmark 最佳实践chinese-llm-benchmark 适合谁用

⚡ 核心功能

👥 适合谁
  • 构建多智能体协作系统的 Agent 开发者
  • 构建企业知识库 / RAG 检索应用的团队
  • 跨境业务、多语言内容运营团队
⭐ 最佳实践
  • 生产部署优先使用 Docker Compose 隔离依赖,并挂载 volume 持久化数据
  • 分块大小建议 256-512 tokens,向量库优选 pgvector 或 Qdrant
  • Agent 任务先做 dry-run 验证工具调用链,再开启自主执行
⚠️ 常见错误
  • API key 直接提交到 git 仓库(请用 .env 并加入 .gitignore)
  • 容器内无法访问宿主机 localhost — 使用 host.docker.internal
  • embedding 模型与查询模型不一致导致检索失效

👥 适合人群

自动化工程师和运维人员项目经理和业务分析师希望减少重复性工作的专业人士数字化转型团队

🎯 使用场景

  • 自动化日常重复性工作,将精力集中于创造性任务
  • 构建数据采集 → 处理 → 输出的完整自动化管线
  • 实现跨平台、跨系统的数据流转和业务协同

⚖️ 优点与不足

✅ 优点
  • +GitHub 6.0k Star,社区高度认可
  • +大幅减少重复性人工操作
  • +可视化流程,清晰直观
  • +可扩展性强,支持复杂场景
⚠️ 不足
  • 未明确开源协议,商用场景需谨慎评估
  • 初始配置和调试需投入一定时间
  • 强依赖外部服务的稳定性
  • 复杂场景需具备一定技术基础
⚠️ 使用须知

该工具未明确声明开源协议,商业使用前请联系原作者确认授权范围,避免侵权风险。

AI Skill Hub 为第三方内容聚合平台,本页面信息基于公开数据整理,不对工具功能和质量作任何法律背书。

建议在沙箱或测试环境中充分验证后,再部署至生产环境,并做好必要的安全评估。

🔗 相关工具推荐

📰 相关 AI 新闻
🍿 AI 圈相关吃瓜
🗺️ 相关解决方案
🧩 你可能还需要
基于当前 Skill 的能力图谱,自动补全的工具组合

❓ 常见问题 FAQ

目前支持374+主流模型,包括OpenAI、Google、Anthropic等商用模型及开源模型
💡 AI Skill Hub 点评

经综合评估,chinese-llm-benchmark Agent工作流 在Agent工作流赛道中表现稳健,质量优秀。如果你已有明确的使用需求,可以直接上手体验;如果还在评估阶段,建议对比同类工具后再做决策。

⬇️ 获取与下载
⚠️ 该工具未声明开源协议,不提供直接下载。请访问原项目了解使用条款。
📚 深入学习 chinese-llm-benchmark Agent工作流
查看分步骤安装教程和完整使用指南,快速上手这款工具
🌐 原始信息
原始名称 chinese-llm-benchmark
原始描述 开源AI工作流:ReLE评测:中文AI大模型能力评测(持续更新):目前已囊括374个大模型,覆盖chatgpt、gpt-5.4、谷歌gemini-3.1-pro、Claude-。⭐6.0k
Topics 大模型评测基准测试中文NLP性能对标
GitHub https://github.com/jeinlee1991/chinese-llm-benchmark
🔗 原始来源
🐙 GitHub 仓库  https://github.com/jeinlee1991/chinese-llm-benchmark 🌐 官方网站  https://nonelinear.com

收录时间:2026-05-14 · 更新时间:2026-05-16 · License:未公布 · AI Skill Hub 不对第三方内容的准确性作法律背书。

📺 订阅 AI Skill Hub Daily Telegram 频道
每天 8 条精选 AI Skill、MCP、Agent 与自动化工具推送
加入频道 →