任德耀

大模型应用工程师 · AI Agent 开发

深耕制造业agent + 全栈 AI 工程能力,独立交付生产级大模型应用。 让 LLM 真正落地业务 —— 把"模型能跑"推进到"线上能扛"。

任德耀
AI 时代真正稀缺的人,不只是会用工具的人, 而是帮组织重新设计工作

能力方向

从底层模型到上层工程,全链路覆盖大模型应用落地。

AI Agent 开发

LangGraph / Plan-Execute 多智能体编排、Function Calling · MCP 工具调用、SSE 流式思维链、上下文工程。

了解更多

LLM 微调与 RAG

LoRA 微调 · CoT 数据蒸馏 · 自建评测体系 · vLLM / Ollama 部署 · BGE-M3 + Chroma 向量检索。

了解更多

全栈工程化

FastAPI · React 18 · Docker Compose · JWT + 三层 RBAC · SSE 流式 · 公网部署。

了解更多

关于我

25 岁,统招本科(泰山科技学院),现居北京,籍贯山东济宁。

2 年制造业 B 端经验,对 CRM / ERP(缤纷销客、鼎捷 T100、ERPNext)与跨部门数据流有深度理解, 专注把大模型能力嵌入销售、采购、仓储、生产、质检、财务等真实业务场景。

清楚哪些流程适合接入 AI、哪些流程应保留人工判断。 擅长把"模型能跑"推进到"线上能扛"——鉴权、权限隔离、流式体验、成本控制全链路落地。

手机13395478541(微信同号)
邮箱rdy1131635252@gmail.com
求职意向大模型应用工程师 / AI Agent 开发工程师
联系我
任德耀

技能栈

从底层模型到上层工程的全栈能力。

经历

围绕制造业 Agent 流程的工程实践与项目积累。

工作经历

信息管理部

2024-2026

独立对接 50+ B 端客户,覆盖报价 / 合同 / 交期全流程;主导推动接入并日常使用 CRM 与 ERP,梳理跨部门数据流,沉淀标准 SOP; 使用 Python + Pandas 对历史订单做客户分群。深度参与 ERP 落地, 积累销售到财务全业务域的数据模型理解 —— 这是两个 AI 项目的业务蓝本与需求来源。

宁波巨隆机械有限公司 · 业务部

实习经历

实验室

2023

用 Excel / Python 完成实验数据整理与可视化分析;编写脚本提升实验记录录入效率; 参与项目汇报,建立"问题—假设—实验—结论"工程思维。

杭州绿兴环保有限公司 · 研发部

教育背景

统招本科

本科

泰山科技学院本科期间打下扎实的工程基础; 持续投入 AI/ML 与大模型应用工程,以真实业务场景驱动实践,把所学落到生产标准的工程交付上。

泰山科技学院

项目作品

主导设计与落地的代表项目。

企业级落地项目 · 2026 · 公网可验证

小耀 · 企业 ERP 智能问数 Agent 平台

LLM + ERP 智能 Agent 系统 · 独立负责全栈交付

需求与数据模型源自制造企业真实业务流程,按生产标准交付并公网部署。用户用自然语言提问, Agent 自动路由到对应业务域、调用参数化 SQL 工具直连 ERP 生产库,秒级返回结构化结果与可下载图表 / 报表。 独立完成需求分析、架构设计、Agent 引擎、前后端开发与上线部署运维。

FastAPI Function Calling React 18 TypeScript SQLAlchemy 2.0 Docker Compose ERPNext v15 MariaDB Chroma + BGE-M3 JWT · 三层 RBAC

业务场景与解决的痛点

围绕制造业 B 端高频业务场景设计 —— "出差路上被催报表"、"月底对账跨表查"、"晨会前赶拼工单数据", 小耀把这些常见低效环节重写成秒级问答。

重要技术点 · 架构全景

从用户提问到 ERP 出数的完整技术栈,按请求流向分层展开。鼠标悬停任意标签查看原理与作用。

前端交互层
用户入口
React 18 Vite TypeScript Tailwind CSS Recharts Zustand TanStack Query SSE 事件流 一键导出下载
HTTPS · JWT Bearer
接入层 · FastAPI
7 域 REST + RBAC

鉴权

JWT (python-jose) bcrypt 7 角色 RBAC

权限三层强制

① REST require_role ② 导出域白名单 ③ 工具 allowed_roles
Uvicorn · SSE StreamingResponse
Agent 编排层 · Supervisor
Plan-Execute 主循环

编排引擎

max 20 turns LLM 自主选工具 伪链接清洗 SSE 5 种事件推送

上下文管理

sessions 表 messages 表 context_summaries Token 感知截断 自动摘要压缩
LLM 返回工具调用 → 权限校验 → 执行 SQL/检索
SQL 工具
43 个 · 7 域
sales 12 procurement 6 warehouse 8 production 5 qc 3 finance 7 export 3

100% 参数化scope 注入只读账号

LLM Client
Provider 无关
OpenAI 兼容协议 DeepSeek Chat 工具调用 + 流式 Provider 无关切换
RAG 检索
知识库
BGE-M3 嵌入 Chroma 向量库 1024 维 制度/SOP 文档
参数化 SQL · 只读数据库连接
数据调度层 · Dispatch
双模式数据源

本地模式

MySQL 8 Faker 1,200+ 条 22 张业务表

ERP 模式

MariaDB 10.6 表名/字段映射 30+ SQL 函数

切换

配置切换 数据源路由 表名映射表

可量化成果

43
参数化 SQL 工具 · 覆盖 7 大业务域
7.7s
端到端典型场景返回
21/21
REST 端点 RBAC 全量通过
Project 02
企业级落地项目 · 2026 · 实测数据驱动

制造业合同评审模型微调工程

Qwen3 LoRA 微调 · 要素抽取 + 风险识别双任务

LoRA · 双任务 · 2000 条自建数据

针对销售合同 / 采购合同 / 加工承揽 / OEM 委托四类制造业典型合同,训练两个专用模型: 一个从合同正文中抽取出甲乙方、金额、期限、关键义务等结构化要素, 另一个识别 R01–R12 共 12 类风险条款并给出等级、原文证据与判定依据。 一份 20 页合同的人均评审时间从 30–60 分钟压缩到 1–2 分钟(单条款秒级)。 跑通"数据合成 → LoRA 微调 → 选型评估 → 上线部署"完整链路。

LLaMA-Factory Qwen3-4B / 8B / 14B LoRA (r=16, α=32) vLLM DeepSeek-Reasoner CUAD (CC BY 4.0) pydantic v2 Ollama

双任务定义与模型架构

两个任务独立训练、独立推理,形成分层架构(4B 抽取 + 14B 风险识别),按复杂度分配合适算力。

模型 A · 要素抽取

基座 Qwen3-4B,non-thinking 直出 JSON。输出 schema:parties(甲方/乙方)· amount(金额+币种)· term(起止+期限)· key_obligations(关键义务) · effective_condition(生效条件)· termination_condition(解除条件)。 抽不到填 null,不编造。推理仅需 ~8GB 显存。

模型 B · 风险识别

基座 Qwen3-14B,输出 schema:has_risk(bool)· risk_type(R01–R12) · risk_level(高/中/低)· span(原文证据)· basis(判定依据)。 按 recall 优先优化,漏检代价远高于误报。推理需 ~28GB 显存。

R01–R12 风险分类体系

基于中国合同法/民法典语境自建分类:R01 单方解除权 · R02 违约金过高 · R03 管辖不利 · R04 付款条件不利 · R05 知识产权归属 · R06 保密义务失衡 · R07 责任限制/免责 · R08 自动续约 · R09 不可抗力 · R10 隐性兜底/连带 · R11 变更/转让限制 · R12 争议解决缺陷。

分层架构依据

同一 LoRA 配置(r=16/α=32/3 epoch)只换基座:4B 微调后抽取 macro_acc 0.821, 与 8B(0.834)仅差 1.3pt,性价比最高;14B 风险 recall 0.949 比 8B(0.901)高 ~5pt, 风险漏检不可接受,必须上大尺寸。

数据生产管线

训练数据没有现成的中文合同评审数据集,全部通过Teacher-Student 合成 + 公开数据复用自建。 中英双语言、12 类风险全覆盖,所有样本 pydantic 强校验。

DeepSeek 合成中文数据

DeepSeek-Reasoner 作为 teacher,prompt 强制 reasoning 150–300 字 + 严格遵循定义好的 JSON schema。生成中文抽取 500 条 + 中文风险 700 条 = 1200 条中文样本。 刻意构造约 20% 对抗/边界样本(同义换说法、临界违约金比例、隐性兜底)。

CUAD 公开数据复用

英文侧引入 CUAD 公开数据集(CC BY 4.0,源自美国 SEC EDGAR), DeepSeek 基于其原始标注生成结构化 CoT 与要素标签,得到 800 条英文样本。 CUAD 41 个原始类别按映射表对齐到 R01–R12,中英风险类目统一,指标可合并对比。

质量防线

全部 2000 条样本经 pydantic v2 强校验,schema 不合规直接丢弃重试。 按合同 ID 切分 train / test(不按条款),独立测试集约 300 条训练全程不可见。 风险数据含 has_risk: false 负样本,防止模型只学"报风险"。

训练配置

LLaMA-Factory,LoRA r=16 · α=32 · dropout=0.05 · target=all,3 epoch, bf16 + gradient checkpointing。抽取(630 条)~12 min,风险(905 条)~30 min。 TensorBoard 跟踪 loss 收敛。

关键架构决策

以下决策由实测数据驱动,非预设。

决策一:风险识别不上 thinking

PRD 原设计保留 thinking 上线(模仿 DeepSeek-R1 思路)。实测对照:thinking 模式 recall 0.9207 / F1 0.8779; no-CoT 模式 recall 0.9494 / F1 0.9286,且延迟仅 1/2.65、token 仅 1/2.41。 12 类中 5 类 no-CoT 显著领先,0 类 thinking 显著领先。结论:上线 no-CoT 版本

决策二:横向选型 → Qwen3

统一 system prompt + schema + 独立测试集,对 5 个候选(DeepSeek-chat / GLM-4.5-Air / Qwen3-4B/8B/14B)做同条件 zero-shot。DeepSeek zero-shot recall 0.711 看似领先, 但 Qwen3-14B 微调后 0.949(差 24pt)。本地推理延迟 0.05–0.2s vs API 1–10s。 微调后自有模型在精度、延迟、成本、合规四个维度全面优于 API 方案。

决策三:选微调,不选纯 RAG

优先尝试了 RAG 路径(嵌入 + 检索 + 大模型拼接),发现三个核心问题:(1) 风险识别是判别任务, RAG 只能塞文本片段进上下文,判断一致性差;(2) JSON schema 解析率随 prompt 长度衰减; (3) "单方解除"说成"甲方有权随时终止",向量相似度经常漏召回。 微调把判断标准直接灌进权重,解析率 100%,recall 比 RAG+prompt 方案高 ~15pt。 最终采用"微调做判别 + RAG 补充法条与模板"的复合架构。

决策四:训练数据全本地闭环

2000 条训练数据由 DeepSeek-Reasoner 合成 + CUAD 公开数据复用构成。 微调完成后推理全本地(vLLM / Ollama),合同文本不离开内网,满足企业对敏感商业数据的合规要求。

可量化成果

+28pt
14B 风险 recall:0.658 → 0.949
+19pt
4B 抽取 macro_acc:0.623 → 0.821
100%
微调后 JSON 解析率 · pydantic 一次通过

个人特质

把"模型能跑"推进到"线上能扛"的工程化思维。

01

工程化思维

贴近真实业务,擅长把"模型能跑"推进到"线上能扛"——鉴权、限流、可观测、灰度发布全链路落地。

02

学习速度

2 年完成从业务岗到 AI 工程的跨界,独立交付生产级全栈项目,把新技术快速转化为可上线的工程。

03

沟通与协作

2 年 B 端客户沟通经验,熟悉跨部门信息流梳理,能把技术方案讲给非技术同事听。