AI Agent Infra System
由 AetherStation 一体化部署到边端
01/ HARDWARE & INFRA
AetherStation

SOFTWARE
Tamer动态任务理解、运行时编排、执行状态机
EDGE AI AGENT INFRA
HARDWARE
ChipsNVIDIA / 昇腾 / 摩尔 / Intel 等异构算力
版本介绍 VERSION
A / 国产版(信创)
AetherStation 国产版
国产信创 Agent Appliance
国产芯片全栈 · 数据不出域 政务 / 金融 / 医疗
- 核心配置
- 摩尔 GPU + 后摩 NPU ×2 370 TOPs INT8 国产异构算力
- 典型场景
- 政务公文 · 金融合规审核 医疗病历分析 · 制造知识库
B / 标准版(NV)
AetherStation Standard
High-performance Agent Workstation
国产芯片全栈 · 数据不出域 政务 / 金融 / 医疗
- 核心配置
- NV GPU + 以太推理引擎 Qwen3.6-27B:单发120tok/s,16并发630tok/s 35B MoE · 20并发(50人以下)
- 典型场景
- 代码 Agent · 数据分析 企业工作流 · 企业助手
02 / ENTERPRISE WORKFLOWS
ATTUNE:让本地小模型胜任复杂企业工作流任务
不改变基座模型权重,Attune 在 15 项工作流任务上达到 Teacher 水平,其中 13 项获得 held-out 满分。
15项行业任务,13项满分
工作流任务通过率(%)
- 合规告警
- 笔录抽取
- 智能家居
- 车机控制
- 政务路由
- 客服路由
- 运维工单
- 合同抽取
- 病历抽取
- 工业边缘
- 质检分类
- 信贷抽取
- 理赔抽取
- 报销抽取
- 机器人指令
03 / INFERENCE PERFORMANCE
AetherInfer Engine:释放生产级推理性能
AetherInfer 面向高吞吐、低延迟与多并发 Agent 工作负载,通过硬件与自研推理栈协同优化,提高单位硬件投入的实际交付效率。
- 12.58×︎
- 单批输出速度 124 tok/s vs 9.86 tok/s124 vs 9.86 tok/s
- 4.92×︎
- 16 并发总吞吐 630 tok/s vs 128 tok/s630 vs 128 tok/s
- 210 16 tok/s per ¥︎10K16 tok/s / ¥︎10K
AetherStation Standard
210
AetherStation Lite
110
DGX Spark · MTP
72.6
DGX Spark · no MTP
40.1
优势硬件与自研推理栈协同优化,而不是单纯堆叠 GPU
04 / THEORETICAL EFFECT
完成常见企业任务时,单任务成本并非线性降低
100名活跃员工 · 年度约200万次工作流 · 工作流均达到Attune验证的同等任务效果
1.0XAetherStation 基准
| 部署方案 | 完成单任务成本 | 运维复杂度与成本 | 初次投入成本 |
|---|---|---|---|
| 8×A100 · Qwen 27B | 30–40× | 中 | 90万-120万 |
| 8×H100 · Qwen 27B | 11.9× | 高 | 220万-300万 |
| GLM-5.2 · 官方API | 11.7× | 低 | API调用付费 |
| 12×B300 · NVIDIA官方优化 · GLM-5.2 | 10.3× | 高 | 千万级 |
| 6×AetherStation · Qwen 27B | 1.0× | 低 | 18万 |
测算说明:以上为特定任务量、模型、并发、硬件与服务价格假设下的理论比较,用于展示成本结构,实际结果会随部署条件变化。
