从任务出发
场景假设:练习一元一次方程的学生与辅助检查作业的家长。没有学生试用或教师独立评价,不把提示生成等同教学效果提升。
核对方程白名单解析精确解集比较分层提示 / AI解释练习记录 / 复习
| 优先级 | 需求 | 依据 |
|---|---|---|
| Must | 题型与语法范围 | 不把不等式或二次方程误作为支持范围 |
| Must | 精确分数运算 | 避免浮点误差和模型心算影响反馈 |
| Must | 三层提示与练习记录 | 让用户控制何时查看答案并能回顾 |
| Should | 模型解释当前提示 | 只解释已有数学结论,限制一级泄露答案 |
| Could | 图片自动识别与教师消息 | 保留历史Dify图片原型;本机版暂以人工核对输入为入口 |
比较过的方案与取舍
| 选项 | 主要问题 | 本版选择 |
|---|---|---|
| 任意Python表达式求值 | 有执行风险,范围不明确 | 使用AST白名单解析仿射表达式,不调用eval |
| 完全依赖模型判题 | 答案漂移难以验收 | Fraction精确运算判断解集,模型负责措辞 |
| 用解集一致当完整步骤正确 | 无法识别所有书写和推导问题 | 界面明确显示解集一致,不宣称教师评分 |
用户完成任务的过程
- 输入并核对原方程
- 提交当前步骤
- 选择思路、关键步骤或答案核对层级
- 阅读精确检查与辅助解释
- 保存练习记录,回看需要修改的步骤
可操作界面与验收条件

实际界面截图。公开站点用于展示案例,程序在本机运行。
| 功能 | 交互与规则 | 验收 |
|---|---|---|
| E01 题目 | 仅x、一元一次结构、常数四则运算与括号;禁止高次、含x除数和函数调用 | 无解、恒等式、负数和分数有明确输出 |
| E02 提示 | 一级给思路,二级给整理结果,三级给答案;当前步骤改变解集时提示复核 | 30个固定种子生成方程、典型去括号错例和越范围用例 |
| E03 记录 | 每次检查保存题目、步骤、层级、反馈与时间 | 最近记录可查看;不建立真实学生画像或排名 |
完成证据与一次关键迭代
本项目功能检查:39/39
历史图片原型存在符号歧义和范围误识别。本版本将数学真值交给可审计的精确解析器,并明确本机入口要求先核对题目文字;没有把OCR能力未经评测地写入新版本成果。
| 类别 | 指标 | 验证状态 |
|---|---|---|
| 业务目标 | 提示后独立完成率、正确迁移率 | 需教师制定评价并经真实学习任务验证 |
| 功能指标 | 受支持表达式求解与范围拒绝 | 30条固定种子题目精确解检查,加异常与边界用例 |
| 模型指标 | 低层级答案泄露与解释一致性 | 已检查一级提示样例,不代表模型永不泄露 |
| 学习过程 | 提示层级分布、需修改次数 | 本地记录可用于后续分析,目前为演示操作 |
范围限制与面试追问
仅覆盖仿射一元方程,不支持完整证明、几何、OCR自动识别和教育效果推断。解集相同不代表每一步推导合理;AI解释仍需复核。
不用大模型能做吗?
核心解集核验和提示骨架可以不用。模型只为表达适配提供辅助;没有增量价值的地方不用模型。
为什么同解不等于步骤正确?
不同变形可能偶然得到同解,且缺少推导说明。系统只声明解集一致,不替代教师对过程的判断。
如何防止直接给答案?
界面分层控制信息,一级不发送最终解给模型。但模型仍可能自己计算,因此需要专项泄露评测与展示限制。
为何不声称提升成绩?
没有真实学生对照实验。工程测试能验证判题范围和数据记录,不能直接证明学习效果。
来源与证据
公开产品资料用于理解能力范围,没有假称开展竞品付费实测。
- Khanmigo · https://www.khanmigo.ai/ · 官方强调引导学生思考而非直接给答案;本项目参考分层提示原则,不引用其效果作为自身结论。
- Photomath · https://photomath.com/ · 数学问题解释与步骤展示的直接参照;本机版聚焦用户当前步骤与可验证数学范围。