Model Reasoning
模型如何在不确定任务中保持可解释的推理链、规划能力和工具使用边界。
Research Focus
我的研究关注模型如何稳定推理、理解多模态信号、接受可复查评估,并最终落到可复现的实验与工程系统中。
Questions
模型如何在不确定任务中保持可解释的推理链、规划能力和工具使用边界。
视觉、语言和音频信号如何在统一任务中协同,并暴露出模型失败模式。
从 benchmark、自动评估到失败案例归因,构建可复查的实验判断链路。
用工程系统承载模型实验、数据管线、评估报告和可复现部署。
Method View
记录规划、工具调用、观察反馈和失败恢复,让模型行为可以被复查而不是只看最终分数。
通过视觉扰动、文本替换和语义保持约束,观察多模态模型在细粒度理解上的稳定性。
将配置、指标、错误案例和结论写入同一个可查询入口,降低复现实验和协作成本。