为什么某些 DeepSeek 文本模型不能直接读取图片,而视觉模型可以?
文本模型仅处理离散的文本token,而视觉模型额外包含视觉编码器,能将图像转换为模型可理解的连续向量表示,并与文本特征对齐。这是架构设计上的根本差异,而非简单的功能开关。
每个问题先给 30 秒回答,再给大学二年级程度的专业解释和一遍更通俗的说明;必要时配图,把“听说”变成能解释、能判断的知识。
文本模型仅处理离散的文本token,而视觉模型额外包含视觉编码器,能将图像转换为模型可理解的连续向量表示,并与文本特征对齐。这是架构设计上的根本差异,而非简单的功能开关。
上下文窗口是模型一次能“看到”的最大文本量,但模型内部注意力机制存在衰减和稀释效应,长文本中靠前的信息容易被后续内容淹没,加上训练数据分布和位置编码限制,导致模型虽在窗口内却仍可能忽略或遗忘前文细节。
RAG 检索到正确文档后仍可能答错,因为大模型在生成阶段可能误解文档内容、忽略关键细节、被自身知识干扰,或受到上下文长度限制而截断信息。此外,检索到的文档可能包含矛盾信息,模型难以分辨,导致最终回答偏离事实。
Agent 不只是让模型循环多次,而是通过结构化编排、工具调用、记忆管理和安全护栏,将模型从被动文本生成器转变为能自主规划、执行并验证任务的工作流系统。
更大的模型虽然参数更多、训练数据更广,但可靠性并非线性提升。模型规模增大可能引入更多不可预测的涌现行为、更高的幻觉风险、更复杂的部署依赖,以及更难调试的故障模式。系统可靠性取决于整体架构设计、评估体系、风险管理和人机协同,而非单一模型大小。
Embedding 将文本映射为高维空间中的点,通过距离衡量语义相似度,但它本身不包含生成或检索逻辑,无法直接输出自然语言答案。
系统提示词只是输入的一部分,模型无法可靠区分指令与数据。攻击者可将恶意指令嵌入用户内容,利用模型遵循一切文本的倾向,绕过系统提示词。架构上缺乏强隔离,因此单靠提示词无法防御。
工具调用需要 Schema 是为了让大模型精确描述要调用的函数及其参数,避免歧义和幻觉。Schema 定义了函数名、参数类型、必填字段和描述,使模型输出结构化的调用请求,从而被外部系统可靠执行。没有 Schema,模型可能生成无效或危险的调用,导致集成失败或安全风险。
多智能体系统将任务拆分给多个智能体,但引入通信开销、协调延迟、重复计算和级联错误,导致速度更慢、成本更高。调试困难源于交互复杂、状态空间爆炸和缺乏统一的可观测性工具。
模型“记忆”通常不修改参数,因为大语言模型的知识固化在预训练参数中,对话记忆通过上下文窗口实现,每次推理时临时拼接历史消息,不改变模型权重。这避免了灾难性遗忘,保证了服务稳定性和多租户隔离,但受限于上下文长度。
同一个 Skill 在不同 Coding Agent 中表现不同,根本原因在于各 Agent 对 Skill 的定义、加载时机、执行环境、工具集成和模型能力存在根本差异。Skill 并非可移植的独立程序,而是深度绑定于宿主 Agent 的架构与产品决策。
一次成功的 Demo 仅证明系统在特定、受控条件下能完成预设路径,无法反映真实环境的随机性、长尾场景、安全边界和持续漂移。生产上线需要可量化的评估体系、风险管理和工程韧性,而非孤立的展示。
这些问题不是背题清单,而是用来暴露你如何面对模糊问题、真实使用 Agent、完整交付,以及把知识地图连接到结果。
面试官在听什么能否讲清目标、拆解、路径、资源、风险、验收标准和交付形态。
面试官在听什么是否先建立最小闭环,而不是先堆工具、写方案或等待完整需求。
面试官在听什么是否真的理解模型的能力边界、上下文损耗和需要人工把关的决策。
面试官在听什么真实使用经验通常藏在失败复盘里,而不是工具名称里。
面试官在听什么是否会设计边界、工具权限、上下文、检查点、测试和回滚,而不只是写一段 Prompt。
面试官在听什么能否说明输入契约、工具选择、状态、失败恢复、输出格式和适用边界。
面试官在听什么重点不是项目名或职位,而是从问题、实现、发布到真实反馈的完整链路。
面试官在听什么是否能拿出可运行产物、用户反馈、测试记录、失败记录或清晰的取舍,而不是只列技术栈。
面试官在听什么能否在速度、质量、成本、体验和风险之间做出有证据的选择。
面试官在听什么是否能抓住关键概念、层次和接口,并知道哪些细节必须继续深挖。
面试官在听什么是否先考虑可观测性、协调成本和失败面,而不是把多 Agent 当成更高级的答案。
面试官在听什么能否把 Agent 能力连接到用户、产品、运行约束和最终结果,而不是停留在流程节点。