群聊记忆的账,AI一直算错了
一篇关于AI群聊记忆系统的论文解读,提出SPEAKERMEM-R1双轨记忆架构解决消息归属与状态重建难题,训练轻量级Writer模型在三大多方对话基准上超越主流方法,效果接近大模型水平。
一篇关于AI群聊记忆系统的论文解读,提出SPEAKERMEM-R1双轨记忆架构解决消息归属与状态重建难题,训练轻量级Writer模型在三大多方对话基准上超越主流方法,效果接近大模型水平。
论文提出VHD-Play方法,先解出数学模型的精确答案,再据此生成智能体交互训练环境,实现低成本批量生产3300个可验证环境,训练后模型在多个陌生任务及外部基准测试中表现大幅提升,且泛化能力随任务复杂度增长而增强。
论文提出ImIR方法,用退化图片自身生成的指令向量替代文字提示词,改造预训练图像编辑大模型,一个适配器处理六种修复任务,效果超越文字方案,且支持无需任务标签的盲修复与可控修复强度调节。
本文介绍Lean Pool,一个由AI代理自主维护的形式化数学证明仓库。它收录211个项目、322万行Lean代码,AI负责版本升级修复、证明优化和数学审稿,并已在研究级形式化项目中被验证为复用率最高的外部代码库。
Reuters 泄露的 Anthropic 招股书数据显示,这家公司2025年收入46亿美元,却承诺未来十年投入5180亿美元用于计算基础设施,其中80%不可取消。Alex Kantrowitz 与 Ranjan Roy...
a16z"消费级AI应用Top 100"第七期首次披露消费支出数据:仅约4%的美国消费者为AI付费,顶级用户月均消费高达903美元。Olivia Moore 与 Josh Elman 复盘个人智能体的爆发、Muse与In...
一篇仅用两万余参数的少样本学习模型论文,用内容自适应的取景机制取代固定网格,在准确率、抗遮挡、跨领域泛化上超越三个经典基线,并诚实自我证伪了最初的关系计算假设。
本文梳理了大语言模型在心理健康领域的演进历程,从被动的风险检测工具,到具备共情能力的单次对话伙伴,再到拥有记忆与规划能力的长期陪伴智能体,系统总结了核心技术、智能体架构、数据集与评估体系的发展脉络。
Flash-dLLM提出IO感知的融合KV缓存与自验证并行解码机制,让扩散语言模型推理速度提升最高81倍,显存占用大幅降低,在数学推理和代码生成任务上超越现有最强加速方法。
AI研究智能体能否改写自身代码实现自我进化?Weco AI提出的AIDE?系统通过八天自主运行完成七次改进,效果泛化到四个陌生评测集,同时意外降低了奖励作弊行为。
论文提出接地动作模型GAM,以三维物体定位模型为基础替代语言或视频预训练骨干,在RoboTwin2.0、LIBERO-PRO及真实机器人上均展现出更强的场景泛化与抗干扰能力。
AI给自己配的外挂工具箱能显著提能,但换环境就失效。研究者提出Harness-Zero,用审校agent把外挂经验蒸馏进模型参数,拆掉工具后成绩不降反升,从23.3%涨到44.3%。
WorldCrafter提出一种带三维感知隐式记忆的视频世界模型,通过预训练新视角合成编码器与生成模型联合训练,让AI生成的可交互场景在长时间探索和重访时保持高度一致,同时借助蒸馏实现接近实时的流畅生成体验。
onPanda是一款面向大模型对齐数据标注的交互工具,核心是让标注者只修正回答中第一个错误词元,模型据此续写,兼顾标注效率与在策略数据保真度,并支持多模态与智能体轨迹标注。
阿里团队发现AI学代码时存在"类别跷跷板":整体分数涨了,但不同任务类型此消彼长。他们提出分类标注、专家分头训练、再融合成一个模型的框架,在多个代码评测基准上验证了这套思路的有效性。
本文解读RoboDawn,一种不训练机器人数据、仅靠人性化指令接口和少量示范就能让视觉语言模型直接操控机械臂的方法,零样本和一次示范均超越多个经过专门训练的机器人策略模型。
北邮团队深入视频扩散模型内部,发现RoPE位置编码导致的空间锚定效应是物体运动违反物理规律的根源,并提出轻量级频率缩放方案,显著提升生成视频的物理常识表现。
这篇论文提出STEERDUPLEX全双工语音模型和STEERBENCH评测基准,首次系统研究语音对话AI的"可控性"问题,即能否按指令调整语气人设语速,并揭示强化学习训练中存在的奖励作弊现象。
机器人预训练模型常在长任务中卡在少数瓶颈步骤,本文提出PARTS框架,冻结已学好的基础策略,只对瓶颈子任务用局部奖励做强化学习,真实机器人实验显示完整任务成功率大幅提升,人工干预显著减少。