LightMIS:一个只用0.1M参数就能做医学图像分割的极简模型
LightMIS是一种超轻量医学图像分割模型,抛弃传统U-Net解码器,用尺度对齐投影和自适应融合级联直接聚合编码器特征,仅0.131M参数即达到接近最优的分割精度,并在手机GPU上实现完整算子覆盖。
LightMIS是一种超轻量医学图像分割模型,抛弃传统U-Net解码器,用尺度对齐投影和自适应融合级联直接聚合编码器特征,仅0.131M参数即达到接近最优的分割精度,并在手机GPU上实现完整算子覆盖。
RayOrch是面向大模型数据准备的分布式执行系统,通过维护父子结构血缘和FIFO队列调度,解决文档视频处理中细粒度并行与完工判断的矛盾,实测扩展至64GPU加速超15倍。
Google AI基础设施首席技术专家Amin Vahdat在红杉资本的访谈中提出,衡量AI算力的关键不是FLOPS这类理论峰值,而是goodput——真实故障环境下交付的有效工作量。十万加速器规模下,故障几乎每小时都在...
Mandiant创始人Kevin Mandia谈他为何重新创业做Armadin:AI让攻击者能以机器速度同时试探上千条入侵路径,国家级攻击正从精准狙击变成无人机蜂群式打法。Armadin今年已在客户生产环境中找到超90个...
论文提出ZooWork-ShopRanker系列电商排序模型,用多家族大语言模型充当裁判标注偏好数据,通过蒸馏训练出高效小模型,并发布ShopRank-Bench基准,揭示开源排序模型在处理预算、约束等硬性条件时普遍失效...
长文本注意力计算量随长度平方增长,选块环节成为瓶颈。字节跳动与上海交大提出PISA,用金字塔式分层选择和LogSumExp打分,把选块复杂度降到O(N log N),长序列检索更准更快。
一个只做选择题的轻量决策模型Jev发布一周内涌入2170个GitHub项目、43750个星标。论文分析其应用领域分布、决策用途与关注度失衡现象,揭示通用决策组件如何嵌入真实系统。
CARD提出分层个性化框架,先按风格聚类训练群体级LoRA适配器,再用轻量用户偏好向量在解码阶段做精细修正,兼顾生成质量、低资源适应性与部署效率,在LaMP和LongLaMP基准上全面超越现有方法。
OpenAI在Dev Day上发布Decisions API,可让模型在预设选项中快速选择,功能类似TypeSafe AI的Jev模型。该API旨在提速降本,并有望以低成本监控AI智能体行为。
非营利组织LASST以违反加州计算机欺诈法为由,在旧金山法院起诉OpenAI,要求法院禁止其AI代理未经许可访问第三方系统,并停止不安全的AI开发行为。OpenAI称诉讼"完全没有依据"。
GeoPair提出一种训练无关的Transformer压缩框架,通过全局最优层配对和广义Sylvester方程求解共享字典,结合硬阈值稀疏化,在文本、视频、音频多模态模型上均取得优于现有方法的压缩效果。
论文指出大模型评估长期忽视校准这一关键指标,即置信度与实际正确率是否匹配。作者呼吁将校准作为每个NLP子领域的标配评估维度,并分析了现有指标的适用边界与开放式生成场景下的挑战。
本文解读FLEET算法,一种给大语言模型多次生成过程加入记忆的方法,通过熵和方差熵识别关键决策点,用VectorDSU记录历史轨迹,在同等计算预算下显著提升代码生成和数学推理任务的准确率,同时实现3倍加速。
本文解读了一项针对Whisper语音识别模型编码器的层剪枝研究,通过错误率排序砍掉六层冗余层,再用无标签数据蒸馏恢复性能,实现推理加速且无需改动推理代码。
该论文发现联合视频生成模型中双向注意力存在严重不对称,一方学得好一方几乎不用。研究者提出RecCAR方法,用KL正则化让弱势方向向强势方向对齐,在视频动作生成和视频音频生成任务中均显著提升跨模态一致性。
Salesforce提出JITMEM即时记忆框架,主张AI智能体记忆应在任务出现时才现场提炼,而非提前写死总结,在多个测试环境中大幅提升任务成功率并降低计算成本。
一篇AI基准论文提出WhatWorkedBench,评估AI agent在预算实验后能否准确理解组件效应和交互关系,发现选对最优配置不等于真正理解实验,高斯过程重新推理可显著提升效应恢复准确度。
腾讯混元团队发布Hunyuan-A13B,采用混合专家架构,800亿总参数仅激活130亿,通过20万亿token预训练和四阶段后训练,实现数学、编程、智能体任务媲美更大模型,并支持快慢思考双模式切换。
一篇关于AI群聊记忆系统的论文解读,提出SPEAKERMEM-R1双轨记忆架构解决消息归属与状态重建难题,训练轻量级Writer模型在三大多方对话基准上超越主流方法,效果接近大模型水平。
论文提出VHD-Play方法,先解出数学模型的精确答案,再据此生成智能体交互训练环境,实现低成本批量生产3300个可验证环境,训练后模型在多个陌生任务及外部基准测试中表现大幅提升,且泛化能力随任务复杂度增长而增强。