解析Pencils Protocol:Scroll当下最具性价比的机会

解析Pencils Protocol:Scroll当下最具性价比的机会

Layer 2 生态内部的价值流转往往会随着空投预期的动向而变化。随着 Starknet、Manta 等 Layer 2 项目此前接连发币,社区内的交互热情已逐渐转移至其他尚未发币的 Layer 2 网络之上。

诸多潜在的选项之中,Scroll 凭借着数千万美元的巨额融资背书,以及以太坊联合创始人 Vitalik 的多次“钦点”,成为了当下承接流量及资金转移的主要 Layer 2 阵地之一。Defillama 数据显示,Scroll 全网总锁仓价值(TVL)在过去几个月内保持了相当不错的净流入态势,现已增长至约 8700 万美元。

解析Pencils Protocol:Scroll当下最具性价比的机会

当下,大多数刚刚进入 Scroll 生态的用户都会面临一道难题:如何寻找最具性价比的交互标的,用相对较少的投入去博取更大的潜在空投回报。

环顾 Scroll 生态现状,TVL 排名靠前的大多数项目要不是已然发币,要不就是已多链部署许久(多链部署往往既意味着发币周期相对较长,也意味着单链交互权重会相对较低),尚未发币且原生于 Scroll 的项目则相对较少。在此背景下,刚刚完成了品牌重塑的 Pencils Protocol 似乎就成为了当下交互 Scroll 生态时最具“性价比”的选择。 

“Scroll 是纸,Pencils 是笔”

Pencils Protocol 的前身为 PenPad,该项目在尚未更名之前已在 Scroll 网络上启动了两轮的早期代币生成活动(当前 Season 2 正在进行中),并吸引了 Scroll 用户的广泛关注。之所以强调 Pencils Protocol 在 Scroll 生态的独特地位,原因在于 Pencils Protocol 与 Scroll 之间的“暧昧”关系。

从投资角度来看,Pencils Protocol 正在进行的最新一轮融资已敲定了业界多家知名投资机构,包括 OKX Ventures、Animoca Brands、Presto Labs、Gate.io 等等,Scroll 联合创始人 Sandy 也参与了该轮融资。

早在今年 3 月的联合活动中,Pencils Protocol 就曾提及“完成任务可获得 Scroll 积分与 Pencils Protocol 代币的双重奖励”,这也是非官方渠道首次流出有关“Scroll 积分”的说法,而后在今年 4 月,Scroll 正式官宣了忠诚度计划 Session Zero,确认了将推出积分系统。

从定位上看,Pencils Protocol 是一个原生于 Scroll、以社区为核心的综合型 DeFi 协议,而随着品牌重塑的完成,该项目现已确定了三条主要产品线 —— Launchpad、Staking 以及 Vaults Restaking。

Launchpad 即资产发行服务,这本就是 Pencils Protocol 曾作为 PenPad 时的核心产品。展望未来,Pencils Protocol 希望为 Scroll 之上的优质项目提供一个公平、开放、高效的资产发行平台,通过一系列创新性认购和拍卖产品模块,使整个 Launchpad 认购流程更加公平、易操作、可组合且本地化,为用户和项目方提供一站式、灵活组合的创新型认购服务,作为 Scroll 生态未来首要的打新品台,帮助该生态的优质项目更好地完成代币分发。 

Staking 和 Vaults Restaking 均属收益优化服务。区别于传统的 PoS Staking,Pencils Protocol 语境下的 Staking 其实提供的是针对单币的收益优化服务,用户可通过存入 ETH(及其衍生的 LST、LRT)、稳定币、WBTC(及其他 BTC 凭证代币)、Scroll 生态优质代币等来简单、高效的获取收益,同时可利用 Pencils Protocol 所发行的流动性凭证代币 pToken 释放已存入资产的流动性,进一步参与到其他 DeFi 活动之中。

Vaults Restaking 则聚焦于杠杆收益领域,为用户提供了通过借入资金以增加仓位杠杆倍数,从而实现多倍收益的进阶功能;此外,Pencils Protocol 的 Vaults 版块还将与多家 Liquid Restaking 协议进行合作,为参与 Vaults 的用户提供更多收益机会,比如 ETH 的原生质押收益、LRT 协议的积分收益、EigenLayer 积分收益 等等。

解析Pencils Protocol:Scroll当下最具性价比的机会

除了上述三大核心产品之外,Pencils Protocol 的运作还将高度依赖于其忠诚度积分系统 Pencil Points。待 Pencils Protocol 未来正式上线协议主要功能之后,用户可以通过在 Staking 产品内存款来积累 Pencil Points,Pencil Points 不但有机会为用户带来持续的未来空投收益(包括但不限于 Pencils Protocol 协议代币),还可在 Launchpad 产品中被消耗以获得更多额度、更低价格,或是在 Vaults 产品中被消耗以增加杠杆,以更快的速度赚取收益。 

解析Pencils Protocol:Scroll当下最具性价比的机会

总而言之,Pencils Protocol 的愿景便是作为 Scroll 之上的 DeFi 基石,一方面帮助该生态的早期项目完成代币分发进程,另一方面则可帮助该生态的用户捕获生态价值。以社区内常提到的一句话“Scroll 是纸,Pencils 是笔”,如果把可直译为“卷轴”的底层网络 Scroll 视为一张白纸,Pencils Protocol 则会是在这张纸上描绘出各种图谱的笔。

如何实现一鱼多吃?

对于普通来说,相较于逐帧理解 Pencils Protocol 的业务逻辑,“如何有效交互,博取潜在收益”或许才是更值得关心的问题。 

今年 2 月,Pencils Protocol(当时还叫作 PenPad)曾宣布将于 Scroll 联合启动为期三季的代币生成活动,并将早期支持者分发占总供应量 18% 的代币奖励。此前,Season 1 已于 2 月 27 日开始并于 3 月 22 日结束,Season 2 则已于 3 月 25 日启动,目前仍在持续之中。

解析Pencils Protocol:Scroll当下最具性价比的机会

在 Season 2 活动中,用户可在通过个人或组队的形式存入 ETH,并累积相应的积分奖励。存款会设置最低 0.05 ETH 的限额,用户首次存入 0.05 ETH 时会立即获得 100 积分,之后每存入 0.05 ETH 即可获得 20 积分;存款数额大于 0.5 ETH 的用户可以启动属于自己的“战队”,并从其所邀请的队员处获取 10% 的邀请积分;随着“战队”存款总额每增长 1 ETH,全体队员都将获得一次积分抽奖的机会,从而加速自身积分积累进度。 

值得一提的是,这里的积分与前文中曾提及的 Pencil Points 并非同一概念,该积分当前将主要作用于 Pencils Protocol 协议代币 PDD 的生成与分发 —— Pencils Protocol 已明确提及会在 Season 2 活动中向社区分发 6% 的代币,用户所累积的积分越多,可获取的代币也会越多,认购的价格也就越低。不过,Pencils Protocol 已在最新公告中提到会在后续的 Season 3 启动时将该存款合约转换为 Staking 和 Vaults 服务的一部分,这也会允许用户将其在 Season 1 和 Season 2 中的积分转换为 Pencil Points,从而继续深度参与 Pencils Protocol。

解析Pencils Protocol:Scroll当下最具性价比的机会

截至发文,Pencils Protocol 的 Season 2 代币生成活动总计已吸引了约 1111 枚 ETH 的存款,价值约 330 万美元,成为了锁仓规模最大的 Scroll 生态原生协议。不过整体来看,Pencils Protocol 代币生成活动的竞争压力仍相对较小,新进用户仍有较大的机会去赶超先行者。 

解析Pencils Protocol:Scroll当下最具性价比的机会

从潜在收益的角度来看,除去可利用积分直接获取 Pencils Protocol 协议代币之外,当下通过 Pencils Protocol 的 Season 2 代币生成活动进行存款,还可解锁额外的多项收益。 

  • 第一项潜在收益在于 Pencils Protocol 为所有用户提供的权益型 NFT 徽章奖励。Pencils Protocol 稍早前已宣布,将在 Season 2 结束之时根据用户积分提供代表 Scroll 的 S 徽章以及代表 Pencils Protocol 的 P 徽章。徽章持有者未来将可优先获得 Pencils Protocol 上新项目的白名单,在 Scroll 生态的其他项目中获得特定的费用折扣,以及被纳入第一批 Scroll Canvas 徽章(这个暂时也无官方描述,因此很值得遐想)领取者之列……

  • 第二项收益则在于 PDD 作为未来积累 Pencil Points 的最有效媒介,其本身就具备着撬动 Scroll 生态后续收益机会的“金铲子”属性。这也意味着提前参与 Season 2 的存款,可帮助用户在后续的 Scroll 生态淘金中先行一步。

  • 第三项收益也是许多用户最为关注的一点 —— 对 Scroll 的交互权重。针对 Layer 2 的空投竞争已愈发激烈,围绕着生态头部项目所进行的高质量参与往往会比略显盲目的无差别交互更具价值,作为 Scroll 生态内与底层母体绑定最紧的原生龙头,Pencils Protocol 之上的交互行为存在被 Scroll 格外重视的可能性,这或许会给用户带来意料之外的惊喜。

根据 Pencils Protocol 的最新披露,Season 2 活动预计将于 5 月 20 日正式结束,届时 Pencils Protocol 将正式激活前期存款的提现功能,并通过最终计算确认用户可获得的 PDD 奖励份额 —— 用户可自由选择利用已存款的 ETH 进行折价认购,或是放弃认购机会保留 ETH。 

之后,用户可选择将其 ETH 存款直接迁移至新合约内,继续参与 Pencil Protocol 的 Staking 和 Vaults 并赚取 Pencil Points 奖励;也可以选择直接提取 ETH,此举虽不会影响 PDD 份额,但却意味着用户将放弃所有的前期积分。

极致性价比

过去一年间,围绕着积分系统而构建的 Points-Fi 玩法已逐渐成为了新的趋势。 

Restaking、Layer 2、DePIN、DeFi……各大赛道的新兴项目们不约而同地都选择了在 TGE 之前利用积分系统来累积流动性,而用户手中的 ETH、稳定币及其他资产也顺势成为了各路项目方极力争取的筹码。对于持有普通用户而言,在面对不断涌现的“存款”或“质押”诱惑时难免会陷入选择性障碍。 

相较于市面上其他一些竞争极度激烈,或是收益兑现日期不够明确的积分类项目而言,Pencils Protocol 的优势一在于时间成本相对较短,收益兑现相对较快;二则在于 Pencils Protocol 的 Season 2 存款活动的竞争压力相对较小;三则在于通过参与 Season 2 不仅仅可以获取 PDD,也可通过多种形式撬动 Scroll 生态未来的多重收益。 

这也是为什么我们会大胆下判断,当下的 Pencils Protocol 或许就是 Scroll 生态最具性价比的交互选择。 

发表在 比特币交易平台 | 留下评论

Binance Labs参投,一文解读Stacks借贷市场Zest

原创 | Odaily星球日报

作者 | 南枳

Binance Labs参投,一文解读Stacks借贷市场Zest

5 月 13 日,Zest Protocol ,Tim Draper 领投,Binance Labs 参投。据悉,该协议利用比特币 Layer 2 Stacks 的 Nakamoto 升级和跨链资产 sBTC 来实现完全原生于比特币网络的借贷服务。近年来 Binance Labs 对比特币生态的投资屈指可数,Zest 是否有独到之处?Odaily星球日报将于本文解析 Zest 的业务。

Zest 解析

Zest 于 2021 年创立,在 2023 年二季度发布 Zest Protocol 原型,四季度完成审计。将跟随 Stacks 的 Nakamoto 升级借贷原生比特币借贷服务。

Zest 借贷方案

Stacks 上现有的借贷解决方案在很大程度上依赖于中心化实体,贷款方通常是一个受信任委员会或者托管人联盟,底层运行情况非常不透明,并且中心化组织将产生额外费用,使借贷活动变得不经济。

而 Stacks 即将进行 Nakamoto 升级,解决了上述的中心化问题,同时 Zest Protocol 将利用该升级创建原生比特币的借贷服务。首先,Nakamoto 升级是什么?

Nakamoto 是 Stacks 一次里程碑更新,更新后区块时间将缩短至约 5 秒(升级前与比特币一致,约为 10 分钟或更高),此外本次升级还将引入 sBTC,这是一种安全高效的封装比特币版本 ,与 Stacks 共识机制天然集成。此前存入 BTC 相当于面向中心化机构存款,交付网络上另行创造的同名代币。而升级后的 sBTC 实现了去中心化、无信任的双向锚定,等价于 BTC 能够在比特币主网和 Stacks 之间自由跨链。

升级后,Stacks 获得了高度的 BTC 流动性和网络性能,而 Zest 将利用这些流动性开展借贷业务。用户跨链原生比特币获得 sBTC,进入 Zest 的池子获取收益。

Zest 的 BTC 流动性池分为两种,借贷池和收益池。前者与常规的借贷模式没有区别,采用了池对池的借贷形式,用户在对应币种的池子进行借/贷操作,并支付或收取相应的利息。

Binance Labs参投,一文解读Stacks借贷市场Zest

而收益(Earn)池中,用户仅作为贷款人角色参与,Zest 为收益池引入了第三方角色即资金池代表(Pool delegates),启动和管理流动性池的信贷专家,资金池代表进行尽职调查,并与借款人商定条款。资金池代表需要审查借款人的声誉、专业知识和绩效,以评估贷款条款。一旦借款人和资金池代表就借款人利率和抵押品比率达成一致,资金池代表就从其管理的资金池中为贷款提供资金。

而收益池的借款人仅限机构,包括接受比特币支付的做市商、交易所、中心化贷款机构、矿工和企业等。借款人需要与资金池代表联系,加入许可白名单之后,创建特定的贷款金库存入资产,然后提交贷款请求。比较特殊的是,该收益池还支持借款人进行展期,即还款日临近时另行签订借贷合同对借款进行延期,仅需支付到期利息。

融资情况

5 月 13 日,Zest Protocol 完成 350 万美元种子轮融资,Tim Draper 领投,Binance Labs、Trust Machines、Flow Traders、Hyperithm、Bitcoin Frontier Fund、DeSpread、Tykhe Block Ventures、Asymmetric、Primal Capital、Gossamer Capital、Scimitar Capital 等参投。这也是目前唯一一轮融资。

而 Binance Labs ,近期在比特币生态方面的投资包括今年 4 月 11 日的 BounceBit、 2 月 27 日的 Babylon,再往前就是 2022 年年末投资的,其在比特币方面的投资具有一定稀缺性。

何一针对此次投资:“Zest Protocol 的技术满足了比特币持有者和借款人的需求,释放了比特币可编程性和互操作性的潜力。在 Binance Labs,我们一直在寻找那些引领行业的先行者,我们期待看到 Stacks 的 Nakamoto 升级推动 Zest Protocol 的成长。”

Zest Protocol 创始人 Tycho Onnasch 表示:“我们旨在重新定义比特币借贷。我们在这里完成长期未完成的任务,将比特币借贷市场迁移到链上,这才是它们应有的地方。”

结论

Zest 的业务模式较为传统没有重大革新,但绑定的 Stacks 生态未充分开发但具有高关注度,市场潜力较大,叠加 Binance Labs 投资属性,具备一定的关注价值。

发表在 比特币交易平台 | 标签为 , | 留下评论

VC币涨不上去不要怪meme

来源: BTCdayu

VC币涨不上去不要怪meme,牛市“提前结束”不要怪meme,这是市场必经的自然修正。

教人发盘子摧毁不了真正的价值,相反只会让真正的价值浮出水面。

大周期,小周期,币圈的4年一周期,其实人们炒的东西也有周期,而且因为人们的情绪影响,总是会倾向于一个极端,再到下一个极端。

meme本轮会很亮眼——但同样,也一定会大崩盘,大概率在某一个二三个月甚至更久都没行情的节点。

meme崩盘就是大盘崩盘,大盘崩盘带来VC币的再一次绝望式崩盘。

如果1.2万亿的山寨币总市值能够回到2000万市值,那会是一次伟大的自然修正,这会导致一轮无法想象的大牛市。

无法精确任何时间点。

但是,人们的情绪波动先是会让meme的位置去到舞台中央,让vc币、价值币一文不值;但最后崩盘后,在废墟中站起来的,可能是市值回归到合理价值以下的VC币。

我相信市场的选择,也相信周期的力量。

存在即合理,根本不用抨击,也不用焦虑——币圈的人群分层就是推动潮涨潮落的底层,改不了。

发表在 比特币交易平台 | 留下评论

不是吧,AI已经下沉到五线小县城了

不是吧,AI已经下沉到五线小县城了

AI下沉,又靠谱又好玩。

文|宁静路

编|任晓渔

大模型在B端进入应用落地元年的同时,在C端AI应用层,变化也在悄然发生。

人群正在下沉。AI工具影响的群体不仅是一线城市的上班族,也有五线小城的公务员,还有大理青旅的老板和房地产行业的从业者。他们或将其充当生产力工具,写文件做PPT,或将其充当打发时间的玩具,做成各种智能体。

同时,伴随着模型能力进步,人们应用AI产品的深度也在提升。以智谱清言为例,支持“一亿字”知识库的智能体能力解锁,用户已经可以快速根据自己的需求来定制专属的智能助理。

而随着AI工具如雨后春笋般涌现,一个问题也浮出水面,国产AI类应用在C端如何能真正破圈,让更多人来使用?

01

当AI走进五环外

五一节前,与在五线小县城工作的朋友闲聊,他说起了五环外小文员工作的苦闷。外界可能觉得,都五线小县城了,应该不至于996,每天是不是到点就下班,钱不多但好歹事少离家近。

但从他的反馈来看,县城的打工人日子也不那么好过。公司日常运转有一些文书工作,是他的活;老板有时候要参加县里的一些活动,如果稍微正式点的场合,发言稿得他先写一份。不大的公司还有个公众号,公司日常运营、员工团队建设等也要撰写活动稿件,这个他也要干。这些事情看起来不起眼,但文字工作每个人都能提几句意见,零碎又耗费精力。所以前阵子他接连好几天都要坐在电脑前憋稿子。

作为被老板压榨的社畜,除了苦命人之间的惺惺相惜,我当时萌生的第一个念头就是,用最近各类科技大厂们推出的AI产品,帮助他解决撰写文件的苦恼。一来是真的为了他好,节省他的时间,二来也有个私心,也想看看这些AI产品在真实需求中的表现。

结果,当天晚上他就发来了一个需求和使用反馈。

不是吧,AI已经下沉到五线小县城了

一开始他的使用反馈并不佳,AI写出来的东西还是太粗糙,最后还是要自己上手重新来一遍。

场面一度非常尴尬,不知道是我的问题,还是他的问题,但最后发现虚惊一场,是使用方式的问题。

他的需求也就是我们说的Prompt,写的非常宽泛,而且一上来就想要得到一个完善的版本。

不是吧,AI已经下沉到五线小县城了

很快,他重新拆分了需求,AI这一次没有掉链子,给出了非常细致的内容建议。

不是吧,AI已经下沉到五线小县城了

这些生成的内容可以整合进他搭建好的内容框架,丰富观点的层次,能够形成一篇更详实的材料。这大大减轻了他的工作负担。如今,他在写各种材料时,脑子里先想到的是能不能用智谱清言这类AI工具提供一些点子,帮助打开思路。

无独有偶,另一位在沿海某二线城市地产行业的朋友也时常询问AI产品能不能用在工作中。

不是吧,AI已经下沉到五线小县城了

她的工作涉及大量的PPT汇报,比如要针对城市的产业布局和规划向客户和合作方提交报告。这不只是单纯的问答,而是涉及大模型驱动的智能体应用。

由于当时国内推出智能体商店的玩家并不多,智谱AI是其中较早发布智能体商店的人工智能企业,旗下的GLMs对标OpenAI的GPTs,并且还是完全免费,没什么体验门槛和成本。对于一个月薪勉强糊口的打工人,免费和提升效率同等重要。

在我反复排除跟我客套的因素后,看得出来,AI的表现让她非常满意。

不是吧,AI已经下沉到五线小县城了

不难发现,过去一年多大模型产品不止在科技圈内狂飙猛进,也不是人工智能行业在自嗨,这些应用正在逐渐覆盖和影响到了更广泛的人群。

而且,他们不只分布在一线大城市;在二三线城市,甚至在四五线小县城里,也有不少人已经率先成为这些AI产品的忠实用户。

02

智能体让AI越用越深

除了用户群体从一线城市向更广泛的地域扩散,从去年到现在,用户们使用智谱清言这类AI工具的深度也在提升。

科技类媒体是AI产品的先锋用户群,我们自己就经历了从轻应用到用大模型来满足定制需求的变化。文生图应该是大模型刚火起来时,圈内最先用起来的功能。科技类图文内容生产者日常工作有一个痛点,是如何找到贴合文章主题的配图。

各类与前沿趋势有关的内容,配图需要抽象且具科技感。过去这类图片通常要靠美工专门制图,成本高昂且速度慢。用大模型产品的文生图功能,生成视觉效果拉满、科技感十足的图片非常快,配图问题迎刃而解。

不是吧,AI已经下沉到五线小县城了

由于图片风格洗练,智谱清言也成为我们常用的配图小助手。

而大模型的文本生成功能则不太一样。有些时候它强大的生成能力让人赞不绝口,但有时候它则让人哭笑不得。回复的内容第一眼看上去像模像样,但其实是胡说八道。还有一些答案比较大路货,针对性较差。

这些问题国内的大模型公司们当然也知道。各路人马都在想办法,升级基座模型,还给大模型加外挂,让它变得更可靠更好用。比如智谱AI,也推出新一代基座大模型GLM-4,并且发布了智能体商店,同时大模型产品还能联网和搭载各种私域知识库。

这相当于通用能力升级之外,再加上专门领域的buff,本科生再读个博士。一番操作下来,AI产品就不再是可用可不用,想起来再去问两句的小配角,通过上传用户自己的文档、文件和知识,它成了每个人都能拥有的专属知识小助理。

这么看,有点化普通为神奇的意思了。你还别说,现在各类AI应用都在暗暗使劲,提升自己的文本挂载能力。

比如智谱AI悄咪咪上线的知识库,就被人称为“一亿字的智能体”。简单说,用户在智谱清言创建智能体时,最多可以上传1000个文件,并且每个文件100MB,总处理字数的上限达到1亿字。

不是吧,AI已经下沉到五线小县城了

如果你不知道这个体量意味着什么,有个很直接的类比。中国古代最大的一部丛书四库全书,共收书3461种,总字数约7亿字。我们普通人日常要处理的领域内知识需求,绝大多数应该超不过四库全书的七分之一,因此绝大多数场景下,智谱AI的知识库产品容量应该足以应对用户的需求。

我们也在网页端点击创建了几个智能体。

不是吧,AI已经下沉到五线小县城了

整个过程非常简单,写出你的要求,让AI自己去生成智能体配置,不用绞尽脑汁去配置。生成之后,用户还可以调整名字和改变细节,之后就可以发布智能体。创建好的智能体创在网页端和APP端都可以使用。

不是吧,AI已经下沉到五线小县城了

值得一提的是,用户还能设置智能体的开放程度。发布成私密状态,就是专用助手,完全不用担心信息泄露。

不是吧,AI已经下沉到五线小县城了

我们很钦佩六神磊磊具备的丰富的金庸知识储备,也想拥有他那样随时对金庸小说人物掌故信手拈来的能力,于是创建了一个“金庸英雄谱”的智能体。

描述词非常简单,就五个字“金庸英雄谱”,之后AI自动生成了非常详细的简介和配置信息。

不是吧,AI已经下沉到五线小县城了

上传的单个文件里有1600万字但显然这没有难倒智谱的智能体创建平台。

不是吧,AI已经下沉到五线小县城了

当我问“乔峰的师傅是谁?”

不是吧,AI已经下沉到五线小县城了

点开知识库里与之相关的片段可以看到相关原文内容。

不是吧,AI已经下沉到五线小县城了

虽然自诩死忠粉丝,看过好多遍各个版本的神雕,但是我的确记不得这个名字。

之后我又创建了一个与工作相关的智能体,出海领域相关的知识助手,把此前积累的十几份热门研报全部上传,并且发布成了私密使用。

不是吧,AI已经下沉到五线小县城了

测试效果时发现,它出乎意料的好用。

不是吧,AI已经下沉到五线小县城了

如图所示,返回的结果不是市面上通行的大路货,还有一些具体的案例细节 。

同时,在智能体调试状态里还会显示内容来源。

不是吧,AI已经下沉到五线小县城了

不信邪的用户可以去提到的相应来源去验证,能发现这些确实是行业研报原文,最终的答案经过了智能体的提炼和总结。

我还尝试问了其他专业问题,比如“中国的家电品牌相比服务品牌出海,处于什么水平?”在提问时,有故意的错字和漏字,但是从回复看,这并没有妨碍智能体的理解。它给出的答案非常具体,有判断,有数据,也能对比出两种类型企业的差异性。

不是吧,AI已经下沉到五线小县城了

这种效果,简直是多了一个随身的知识小助理。也难怪从一二线大城市到四五线小县城,各路打工人纷纷用起了AI。

03

靠谱有趣,AI类APP才能玩起来

提高效率是AI最朴素的追求,比如我们看到大量的生产力工具,在智谱上都非常受欢迎,例如AI搜索有111万人次使用,数据分析则有51万人次使用。

不是吧,AI已经下沉到五线小县城了

但当我们以为大家都在为了提升工作效率而用AI工具疯狂内卷时,靠谱的年轻人还用AI玩出了花。

比如,一位解密小游戏的爱好者最近在智谱AI玩起了一款AI解谜游戏——犯罪之谜侦探。本来她以为凭借自己的“资历”能轻松通关,但是玩了一阵后,她发现自己进入了无限循环中,无法起诉相关的嫌疑人。而出现这个结局的原因其实是她忽略了与游戏里的一个关键NPC互动,最终用户扮演的侦探无法拿到关键的信息,起诉犯罪嫌疑人这个结局就没有出现。于是她不服输选择了重玩游戏,经过尝试,她走通了故事线。目前这个智能体已经吸引了十几万人次的互动。

在C端用户的使用场景里,靠谱只是最基本的诉求,有趣才是深入交流的源动力。

不是吧,AI已经下沉到五线小县城了

另一个例子是“表情包大全”智能体,这个智能体的玩法是,只要输入文字,它就能生成各种表情包。从闺蜜群里的八卦闲聊,到相亲相爱一家人里到家长里短,再到工作群里的情绪表达,表情包从来都是应对这一切的最好武器。

不是吧,AI已经下沉到五线小县城了

比如输入“为什么周六要调休”,它自动生成了以下表情包。

不是吧,AI已经下沉到五线小县城了

对i人来说,它可以放飞自我,愉快斗图。对e人而言,它简直就是自己的第二张嘴,“总有一些场景用文字回复显得生硬,但又需要回应,这个时候你就需要有一款表情包。”

由于智能体的制作流程非常简单,用户自己基于自己的兴趣和需求公开发布的智能体受到其他用户的欢迎,也繁荣了智能体市场。从智谱清言APP的每周趋势榜可以看到,智谱AI官方出品了一些智能体,还有大量的是用户自己打造和发布的。

不是吧,AI已经下沉到五线小县城了

智谱清言上各种智能体也迎来了大爆发。据智谱AI提供的数据显示,从今年1月GLMs个性化智能体功能上线以来,智谱清言智能体中心已有超过30 万个活跃智能体。

这些形形色色的智能体各具特色,但都有个共性——要么靠谱好用,要么有趣好玩。

靠谱又有趣的智能体越多,能吸引更多人来玩,产生更多的智能体;同时,APP的用户越多,用得越深,也在加速产品智能程度的升级。在C端人群里,智谱清言有望在用户人数及口碑和产品能力进化间形成数据飞轮。

发表在 比特币交易平台 | 留下评论

揭秘TON上假虚拟号骗局:钓鱼团队花式坑蒙拐骗大赏

原创 | Odaily星球日报

作者 | 夫如何

揭秘TON上假虚拟号骗局:钓鱼团队花式坑蒙拐骗大赏

近期,TON 生态发展如火如荼,生态 TVL 在本月涨幅超 70% ,达到 2.6 亿美元。但 TON 的高速发展也引起钓鱼团体的关注,此前社区成员就有披露出自己 TON 钱包中多出一个“靓号”(888 0505 0707) NFT,但不少社区成员将其进行转移时发现,该 NFT 转出的手续费高达 1 Toncoin(正常 0.02 Toncoin),并且转出后 NFT 又会出现在你的钱包中。

目前 TON 生态充斥的较多“令人迷惑”的项目,为此Odaily星球日报将就虚拟号码本身的发展,以及本类骗局风险进行回顾。

钓鱼团队玩法升级,利用小成本和占便宜心理

“+ 888 ”系列虚拟号码由 Telegram 在 2022 年在 Fragment 平台进行发售,其中去中心化拍卖平台 Fragment 是 Telegram 与 TON 破冰的重要见证。

起先,“+ 888 ”系类虚拟号码 NFT 早期通过 Telegram 直接销售,定价为 9 Toncoin,后续在全部售罄后,购买者可以直接使用或进行转卖。Telegram 团队原本是通过拍卖虚拟号码对 Telegram 中有隐私需求的用户提供方式,从而体现 Telegram 抗审查的能力。

此外,同期 Telegram 与 TON 的关系缓和,并基于 TON 推出 Fragment 拍卖平台,使虚拟号码采用 NFT 形似进行拍卖。

目前,Telegram 仅推出“+ 888 ”系列虚拟号码,本应以隐私需求为主的购买群体,转向成为彰显身份的象征,该现象和此前国内手机靓号的需求度一样,引起 TON 和 Telegram 用户对连贯且吉利的号码进行拍卖。

Fragment 平台数据显示,目前最高拍卖价格的虚拟号码为“+ 888 0666 0000 ”,拍卖价为 1365 Toncoin(约 9350 美元),其次拍卖价格较高的号码就是本文“主人公”(+ 888 0505 0707)。

钓鱼团队首先 0 成本创建冒充虚拟号码(+ 888 0505 0707)的假 NFT,并通过 nftTONificatorBot 进行分发,具体分发对象为 TON 链上活跃地址。经常从事链上活动的用户大或许是觉得该 NFT 并无价值,安全性也不确定,于是持有怀疑心理的用户尝试转走该 NFT。

揭秘TON上假虚拟号骗局:钓鱼团队花式坑蒙拐骗大赏但用户发现在进行 NFT 交易时,费用高达 1.02 Toncoin,并且完成链上步骤后,NFT 依旧原封不动的在钱包中(这不就是早年间想卸载 360 吗)。有些用户不死心想要将该 NFT 转走,但每次付出 1 Toncoin 后,NFT 依旧留在钱包。

以上是钓鱼团队利用用户转走 NFT 的怀疑心理将交易 NFT 的手续费抬高到 1 Toncoin,并且该 NFT 依旧留在钱包,至于如何将智能合约设置为 NFT 无法转移或者采用重新定向空投假 NFT,并没有找到理论支撑。

但仅通过该新颖钓鱼手段只能让少部分人蒙骗,于是该钓鱼团队效仿此前在 X 平台(原 Twitter)假空投的方式,开放铸造页面,让用户参与制造,这与以往领取空投,开放钱包权限,使钱包里资金被盗有所差别,钓鱼团队这回纯靠用户自行送钱。

揭秘TON上假虚拟号骗局:钓鱼团队花式坑蒙拐骗大赏

作者在钓鱼团队的接受地址中发现,目前仍有用户在给他们“送钱”,从转账 1 Toncoin 到铸造手续费 0.02 Toncoin,目前钓鱼团队疑似正在进行资金归拢,据 tonscan 数据,UQB1QBhyiY76wtIDTaV3pFtl8jE_aCrlGeDDTRbz2LaNjTvH该地址近几天已转入 6483 枚 Toncoin,约为 4.5 万美元。该地址仅是资金汇集地址中的其中一个。具体诈骗金额恐超 10 万美元。

为此,Odaily星球日报在此提醒大家,虽然目前 TON 生态发展较快,财富收益较高,但也是钓鱼团队作案的新阵地,社区成员已反应多个假空投和假 NFT 的链接,望大家加强风险意识。

发表在 比特币交易平台 | 留下评论

阿里“爆改”一周年:变法凶猛,增长艰难

文章来源:

出品|网易科技《态度》栏目组

作者|闫妍

编辑|丁广胜

阿里“爆改”一周年:变法凶猛,增长艰难

图片来源:由无界AI生成

14日晚间,阿里巴巴集团发布2024财年Q4及全年业绩。财报显示,阿里巴巴集团Q4收入2218.74亿元,同比增长7%,超市场预期。

2024财年全年,营收为9411.68亿元,同比增长8%。净利润为713.32亿元,同比增长9%;不按美国通用会计准则,净利润为1574.79亿元,同比增长11%(注:阿里巴巴财年与自然年不同步,2023财年4月1日至2024年3月31日为2024财年)。

经过一年剧烈变革,阿里重回健康增长轨道:本季度,淘宝天猫GMV双位数增长,阿里云核心公共云产品收入双位数增长、AI相关收入三位数增长,海外电商实现45%的同比增长,本地生活集团营收同比增长19%。

但纵观本季度财报,挤压式增长已成阿里新常态,最为核心且重要的淘系业务仍然承压。

阿里“爆改”一周年:变法凶猛,增长艰难

主动求变,

但核心业务增长仍乏力

本季度,阿里交上了一份喜忧参半的成绩单。

财报显示,阿里巴巴集团Q4收入2218.74亿元,同比增长7%,超市场预期。而上一季度,阿里营收2603.5亿元,低于市场预期2612.47亿元,同比增长仅5%,创下三个季度以来的最低增速。

继上一季度阿里巴巴经营利润、净利润双双下滑,本季度这两组数字仍不理想。

财报显示,这一季度阿里经营利润为147.65亿元,同比下降3%。净利润为9.19亿元,同比下滑96%,主要是由于所持上市公司股权投资按市值计价变动而产生的净亏损,而去年同期则为净收益所致;不按美国通用会计准则,净利润为244.18亿元,同比下滑11%。

阿里“爆改”一周年:变法凶猛,增长艰难

值得注意的是,处于集团最高优先级的电商和云计算两大核心业务重燃了增长动力,海外电商、本地生活、菜鸟等回归健康增长轨道。

阿里“爆改”一周年:变法凶猛,增长艰难

淘天集团方面,本季度营收932.16亿元(约合129.10亿美元),同比增长4%;整个2024财年营收4348.93亿元(约合602.32亿美元),同比增长5%。上一季度淘天集团的收入为1290.7亿元,同比增长仅为2%。

财报显示,淘宝天猫的季度购买人数和购买频次强劲增长,推动线上GMV及订单量实现同比双位数增长。来自搜索和推荐的收入强劲增长,带动客户管理收入同比增长5%。

但对于电商平台来说,重要的用户数据,阿里这次依旧没披露。无论是ACC(年活跃买家数),亦或是DAU(日活跃用户数),均在阿里该季度业绩报告中无从寻觅,仅交代了淘天GMV、订单量均实现了双位数增长。

本季度,阿里云收入255.95亿元,同比增长3%,其中核心公共云产品收入实现双位数同比增长,AI相关收入增长加快,持续实现三位数同比增长。同时,阿里云持续盈利,经调整EBITA同比增长45%。

阿里海外相关业务继续保持强劲势头,本季度,阿里国际数字商业集团收入同比增长45%,旗下零售平台的季度整体订单同比增长20%。

本季度,菜鸟撤回IPO,继续与国内外电商业务增强协同。2024年1-3月菜鸟单季营收245.57亿元人民币,同比增长30%,全年营收同比增长28%至990.2亿元人民币。

2024财年第四季度受饿了么和高德订单快速增长所驱动,本地生活集团收入146.28亿元人民币,相比2023年同期的123.40亿元增长19%。季度内,本地生活集团亏损已由2023年同期的40.63亿元缩减至31.98亿元,同比减亏21.3%。

2024财年,大文娱集团收入同比增长15%,并实现亏损同比收窄。

阿里“爆改”一周年:变法凶猛,增长艰难

寻求增长,

“四小龙”被寄予厚望

2023年11月16日晚的阿里巴巴财报电话会上,阿里巴巴CEO吴泳铭公布了第一批战略级创新业务——“四小龙”,分别为1688,闲鱼,钉钉,夸克,这批战略级创新业务也是阿里未来发展的关键所在。并承诺,阿里将以3-5年为周期持续投入,培育面向未来的新动能。

其中,钉钉发展迅猛,承载着阿里AI驱动的厚望。

钉钉拥有着庞大的用户基数。1月9日,在钉钉7.5产品发布会上,钉钉交出2023年的成绩单:截至2023年底,钉钉注册用户数达7亿人。此外,钉钉企业组织数达2500万,软件付费企业数达12万。值得注意的是,预计2025财年钉钉开始盈利。

闲鱼,则成为了阿里接触z世代年轻消费者的“抓手”。

去年5月,闲鱼公布用户数超5亿,其中95后用户占比43%,成为最活跃的用户,00后占比22%。最新数据显示,闲鱼日均交易额已突破10亿,过去一年超1亿人在闲鱼挂出闲置宝贝。目前闲鱼上活跃兴趣用户数已达8300万,45%的交易与潮玩、动漫、宠植等兴趣相关。

闲鱼在2023年的频频动作,先是进行了全方位的产品和战略升级,推出信用评级新体系“鱼力值”,促进闲置交易行业标准化建设;推出社区化产品“海鲜市场”;升级“会玩”社区,分享最前沿的资讯和产品;面向所有兴趣达人推出“星灿计划”,培育扶持兴趣达人……

“阿里四小龙”中相对比较低调的夸克,其实是当前整个互联网行业少见的、能保持双位数高增长的产品。

2016年8月,夸克由UC浏览器内部孵化,上线1年后用户数达到百万。随后,夸克战略重心进行调整,逐渐从浏览器转变为智能搜索,内含网盘、扫描、学习、文档、健康、小说等业务。2023年11月14日,夸克发布了自己自研的千亿参数通用大模型,迈向下一代搜索的临界点。

从公开数据来看,2020年—2023年,夸克每年用户增长率都在200%以上,2023年11月累计服务用户过亿。夸克技术负责人蒋冠军曾透露,夸克用户中,50%以上都是25岁以下年轻用户。

而作为“阿里四小龙”中最“古早”的业务,1688在2023年底突然成了“重头戏”,尤其是宣布正式布局跨境业务的消息,一度引发各方讨论。

事实上,成立于1999年的1688是阿里的第二块业务,在批发业务上几乎打遍天下无对手,年GMV能达到8000亿。随着“平替经济”大行其道,1688在新消费浪潮下也被彻底被翻红。

过去一年,1699加速了跨界至C端的脚步。1688面向买家的会员产品1688 PLUS的会员数已突破100万,成为B2B电商行业首个会员数过百万的买家付费产品。去年11月,1688跨境业务正式亮相,平台背后拥有100万的源头厂商,整个平台销售额中大概1/4是跨境(产生)的,无疑是跨境电商中一匹黑马。

1688总裁余涌也披露了一系列相关数据,2023年1~11月,跨境注册买家数同比增长76%,跨境注册买家数超594万,跨境动销品超过1.3亿,平台跨境采购规模近2000亿元,其中每年采购金额超1000万元的跨境大买家超过1000家。

可以看出,“四小龙”是阿里寻找新增长极的有力“新武器”,或许能为阿里应对新变化、新周期带来新机遇。随着“四小龙”的不断做大,甚至实现正增长,有朝一日或许也能替阿里缓解一定的营收压力。

阿里“爆改”一周年:变法凶猛,增长艰难

阿里披露六大业务领导班子名单,

人事地震已结束?

过去一年,阿里巴巴内部调整动荡不已。

2023年3月,阿里启动成立24年来最大规模的一场组织变革,正式拆分成“1+6+N”结构,即设立阿里云智能、淘宝天猫、本地生活、菜鸟、国际数字商业、大文娱等六大业务集团和多家业务公司。

2023年9月,在阿里担任了8年CEO、4年董事会主席的张勇退休,由蔡崇信和吴泳铭分别出任阿里巴巴集团董事会主席、阿里集团CEO。

2023年11月16日,阿里巴巴公布2024财年第二财季财报,并宣布一系列重大调整:盒马的首次公开募股计划暂缓;阿里巴巴不再推进云智能集团的完全分拆;菜鸟集团已申请在香港进行首次公开募股;1688,闲鱼,钉钉,夸克成为阿里巴巴第一批战略级创新业务“四小龙”。

12月,淘天集团高层发生变阵。担任淘天集团CEO仅半年,戴珊便宣布卸任,接力棒来到吴泳铭手中。与此同时,淘天集团核心管理层几乎全部更换,阿里智能事业群总裁吴嘉、饿了么首席运营官谌伟业等“少壮派”全面接管。

从一系列大刀阔斧的组织调整中可以看出,阿里在完成“大象转身”主动分拆之后,正试图重构组织以适应新周期,主动求变唤醒不同业务的新增长方式,为阿里找到全新的增长道路。

但当事物在流动时,变革是容易的,当事物凝固时,变革就十分困难。

作为电子商务的先驱,阿里正在面对拼多多、抖音等新锐平台的激烈挑战。如今阿里的业绩表现,远远不及当年井喷式的增长,这无疑给拆分重组中的阿里带来了更大的挑战。

在蔡崇信和吴泳铭接手后,阿里过去一年对内精简组织,对外战略聚焦,带领“大象”转身重拾增长。但目前来看,阿里在提升组织效能、保持应对外部变化的活力和创新力等方面,仍面临着严峻的考验。

但最起码,阿里已经有了直面问题、直面未来的勇气。

近日,阿里联合创始人、董事局主席蔡崇信与挪威主权财富基金首席投资官Nicolai Tangen对话的视频中,主持人问到,“你们面临的最严峻的竞争是什么?”

蔡崇信回答说,阿里过去几年忘记了真正的客户是谁,并说道:“我们的客户是使用我们的应用程序购物的用户,我们没有给他们最好的体验。所以在某种程度上,我们有点自食其果,并没有真正关注价值所在,我们能在哪里提供价值。”

值得注意的是,本季度财报还披露了业务集团董事和首席执行官的变更。或许,这意味着历时一年的阿里“人事地震”终于告一段落?

阿里“爆改”一周年:变法凶猛,增长艰难

阿里“爆改”一周年:变法凶猛,增长艰难

今晚财报电话会上,阿里巴巴集团首席执行官、淘天集团董事长吴泳铭表示:“随着‘用户为先’战略下的产品改进和投资策略逐步推进,我们对于持续赢得消费者信任,保持市场份额领先地位具备充分信心。”

通过自我革新、主动开刀,或许不久的将来阿里将重新回归效率至上、市场至上,变得简单和敏捷。

发表在 比特币交易平台 | 留下评论

星球日报 | 美联储主席鲍威尔:不认为下一步行动可能是加息;荷兰法院判定Tornado Cash开发者犯洗钱罪(5月15日)

星球日报 | 美联储主席鲍威尔:不认为下一步行动可能是加息;荷兰法院判定Tornado Cash开发者犯洗钱罪(5月15日)

头条


美联储主席鲍威尔发表讲话称,美国 PPI 数据实际上相当混杂,不确定通胀是否会持续,限制性政策可能需要比预期更长的时间才能发挥作用,以降低通胀,美国将把通胀率降回 2% ,限制性政策可能需要比预期更长的时间才能发挥作用,以降低通胀,从许多方面来看,政策利率是有限制性的,不认为下一步行动可能是加息,更有可能将政策利率维持在现有水平。(金十)


美联储主席鲍威尔今日发表讲话称,看起来需要更长时间才能对通胀有信心,可能需要在当前政策利率上维持更长时间。美联储需要保持耐心,等待更多证据表明高利率正在抑制通胀,从而使利率在更长时间内保持在高位的必要性加倍。鲍威尔预计通胀率将按月下降,但第一季度的物价数据削弱了他的信心。美国第一季度在通胀方面缺乏进一步的进展是值得注意的。美联储没有认为抗击通胀这是一条平坦的道路,但最近的数据比任何人预期的都要高。这告诉人们需要保持耐心,让限制性政策发挥作用。(金十)


美联储主席鲍威尔发表讲话称,美国经济表现非常好,拥有非常强劲的劳动力市场,第一季度美国通胀未见进一步进展,没有预期通胀之路会平坦,我们必须耐心等待政策发挥作用,美国 GDP 将继续以 2% 或更高的速度增长,对通胀回落的信心低于之前,预计通胀率将环比回落。(金十)

行业新闻


周二,荷兰一家三名法官判定 Tornado Cash 开发者 Alexey Pertsev 在加密货币混合器平台 Tornado Cash 上洗钱 12 亿美元的非法资产有罪。预计该小组将于周二对 Pertsev 进行量刑,Alexey Pertsev 的律师将有 14 天的时间对法官的决定提出上诉。(DL News )

荷兰法官在斯海尔托亨博斯法院裁定,Tornado Cash 开发者 Alexey Pertsev 犯有洗钱罪。法庭判处 Pertsev 64 个月监禁。2022 年 8 月,Tornado Cash 被美国政府列入黑名单后,该开发商首次在荷兰被判入狱。当时,美国财政部声称 Tornado Cash 是朝鲜黑客组织 Lazarus 的关键工具。Lazarus 集团与 Axie Infinity 旗下 Ronin Network 遭受的价值 6.25 亿美元的黑客攻击以及其他重大加密货币盗窃案有关。(Coindesk)


前美国商品期货交易委员会(CFTC)主席 J. Christopher Giancarlo 宣布加入稳定币发行商 Paxos 董事会,J. Christopher Giancarlo 在一份声明中表示:“Paxos 通过推出对机构和消费者安全的受监管解决方案,已成为连接传统和数字资产市场的领导者,很荣幸加入 Paxos 董事会并成为金融领域创新的一部分。”(Coindesk)

项目要闻


LayerZero CEO Bryan Pellegrino 在 X 平台发文表示,已有多达 10 万个地址承认为女巫。
此前消息,LayerZero 在 X 平台发文表示,将代币分发给持久用户(而不是女巫用户)符合协议的最佳利益,对于女巫用户,现在有两个选择: 1. 在 5 月 17 日之前自行报告女巫地址;2. 当地址被 LayerZero 的内部女巫报告或赏金猎人标记后,再进行报告将不再有效,也不会收到任何代币。
Bryan Pellegrino 在 X 平台回复用户时表示,“女巫自行报告”不是针对普通用户,而是针对大型女巫用户。报告的重点是大规模女巫而不是个人用户。


LayerZero Labs 在 X 平台发文表示,女巫悬赏活动将于北京时间 5 月 18 日 10: 00 开始。赏金报告将于北京时间 6 月 1 日 07: 59 截止,并且必须包含至少 20 个地址。
成功举报女巫的赏金猎人将收到女巫预期代币分配的 10% ,而女巫则将获得 0 分配。
女巫自我报告将开放至北京时间 5 月 18 日 07: 59 。自我报告为女巫的地址将获得其预期分配的 15% 。不自行报告并被 LayerZero 与 Chaos 和 Nansen 共同撰写的内部报告识别为女巫的地址,或者在赏金过程中发现的地址将不会收到代币。


Lens Lab 是 Stani Kulechov 领导项目,也是基于 Polygon PoS 构建的 Web3 社交平台 Lens Protocol 背后的团队,宣布现在正在开发自己的区块链网络 Lens Network。新网络将建立在 Matter Labs 的 ZK Stack 上,由以太坊上的 zkSync 提供支持。


CoinGecko 数据显示,PEPE 24 H 交易量接近 29 亿美元,当前为 2, 893, 749, 805 美元,超过 SOL(2, 287, 698, 756 美元),在所有加密货币中排名第六。
另据 OKX 行情,PEPE 短时触及 0.000011533 USDT,续创历史新高;现报 0.000010988 USDT, 24 H 涨幅为 15.88% 。


据派盾监测,DeFi 借贷协议 Sonne Finance 遭黑客攻击,需仔细检查其时间锁合约,目前损失超过 2000 万美元。
Sonne Finance 在 X 平台发文表示,所有 Optimism 市场均已暂停。Base 上的市场是安全的,将及时提供更多信息。

人物*声音


CNBC 对前 SEC 主席 Jay Clayton 进行了采访,针对 GME 本周上涨了 187% 和 Meme 股票再次卷土重来这一问题,Clayton 表示:“它在很多层面上困扰着我(it bothers me on many levels)。它更接近于赌博而不是交易,当然也不是投资。”
此外 Clayton 对 Roaring Kitty 近期行为的合法性进行了点评,虽不属于内幕交易和操作股市,但 Clayton 认为 Kitty 应当直接明了地表示他的想法(Tell people why you do this.),行为合法。


根据判决,荷兰法院判定 31 岁的 Pertsev 通过 Tornado Cash 洗钱 12 亿美元。一个由三名法官组成的小组判处 Pertsev 五年四个月的监禁。法院在最终结论中表示:“法院认为法律上和事实证明,嫌疑人与他人一起,通过犯罪获得的以太坊进行洗钱,并且他已经习惯了这种洗钱行为。”与此同时,Tornado Cash 联合创始人 Roman Storm 在美国的审判定于 9 月 23 日开始。去年,美国检察官指控 Storm 和另一位联合创始人 Roman Semenov 共谋洗钱、共谋违反制裁以及共谋经营无牌货币传输业务。起诉时,Semenov 仍在逃。
去中心化金融教育基金(DeFi Education Fund)的发言人表示,他们对 Pertsev 在荷兰案件的结果感到失望,但认为这不应影响美国针对 Storm 的案件。该基金的一位发言人在一份电子邮件声明中表示:“正如我们在之前提交的关于 Roman Storm 案件的法庭之友简报中所辩称的那样,政府在起诉书中的责任理论是前所未有的。” “根据起诉书中的指控,软件开发人员在创建开源、通用软件多年后,如果第三方不法分子使用该软件,且开发人员与这些不法分子之间没有直接或积极的互动,那么这些开发人员将被追究刑事责任。”
“这根本不是美国现行的法律,”他们补充道。(The Block)

投融资


加密预测市场 Polymarket 已完成总计 7000 万美元两轮融资,最近一轮融资由 Founders Fund 等领投,以太坊联合创始人 Vitalik Buterin 等参投。Polymarket 发言人表示,Founders Fund 领投了 4500 万美元的 B 轮融资。 General Catalyst 早些时候帮助该公司在 A 轮融资中筹集了 2500 万美元。(Bloomberg)


代币化再保险 RWA 平台 Re 完成 700 万美元新一轮融资,Electric Capital 领投,据悉该项目曾在 2022 年底完成 1400 万美元种子轮融资,Re 的目标是到今年年底支持 2 亿美元的保费。(Coindesk)


Solana DEX Zeta Markets 宣布完成新一轮 500 万美元融资, Electric Capital 领投, Digital Asset Capital Management、Selini Capital 和 Airtree Ventures、以及包括 Solana 的 Anatoly Yakovenko、Helius 的 Mert Mumtaz、Tensor 的 Richard Wu、Pyth 的 Genia Mikhalchenko、Wintermute 的 JMR Luna 和 Bonk 的 Nom 在内的天使投资人参投。(TheBlock)


发表在 比特币交易平台 | 留下评论

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

作者 |  智东西编辑部

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

图片来源:由无界AI生成

秀杀手级AI玩法、Gemini安卓合体截胡苹果、最强TPU,谷歌2小时提了121次AI。

智东西5月15日报道,今日凌晨,在一年一度的谷歌I/O开发者大会上,谷歌干了一场AI硬仗!

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

时长不到2小时的开幕式期间,谷歌CEO桑达尔·皮查伊携一众谷歌高管总共提到121次“AI”。谷歌DeepMind的联合创始人兼CEO戴密斯·哈萨比斯首次在I/O大会上发表演讲,顺序仅次于皮查伊,足见AI大模型已经成谷歌的头等大事。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

在昨天OpenAI发动奇袭、推出干掉传统语音助手的旗舰模型GPT-4o后,作为“全球AI一哥+搜索一哥”的谷歌,势必得扳回一城,搏一搏谁才是AI赛道的头号“大模王”。

这次,谷歌连珠炮般甩出了22项AI大招,包括公布200万tokens超长上下文Gemini 1.5 Pro进阶版、Gemini 1.5 Flash轻量级模型、通用AI Agent、高质量文生图模型Imagen 3、AI音乐创作工具Music AI Sandbox、70秒视频生成模型Veo、首个视觉语言开放模型PaliGemma等多款模型,还剧透了下一代Gemma 2大模型

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

Veo生成视频的部分片段:

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

其他大招包括第六代TPU、AI基础设施、AI搜索新功能、Google Workspace应用Gemini功能、Gemini Live多模态功能、Gemini定制功能、Gemini Advanced、画圈即搜功能、Gemini Nano新功能、安卓Gemini合体、AI辅助红队技术、扩展和开源SynthID文本水印等。

谷歌还展示了一系列AI系统,包括将视觉和语言转化为机器人行动的RT-2、浏览复杂虚拟3D环境的SIMA、解决奥数问题的AlphaGeometry

发布会开场,皮查伊称目前有超150万开发人员在使用Gemini模型,谷歌拥有20亿用户的产品都在使用Gemini,谷歌推出安卓和iOS上可用的应用程序直接与Gemini互动,3个月内已有超过100万人注册尝试。

谷歌今天的诸多AI大招还有哪些精彩细节,这些技术又将如何深度影响产业,我们将带你一文看尽。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

01.

未来通用AI Agent:
日常生活随时答疑解惑的超级助手

昨天OpenAI果然是有预谋的精准狙击,率先亮出聊天丝滑宛如真人、具有炫酷实时视频理解能力的旗舰模型GPT-4o,导致今天谷歌展示的未来AI助手Project Astra演示有点儿眼熟,演示者打开手机摄像头,边走边问摄像头捕捉到的现实场景中的问题。

比如要求“看到能发出声音的东西就告诉我”,Gemini就会给出准确描述:“我看到一个音响发出声音。”接着你可以在手机屏幕上画出红色箭头,追问“音响的这部分叫什么”,Gemini立即回复说这是“高频扬声器”并解释它的用途。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

再比如要求Gemini给出创造性的头韵体,它随即根据画面中的蜡笔给出回答:“Creative crayons color cheerfully. They certainly craft colorful creations.”

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

实时解答代码同样不在话下。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

甚至扫一眼周围环境,Gemini就能推断出你住在哪个小区。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

找不到东西也可以请求Gemini的帮助,问问它有没有看见自己的眼镜在哪儿,Gemini立即发现它在桌面上靠近一个红苹果的地方。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

你还能直接现场板书,问在这里可以添加什么来使得系统更快,Gemini回复说“在服务器和数据库之间添加缓存可以提高速度”。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

此外,问它看到这个画面能想起什么,Gemini能瞬间理解它指的是“薛定谔的猫”。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

让它给小狗和老虎玩偶的组合起个乐队名,Gemini给出的建议是“金色条纹”。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

02.

8大AI模型/工具炸场!
最强文生图、70秒视频生成、
200万tokens超长上下文

1、Veo:全新视频生成模型,只需一个文本、图像或视频提示,就能制作和编辑70秒以上不同视觉风格的高质量1080p视频。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

OpenAI发布Sora后,视频大模型的热度就一直居高不下,今天谷歌的Veo也算是正面硬刚Sora了。

用户可以自定义各种风格模式,还能通过点击增长时间,视频时长可以超过1分钟。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

从Veo生成的视频中我们可以看到,AI对空间中的物体关系是有理解的。比如车辆是如何在道路上行驶的,车辆之间的位置关系等等。

同时,Veo生成的视频镜头有不错的一致性,人、动物、物体的移动显得比较真实、自然。

谷歌说,Veo是他们在视频生成领域技术的集大成制作,包含了多年来谷歌开发的生成查询网络(GQN)、DVD-GAN、Imagen-Video、Phenaki、WALT、VideoPoet和Lumiere等各类技术。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

值得一提的是,Veo还能理解很多电影术语,比如“时光倒流(Timelapse)”。

在演示视频中,电影导演也用到了Veo,Veo帮他们把灵感变成现实,电影导演说,AI可以帮他们快速发现构思中的错误并快速纠正,提高效率。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

谷歌称,实现这些,需要让AI模拟世界的物理法则,这是很关键的。

用户可加入实验室等待名单,在新实验工具VideoFX中尝试。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

2、Imagen 3:谷歌迄今最高质量的文生图模型,能更好理解文本,创造出逼真图像,能从草图快速生成高分辨率图像。谷歌自信地说Imagen 3是目前最强大的图像生成模型。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

Imagen 3生成的图像可以达到“数毛”级别,具备非常多的画面细节,同时其光影细节也非常震撼。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

Imagen 3可以像人一样理解世界,可以理解文字中的信息对应图像中的哪一部分,并且具备上下文理解能力。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

Imagen 3可以更好地理解自然语言,理解提示文字背后的意图,比如它可以理解人物照片中的背景虚化效果、人物跟背景中植物和建筑的关系。

3、Music AI Sandbox:AI音乐创作工具,可以改变音乐的创作方式,谷歌与音乐家、词曲作者和制作人密切合作来帮助设计和测试这款工具。

在生成式音乐创作方面,谷歌通过Music AI Sandbox跟音乐家合作,音乐家可以直接把一段哼唱或者弹奏的灵感片段发给AI,生成一首歌或者一段真正的旋律。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

音乐家说,AI就像一个朋友,让你试试这个、试试那个,这可以解放他们的创造力,让他们更高效地创作音乐。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

4、Gemini 1.5 Pro进阶版:多模态,上下文窗口扩展至200万个tokens,改进代码生成、逻辑推理和规划、多轮对话、音频与图像理解能力,支持35种语言,面向全球开放。

上下文扩展到200万个tokens,意味着它能够处理1500页PDF、30000行代码或是1小时的视频。Gemini 1.5 Pro在翻译、编码、推理等方面,可处理更广泛、更复杂的任务。

皮查伊宣布把Gemini 1.5 Pro的进阶版开放给全球开发者使用。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

Gemini 1.5 Pro即日起面向谷歌Workspace Labs进行开放,支持用户在工作场景中获得更多智能功能。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

皮查伊谈道,多模态+上下文可以解锁不少新功能。比如基于Gemini在谷歌Gmail邮箱中搜索内容,人们可以问Gemini“小朋友最近在学校做什么?”,Gemini就会去识别相关邮件及附件,给出一个关键要点的列表。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

现场谷歌演示了NotebookLM的音频概述功能,用户只需将文本资料输入进去,该软件即可基于Gemini Pro 1.5能力,生成丰富的音频内容素材,就像整合成一个课本一样,互动性、沉浸性较高。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

5、Gemini 1.5 Flash:轻量级模型,针对低延迟和低成本任务(聊天应用、从长文档提取数据等)进行了优化,成本效益更高,上下文窗口达100万个tokens。

Gemini 1.5 Flash模型,相比此前的Gemini 1.5 Pro,该模型的特点是轻量级,支持快速、多模态、长上下文的推理。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

价格方面,Gemini 1.5 Pro为7美元/100万tokens,对于128k以下的输入,将降价50%至3.5美元/100万tokens;Gemini 1.5 Flash的价格为0.35美元/100万tokens。

Gemini 1.5 Pro和Gemini 1.5 Flash这两款型号的模型现已在200多个国家和地区提供预览版,并将于6月全面上市。

6、PaliGemma:谷歌首个视觉语言开放模型,Gemma系列型号在轻量级7B和2B尺寸方面将提供行业领先的性能。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

谷歌此前于2月推出开源模型Gemma,包含7B、2B两种参数规模,在各大开源社区下载量已累计数百万次。

今天,谷歌发布其首个视觉语言开放模型PaliGemma,基于SigLIP视觉模型和Gemma语言模型等开放组件构建,用于在各种视觉语言任务上实现一流的微调性能,包括图像和短视频字幕、视觉问答、理解图像中的文本、对象检测和对象分割等。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

7、Gemma 2抢先看:将在未来几周正式发布一个有270亿个参数的模型版本。Gemma 2 27B性能媲美Llama 3 70B,尺寸不到Llama 3 70B的一半,可在NVIDIA GPUs或Vertex AI单个TPU主机上运行。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

Gemma 2还在进行预训练。下图展示了最新的Gemma 2检查点的性能以及基准预训练指标。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

8、LearnLM:基于Gemini的新系列模型,对学习进行了微调,应用教育研究使谷歌搜索、Gemini、YouTube等产品更加个性化、更活跃、更吸引学习者,将在未来几个月发布。

03.

AI搜索走向多模态!发布最强AI安卓系统,
手机上就能圈图提问读文档

1、AI搜索:到今年年底,谷歌搜索的AI概览将超过10亿人。谷歌搜索将很快推出多轮推理能力,可将复杂问题分解处理,将原本需要几分钟甚至几个小时的研究压缩到在几秒钟内完成,还将支持在搜索中对视频提问。

皮查伊宣布,谷歌即日起开始向每位美国用户推出基于Gemini改进的搜索体验,本周将向更多国家开放。

在谷歌照片方面,Gemini让照片搜索变得更容易。假设用户在停车场准备付款但想不起自己的车牌号,他可以简单地询问Gemini,基于之前拍的照片告诉用户车牌号码。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

基于此谷歌宣布推出AI Overviews工具,将陆续面向美国及各国用户开放。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

谷歌AI Overviews功能相比传统搜索引擎的结果,其将为用户呈现出完整的包括观点、见解、链接的答案。

谷歌搜索负责人Liz Reid强调,谷歌的AI搜索概述有三大独特优势:实时信息、排名和质量体系、Gemini模型能力。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

今天起,谷歌AI搜索概述将在美国全面推出,后续推广到更多国家和地区,在今年内覆盖10亿用户。

Reid称,谷歌引入多步推理功能(Multi-step reasoning),把大问题分解为小部分,并判断优先顺序。

例如,用户想找一个合适的普拉提工作室,需要同时考虑时间、价格、距离等因素。用户可以在谷歌搜索输入:在波士顿找到最好的瑜伽工作室,并显示优惠详情、从我家过去的步行时间。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

谷歌搜索将提炼整合出这些信息,并呈现在AI搜索概述中,为用户节省数个小时的时间。这一功能也适合用在出行、聚会等规划上,或是餐饮计划的定制等。

例如“为团队定制一个三天的餐饮计划”,AI搜索概述不仅能提供各类型的食谱,还能直接将食谱中用到的食材等导出成购物清单,这意味着用户仅需提问,就能将所需的一切加入购物车。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

此外,谷歌搜索还将很快推出视频搜索功能。例如可以通过拍摄电唱机,来获取故障排除相关的AI搜索概述。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

2、Google Workspace应用:侧边面板可使用Gemini 1.5 Pro模型,将使跨应用程序的工作变得更加容易,例如在Gmail中识别收据并在Drive和Sheets中组织收据,还可以通过数据问答让Gemini帮你分析开支。

AI在我们的日常办公中能有什么妙用,这次谷歌在Workspace中增加了不少AI重磅新功能。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

在邮件应用中,Gemini可以根据我们的需求总结邮件中的信息,比如家里屋顶漏水了,Gemini可以帮你找到所有修复屋顶的公司发给你的邮件,按照各个公司的报价、可以服务的时间进对比。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

Gemini可以找到价格相对合适,上门服务时间最快的合同商,我们确定后,Gemini还可以提供邮件回复建议。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

值得一提的是,Gemini是有理解语境能力的,AI知道之前的邮件中都说了什么。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

更进一步,在邮件应用中,Gemini还可以帮你追踪所有订单、相关收据,把这些邮件进行归纳整理,放到一个文件夹里,然后把其中关键信息整理进表格里。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

用户可以直接选择自动化工作流,后面所有相关订单邮件都会放到文件夹里,关键信息也会自动整理进表格。

我们还可以直接问Gemini“我的钱都花在哪里了?”Gemini可以直接用图表给你展示出来,让你清清楚楚地知道自己哪里花销最大。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

此外,在公司办公协作场景中,谷歌还推出了一个“AI虚拟员工”功能,可以说是打造了一个“最强AI实习生”。

这个AI虚拟员工会有一个Workspace账号,用户可以对其自由命名、指派任务。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

▲右侧为用户建立的AI虚拟员工Chip

我们可以把这个AI虚拟员工放在各个工作群组里,它可以在各个群聊中提取信息,找到关键信息。

值得一提的是,这个AI员工可以有“集体记忆”,可以总结之前的一些工作重点,还可以把总结发送给相关人员。谷歌高管称,以前需要几个小时做的,现在AI几分钟的就可以做好。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

可以说,这着实是最强AI企业实习生了。

3、Gemini Live:今年夏季将扩展Gemini的多模态功能,包括使用你的声音进行深入的双向对话的能力。

在Gemini APP中,谷歌推出Gemini Live功能,用户可通过文本、语音或影像多种方式进行交互,直接与大模型进行对话,并能够随时打断,可以打开摄像头使其“看到”周围的世界并实时响应。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

Gemini Live将在未来几个月内,优先向Gemini Advanced订阅用户推出。

4、Gems:Gemini定制功能,无论你需要一位瑜伽闺蜜还是微积分导师,都可以定制专属的Gemini来以特定方式进行互动。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

用户可以通过简单的指令打造个人专家,例如写作教练、瑜伽老师、代码检查器等。在构建过程中,用户可直接选择Google Drive中的文件上传。

Gemini还将连接更多谷歌工具,包括日历、任务、邮件等,在这些应用中用户能够通过简单的提示获取AI体验。

5、Gemini Advanced:今年夏季将新增旅行计划功能,支持创建个性化的行程;即日起支持访问Gemini 1.5 Pro,具有100万个tokens上下文窗口,可上传多达1500页的文件;接下来几周内新增数据分析功能,上传电子表格即可更快分析数据、制作图表、发现见解。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

6、画圈即搜功能:在你的手机或平板电脑上圈出复杂的物理问题,就能获得一步一步的指导,学习如何解决问题。

AI搜索方面,画圈即搜功能大家已经在三星的手机上看过了,比如画圈找心仪的商品信息。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

今天谷歌给画圈即搜增加了新能力,在学习过程中,用户可以直接把不懂的问题圈出来,Gemini就会给用户一步步的问题解答,可以说摇身一变成为最强辅导老师——谷歌圈读机,哪里不会圈哪里。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

谷歌称,画圈即搜后续面可以处理公式、复杂图表,目前已经应用在1亿台设备上,谷歌计划把这个数字在年底翻倍。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

7、安卓版Gemini新功能:安卓系统上的Gemini变得更有帮助,更有环境意识;今年晚些时候支持将生成的图像拖放到Google Messages和Gmail中,还支持用户直接在设备上询问有关YouTube视频和PDF文件的问题。

谷歌要怎么做手机上的AI,今天答案有了:谷歌要做“系统级AI”,把Gemini用在安卓系统底层。这对于产业的重要意义不言而喻,所有安卓手机,可能都会享受到这一“AI福利”。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

谷歌说,他们要让安卓成为体验谷歌AI的最强移动平台。

对于“系统级AI”,谷歌进行了重点解读。谷歌希望让Gemini成为安卓体验的基础。

所以区别在哪?Gemini在系统级层面运行,因此用户不需要打开应用。同时Gemini有了上下文感知能力,它知道你在干什么,可以成为更有用的助手。

比如,Gemini可以帮用户在聊天中生成有趣的表情包图片,Gemini可以感知到用户在看视频,弹出提示,询问是不是想了解关于这个视频的问题,用户可以直接询问视频中的细节,Gemini可以直接从视频中找到答案。

比如当朋友发过来一个关于匹克球规则的84页的PDF,Gemini会检测到,并询问你是不是要了解这个PDF,你可以把PDF直接甩给Gemini,它就会成为一个匹克球的“运动专家”,用户问什么规则,它都可以解答。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

这种系统级AI具备上下文感知能力,可以提供更即的时帮助。谷歌特别强调说,这些体验只在安卓上可以用——Only on Android。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

这下,压力给到了苹果。

谷歌把AI直接嵌入到了操作系统中,称这是首个内置端侧AI的移动操作系统。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

谷歌预告称,今年晚些时候,Gemini Nano的功能会在Pixel系列手机上落地。

对于视障人士,TalkBack读屏功能,此次升级了多模态能力,可以更加清晰的描述一张图片,比如服装的款式,这些功能都是端侧实现的,不需要联网。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

谷歌还发布了端侧AI的另一个应用,预防电话诈骗。手机发现用户接打有风险的陌生的来电时,会直接发出警告,告诉用户这个电话可能是个诈骗电话。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

所以谷歌要做什么,谷歌要做的就是以Gemini为核心的安卓。

这些功能会在安卓15 Beta 2版本中落地。

8、Gemini Nano新功能:多模态功能很快将上线,使手机可以通过文本、视觉、声音和口语来理解世界;今年晚些时候安卓辅助功能TalkBack将在Gemini Nano上得到提升,图像描述将更清晰、更丰富,帮助低视力和盲人用户通过语音反馈更好地导航他们的手机;安卓一旦检测到可疑活动,就会在通话过程中发出警告,比如被要求提供社会安全号码和银行信息。

04.

第六代TPU芯片来了!
训练agents提高AI安全

1、第六代TPU:谷歌迄今性能最高、最节能的TPU,相比上一代TPU v5e,每颗芯片的峰值计算性能提高了4.7倍,节能67%以上,HBM容量和带宽提高1倍,Interchip Interconnect带宽提高1倍,可在单个高带宽、低延迟POD中扩展到256个TPU,还配备了专门用于处理高级排名和推荐工作负载中常见的超大型嵌入的专用加速器第三代SparseCore。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

Trillium配备的第三代SparseCore加速器,可以更快地训练基础模型,并提供更低的延迟和成本。

Trillium在单个高带宽、低延迟pod中可扩展至256个TPU,利用Multislice技术和Titanium 智能处理单元(IPU),Trillium还可以扩展到数百个pod,通过每秒数万比特的数据中心网络互联,将数万个芯片连接到楼宇级超级计算机中。

第六代TPU Trillium将于今年晚些时候上市,此外Pichai还透露,谷歌将与英伟达合作,在2025年推出Blackwell平台。

2、AI基础设施:从AI超算到跨越200多英里陆地和海底光纤的海底电缆网络,谷歌持续投资推进AI创新,投资世界一流的基础设施。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

3、AI辅助红队:使用谷歌DeepMind的AlphaGo开发的一种新技术,训练agents相互竞争,提高红队能力,这有助于对抗提示并限制有问题的输出。

4、扩展SynthID水印功能:谷歌去年推出的SynthID为AI生成的图像和音频添加了难以察觉的水印,使它们更易区分,今天谷歌将SynthID扩展到Gemini应用和web体验中的文本输出,并在全新视频生成模型Veo中对视频进行水印。接下来几个月里还将开源用于文本水印的SynthID。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

▲用于视频水印的SynthID标记生成的视频的每一帧

5、扩展负责任的生成式AI工具包:通过发布开源的大语言模型比较器(一种新的交互式和可视化工具),帮助开发人员进行更健壮的模型评估,有效并行评估模型质量与安全性。

谷歌7大模型22项AI大招轰炸!70秒视频生成、Gemini安卓合体、200万tokens上下文

05.

结语:生成式AI落地酣战在即!
谷歌用Gemini重塑搜索

“谷歌搜索是人类浩瀚好奇心的生成式AI——这是我们搜索领域最激动人心的篇章。”皮查伊在谷歌I/O大会上激情洋溢地说。

在OpenAI ChatGPT点燃生成式AI的热焰时,昔日AI老大哥谷歌因为反应迟钝外加“翻车”事件,沦为了顶尖AI大模型竞赛里的追赶者。随后谷歌重燃AI斗志,不断打磨Gemini大模型,并在本届I/O大会上从“AI军火库”中狂掏武器秀实力。

无论是包括Gemma 2、Gemini 1.5 Flash、Imagen 3、Veo等新模型在内的一系列创新,通过文本、语音、视频、图片等多模态的搜索方式升级,还是为下一代AI模型与agents提供更快、更低延迟训练和服务动力的定制AI专用芯片与基础设施,谷歌披露了这一系列进展,都彰显出巨头雄厚的技术实力和广泛的应用市场。

在激烈的生成式AI竞赛中,OpenAI并非一骑绝尘,最终赢家是谁还有相当多的变数。

发表在 比特币交易平台 | 标签为 | 留下评论

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

来源:机器之心

机器之心编辑部

通用的 AI,能够真正日常用的 AI,不做成这样现在都不好意思开发布会了。

5 月 15 日凌晨,一年一度的「科技界春晚」Google I/O 开发者大会正式开幕。长达 110 分钟的主 Keynote 提到了几次人工智能?谷歌自己统计了一下:

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

是的,每一分钟都在讲 AI。

生成式 AI 的竞争,最近又达到了新的高潮,本次 I/O 大会的内容自然全面围绕人工智能展开。

「一年前在这个舞台上,我们首次分享了原生多模态大模型 Gemini 的计划。它标志着新一代的 I/O,」谷歌首席执行官桑达尔・皮查伊(Sundar Pichai)说道。「今天,我们希望每个人都能从 Gemini 的技术中受益。这些突破性的功能将进入搜索、图片、生产力工具、安卓系统等方方面面。」

24 小时以前,OpenAI 故意抢先发布 GPT-4o,通过实时的语音、视频和文本交互震撼了全世界。今天,谷歌展示的 Project Astra 和 Veo,直接对标了目前 OpenAI 领先的 GPT-4o 与 Sora。

这是 Project Astra 原型的实时拍摄:

我们正在见证最高端的商战,以最朴实的方式进行着。

最新版 Gemini 革新谷歌生态

在 I/O 大会上,谷歌展示了最新版 Gemini 加持的搜索能力。

25 年前,谷歌通过搜索引擎推动了第一波信息时代的浪潮。现在,随着生成式 AI 技术的演进,搜索引擎可以更好地帮你回答问题,它可以更好地利用上下文内容、位置感知和实时信息能力。

基于最新版本的定制化 Gemini 大模型,你可以对搜索引擎提出任何你想到的事情,或任何需要完成的事 —— 从研究到计划到想象,谷歌将负责所有工作。

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

有时你想要快速得到答案,但没有时间将所有信息拼凑在一起。这个时候,搜索引擎将通过 AI 概述为你完成工作。通过人工智能概述,AI 可以自动访问大量网站来提供一个复杂问题的答案。

借助定制 Gemini 的多步推理功能,AI 概述将有助于解决日益复杂的问题。你无需再将问题分解为多个搜索,现在可以一次性提出最复杂的问题,以及你想到的所有细微差别和注意事项。

除了为复杂问题找到正确的答案或信息之外,搜索引擎还可以与你一起,一步步制定计划。

在 I/O 大会上,谷歌重点强调了大模型的多模态和长文本能力。技术的进步为 Google Workspace 等生产力工具变得更加智能化。

例如,现在我们可以要求 Gemini 总结一下学校最近发来的所有电子邮件。它会在后台识别相关的 Email,甚至分析 PDF 等附件。随后你就能获得其中的要点和行动项目的摘要。

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

如果你正在旅行,无法参加项目会议,而会议的录音长达一个小时。如果是 Google Meet 上开的会,你可以要求 Gemini 给你介绍一下重点。有一个小组在寻找志愿者,那天你有空。Gemini 可以帮你写一封邮件进行申请。

更进一步,谷歌在大模型 Agent 上看到了更多的机会,认为它们可作为具有推理、计划和记忆能力的智能系统。利用 Agent 的应用能够提前「思考」多个步骤,并跨软件和系统工作,更加便捷地帮你完成任务。这种思路已经在搜索引擎等产品中得到了体现,人们都可以直接看到 AI 能力的提升。

至少在全家桶应用方面,谷歌是领先于 OpenAI 的。

Gemini 家族大更新

Project Astra 上线

生态上谷歌有先天优势,但大模型基础很重要,谷歌为此整合了自身团队和 DeepMind 的力量。今天哈萨比斯也首次在 I/O 大会上登台,亲自介绍了神秘的新模型。

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

去年 12 月,谷歌推出了首款原生多模态模型 Gemini 1.0,共有三种尺寸:Ultra、Pro 和 Nano。仅仅几个月后,谷歌发布新版本 1.5 Pro,其性能得到了增强,并且上下文窗口突破了 100 万 token。

现在,谷歌宣布在 Gemini 系列模型中引入了一系列更新,包括新的 Gemini 1.5 Flash(这是谷歌追求速度和效率的轻量级模型)以及 Project Astra(这是谷歌对人工智能助手未来的愿景)。

目前,1.5 Pro 和 1.5 Flash 均已提供公共预览版,并在 Google AI Studio 和 Vertex AI 中提供 100 万 token 上下文窗口。现在,1.5 Pro 还通过候补名单向使用 API 的开发人员和 Google Cloud 客户提供了 200 万 token 上下文窗口。

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

此外,Gemini Nano 也从纯文本输入扩展到可以图片输入。今年晚些时候,从 Pixel 开始,谷歌将推出多模态 Gemini Nano 。这意味着手机用户不仅能够处理文本输入,还能够理解更多上下文信息,例如视觉、声音和口语。

Gemini 家族迎来新成员:Gemini 1.5 Flash

新的 1.5 Flash 针对速度和效率进行了优化。

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

1.5 Flash 是 Gemini 模型系列的最新成员,也是 API 中速度最快的 Gemini 模型。它针对大规模、大批量、高频任务进行了优化,服务更具成本效益,并具有突破性的长上下文窗口(100 万 token )。

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

Gemini 1.5 Flash 具有很强的多模态推理能力,并具有突破性的长上下文窗口。

1.5 Flash 擅长摘要、聊天应用程序、图像和视频字幕、从长文档和表格中提取数据等。这是因为 1.5 Pro 通过一个名为「蒸馏」的过程对其进行了训练,将较大模型中最基本的知识和技能迁移到较小、更高效的模型中。

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

Gemini 1.5 Flash 性能表现。来源 https://deepmind.google/technologies/gemini/#introduction

改进的 Gemini 1.5 Pro 上下文窗口扩展到 200 万 token

谷歌提到,如今有超过 150 万的开发人员在使用 Gemini 模型,超过 20 亿的产品用户都用到了 Gemini。

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

在过去的几个月里,谷歌除了将 Gemini 1.5 Pro 上下文窗口扩展到 200 万 token 之外,谷歌还通过数据和算法的改进增强了其代码生成、逻辑推理和规划、多轮对话以及音频和图像理解能力。 

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

1.5 Pro 现在可以遵循日益复杂和细致的指令,包括那些指定涉及角色,格式和风格的产品级行为的指令。此外,谷歌还让用户能够通过设置系统指令来引导模型行为。

现在,谷歌在 Gemini API 和 Google AI Studio 中添加了音频理解,因此 1.5 Pro 现在可以对 Google AI Studio 中上传的视频图像和音频进行推理。此外,谷歌还将 1.5 Pro 集成到 Google 产品中,包括 Gemini Advanced 和 Workspace 应用程序。

Gemini 1.5 Pro 的定价为每 100 万 token 3.5 美元。

其实,Gemini 最令人兴奋的转变之一是 Google 搜索。

在过去的一年里,作为搜索生成体验的一部分,Google 搜索回答了数十亿个查询。现在,人们可以使用它以全新的方式进行搜索,提出新类型的问题、更长、更复杂的查询,甚至使用照片进行搜索,并获得网络所提供的最佳信息。

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

谷歌即将推出 Ask Photos 功能。以 Google Photos 举例,该功能大约在九年前推出。如今,用户每天上传的照片和视频数量超过 60 亿张。人们喜欢使用照片来搜索他们的生活。Gemini 让这一切变得更加容易。

假设你正在停车场付款,但不记得自己的车牌号码。之前,你可以在照片中搜索关键字,然后滚动浏览多年的照片,寻找车牌。现在,你只需询问照片即可。

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

又比如,你回忆女儿露西娅的早期生活。现在,你可以问照片:露西亚什么时候学会游泳的?你还可以跟进一些更复杂的事情:告诉我露西娅的游泳进展如何。

在这里,Gemini 超越了简单的搜索,识别了不同的背景 —— 包括游泳池、大海等不同场景,照片将所有内容汇总在一起,以便用户查看。谷歌将于今年夏天推出 Ask Photos 功能,并且还将推出更多功能。

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

新一代开源大模型 Gemma 2

今天,谷歌还发布了开源大模型 Gemma 的一系列更新 ——Gemma 2 来了。 

据介绍,Gemma 2 采用全新架构,旨在实现突破性的性能和效率,新开源的模型参数为 27B。

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

此外,Gemma 家族也在随着 PaliGemma 的扩展而扩展,PaliGemma 是谷歌受 PaLI-3 启发的第一个视觉语言模型。

通用 AI 智能体 Project Astra

一直以来,智能体都是 Google DeepMind 的重点研究方向。

昨天,我们围观了 OpenAI 的 GPT-4o,为其强大的实时语音、视频交互能力所震撼。

今天,DeepMind 的视觉与语音交互通用 AI 智能体项目 Project Astra 亮相,这是 Google DeepMind 对未来 AI 助手的一个展望。

谷歌表示,为了真正发挥作用,智能体需要像人类一样理解和响应复杂、动态的真实世界,也需要吸收并记住所看到和听到的内容,以了解上下文并采取行动。此外,智能体还需要具有主动性、可教育和个性化,以便用户可以自然地与它交谈,没有滞后或延迟。

在过去的几年里,谷歌一直致力于改进模型的感知、推理和对话方式,以使交互的速度和质量更加自然。

在今天的 Keynote 中, Google DeepMind 展示了 Project Astra 的交互能力:

据介绍,谷歌是在 Gemini 的基础上开发了智能体原型,它可以通过连续编码视频帧、将视频和语音输入组合到事件时间线中并缓存此信息以进行有效调用,从而更快地处理信息。

通过语音模型,谷歌还强化了智能体的发音,为智能体提供了更广泛的语调。这些智能体可以更好地理解他们所使用的上下文,并在对话中快速做出响应。

这里简单评论一下。机器之心感觉 Project Astra 项目发布的 Demo,在交互体验上要比 GPT-4o 实时演示的能力要差许多。无论是响应的时长、语音的情感丰富度、可打断等方面,GPT-4o 的交互体验似乎更自然。不知道读者们感觉如何?

反击 Sora:发布视频生成模型 Veo

在 AI 生成视频方面,谷歌宣布推出视频生成模型 Veo。Veo 能够生成各种风格的高质量 1080p 分辨率视频,时长可以超过一分钟。

凭借对自然语言和视觉语义的深入理解,Veo 模型在理解视频内容、渲染高清图像、模拟物理原理等方面都有所突破。Veo 生成的视频能够准确、细致地表达用户的创作意图。

例如,输入文本 prompt:

Many spotted jellyfish pulsating under water. Their bodies are transparent and glowing in deep ocean.

(许多斑点水母在水下搏动。它们的身体透明,在深海中闪闪发光。)

再比如生成人物视频,输入 prompt:

A lone cowboy rides his horse across an open plain at beautiful sunset, soft light, warm colors.

(在美丽的日落、柔和的光线、温暖的色彩下,一个孤独的牛仔骑着马穿过开阔的平原。)

近景人物视频,输入 prompt:

A woman sitting alone in a dimly lit cafe, a half-finished novel open in front of her. Film noir aesthetic, mysterious atmosphere. Black and white.

(一个女人独自坐在灯光昏暗的咖啡馆里,一本未完成的小说摊在她面前。黑色电影唯美,神秘气氛。黑白。)

值得注意的是,Veo 模型提供了前所未有的创意控制水平,并理解「延时拍摄」、「航拍」等电影术语,使视频连贯、逼真。

例如电影级海岸线航拍镜头,输入 prompt:

Drone shot along the Hawaii jungle coastline, sunny day

(无人机沿夏威夷丛林海岸线拍摄,阳光明媚的日子)

Veo 还支持以图像和文本一起作为 prompt,来生成视频。通过提供参考图像与文本提示,Veo 生成的视频会遵循图像风格和用户文本说明。

有趣的是,谷歌发布的 demo 是 Veo 生成的「羊驼」视频,很容易让人联想到 Meta 的开源系列模型 Llama。

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

在长视频方面,Veo 能够制作 60 秒甚至更长的视频。它可以通过单个 prompt 来完成此操作,也可以通过提供一系列 prompt 来完成此操作,这些 prompt 一起讲述一个故事。这一点对视频生成模型应用于影视制作非常关键。

Veo 以谷歌的视觉内容生成工作为基础,包括生成式查询网络 (GQN)、DVD-GAN、Imagen-Video、Phenaki、WALT、VideoPoet、Lumiere 等。

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

从今天开始,谷歌会为一些创作者在 VideoFX 中提供预览版 Veo,创作者可以加入谷歌的 waitlist。谷歌还将把 Veo 的一些功能引入 YouTube Shorts 等产品。

文生图新模型 Imagen 3

在文本到图像生成方面,谷歌再次升级了系列模型 —— 发布 Imagen 3。

Imagen 3 在生成细节、光照、干扰等方面进行了优化升级,并且理解 prompt 的能力显著增强。

为了帮助 Imagen 3 从较长的 prompt 中捕捉细节,例如特定的摄像机角度或构图,谷歌在训练数据中每个图像的标题中添加了更丰富的细节。

例如,在输入 prompt 中添加「在前景中略微虚焦」、「温暖光线」等,Imagen 3 就可以按照要求生成图像:

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

此外,谷歌特别针对图像生成中「文字模糊」的问题进行了改进,即优化了图像渲染,使生成图像中文字清晰并风格化。

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

为了提高可用性,Imagen 3 将提供多个版本,每个版本都针对不同类型的任务进行了优化。

从今天开始,谷歌为一些创作者在 ImageFX 中提供 Imagen 3 预览版,用户可以注册加入 waitlist。

第六代 TPU 芯片 Trillium

生成式 AI 正在改变人类与技术交互的方式,同时为企业带来巨大的增效机会。但这些进步需要更多的计算、内存和通信能力,以训练和微调功能最强大的模型。

为此,谷歌推出第六代 TPU Trillium,这是迄今为止性能最强大、能效最高的 TPU,将于 2024 年底正式上市。

TPU Trillium 是一种高度定制化的 AI 专用硬件,此次 Google I/O 大会上宣布的多项创新,包括 Gemini 1.5 Flash、Imagen 3 和 Gemma 2 等新模型,均在 TPU 上进行训练并使用 TPU 提供服务。

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

据介绍,与 TPU v5e 相比,Trillium TPU 的每芯片峰值计算性能提高了 4.7 倍,同时它还把高带宽内存(HBM)以及芯片间互连(ICI)带宽加倍。此外,Trillium 配备了第三代 SparseCore,专门用于处理高级排名和推荐工作负载中常见的超大型嵌入。

谷歌表示,Trillium 能够以更快的速度训练新一代 AI 模型,同时减少延迟和降低成本。此外,Trillium 还被称为迄今为止谷歌最具可持续性的 TPU,与其前代产品相比,能效提高了超过 67%。

Trillium 可以在单个高带宽、低延迟的计算集群(pod)中扩展到多达 256 个 TPU(张量处理单元)。除了这种集群级别的扩展能力之外,通过多片技术(multislice technology)和智能处理单元(Titanium Intelligence Processing Units,IPUs),Trillium TPU 可以扩展到数百个集群,连接成千上万的芯片,形成一个由每秒数 PB(multi-petabit-per-second)数据中心网络互联的超级计算机。

谷歌早在 2013 年就推出了首款 TPU v1,随后在 2017 年推出了云 TPU,这些 TPU 一直在为实时语音搜索、照片对象识别、语言翻译等各种服务提供支持,甚至为自动驾驶汽车公司 Nuro 等产品提供技术动力。

Trillium 也是谷歌 AI Hypercomputer 的一部分,这是一种开创性的超级计算架构,专为处理尖端的 AI 工作负载而设计。谷歌正在与 Hugging Face 合作,优化开源模型训练和服务的硬件。

谷歌反击:Project Astra正面硬刚GPT-4o Veo对抗Sora

以上,就是今天谷歌 I/O 大会的所有重点内容了。可以看出,谷歌在大模型技术与产品方面与 OpenAI 展开了全面竞争的态势。而通过这两天 OpenAI 与谷歌的发布,我们也能发现大模型竞争进入了到了一个新的阶段:多模态、更自然地交互体验成为了大模型技术产品化并为更多人所接受的关键。

期待 2024 年,大模型技术与产品创新,能为我们带来更多的惊喜。

发表在 比特币交易平台 | 留下评论

Google“反击战” 一夜放出近10款模型

作者:屠敏,CSDN

今年的 5 月宛如梦回 2023 年的 3 月,一场场热闹的 AI 盛宴相继开席。

不过,不知是有意还是无意,去年 3 月,Google 选择开放大语言模型 PaLM API 之际,几乎在同一时间 OpenAI 释出最强模型 GPT-4 惊艳四座,此外仅时隔几天后,微软又在一场发布会上官宣自家 Office 全家桶被 GPT-4 革新,导致 Google 似乎成为被众人忽视的存在。

些许尴尬的是,今年同样的情形似乎正在上演,一方面 OpenAI 于昨日凌晨带来了全面升级的旗舰级 GPT4o 作为本月 AI 小春晚的开场,另一方面微软将于下周召开 Bulid 2024,那么,这一次再次遭到夹击的 Google 能否逆风翻了其两家“组的局”,我们将从今日凌晨开幕的 I/O 2024 开发者大会中窥见一斑。

今年的 I/O 大会也是 Google 旗帜鲜明地推行“AI First”战略的第八个年头。

01 亮点抢先看

正如此前所料,在这场时长近 2 小时的 Keynote 上,「AI」是贯穿 I/O 大会全场的关键词,只是没想到的是,它被提及的次数能高达 121 次,也不难看出 Google 对 AI 的焦虑了。

Google“反击战” 一夜放出近10款模型

面对外部来势汹汹的竞争对手,Google CEO Sundar Pichai(桑达尔·皮查伊)近日在做客一档节目时表示,「AI 目前还处于发展的早期阶段,相信谷歌最终将赢得这场战争,正如谷歌当初并不是第一家做搜索的公司」。

在 I/O 发布会现场,Sundar Pichai 同样强调了这一点,「我们仍处于人工智能平台转变的早期阶段。对于创作者、开发者、初创公司和每个人来说,我们看到了巨大的机遇。」

Sundar Pichai 表示,去年发布 Gemini(双子座)时,它的定位便是多模态的大模型,可以跨文本、图像、视频、代码等进行推理。今年 2 月,Google 发布了 Gemini 1.5 Pro,在长文本方面实现了突破,将上下文窗口长度扩展到 100 万个 tokens,比任何其他大规模基础模型都要多。如今,超过 150 万的开发者在 Google 工具中使用 Gemini 模型。

在发布会上,Sundar Pichi 分享了 Google 内部的最新的进展:

  • Gemini 应用程序现在已上线 Android 和 iOS 系统。通过 Gemini Advanced,用户可以访问 Google 最强大的模型。

  • Google 将向全球所有开发者推出 Gemini 1.5 Pro 的改进版本。此外,今天拥有 100 万个 token 上下文的 Gemini 1.5 Pro 现在可以直接在 Gemini Advanced 中供消费者使用,它可以跨 35 种语言使用。

  • Google 将 Gemini 1.5 Pro 上下文窗口扩展到了 200 万个 tokens,并以私人预览版的形式提供给开发人员。

  • 虽然我们还处于 Agent 的早期阶段,但是 Google 已经开始先行探索,尝试了 Project Astra,通过智能手机摄像头分析世界,识别及解释代码、帮助人类寻找眼镜、还能辨别声音…

  • 比 Gemini 1.5 Pro 更轻量级的 Gemini 1.5 Flash 发布,针对低延迟和成本等重要的任务进行了优化。

  • 可制作“高质量” 1080p 视频的 Veo 模型和文本生成图像模型 Imagen 3 发布;

  • 采用全新架构、27B 大小尺寸的 Gemma 2.0 来了;

  • Android,第一个包含内置设备基础模型的移动操作系统,深度集成了 Gemini 模型,成为以 Google AI 为核心的操作系统;

  • 第六代 TPU Trillium 发布,与上一代 TPU v5e 相比,每个芯片的计算性能提高了 4.7 倍。

02 Google “杀疯了”,多款模型齐发

都说做大模型的很“卷”,没想到在加速赶超的路途中,Google 的“卷”远超乎想象。在发布会上,Google 不仅对过往的大模型进行了升级,还发布了多款新模型。

Gemini 1.5 Pro 升级更新

去年发布 Gemini(双子座)时,Google 对它的定位便是多模态的大模型,可以跨文本、图像、视频、代码等进行推理。今年 2 月,Google 发布了 Gemini 1.5 Pro,在长文本方面实现了突破,将上下文窗口长度扩展到 100 万个 tokens,比任何其他大规模基础模型都要多。

发布会上,Google 首先对 Gemini 1.5 Pro 一些关键用例进行了质量改进,例如翻译、编码、推理等,可以处理更广泛、更复杂的任务。1.5 Pro 现在可以遵循一些复杂和细致的指令,包括指定涉及角色、格式和风格的产品级行为的指令。也可以让用户能够通过设置系统指令来控制模型行为。

同时,Google 在 Gemini API 和 Google AI Studio 中添加了音频理解,因此 1.5 Pro 现在可以对 Google AI Studio 中上传的视频的图像和音频进行推理。

更值得注意的是,如果说 100 万 token 的上下文已经足够长了,就在今天,Google 进一步拓展它的能力,将上下文窗口扩展到 200 万个 token,并以私人预览版的形式提供给开发人员,这意味着其朝着无限上下文的最终目标迈出了下一步。

Google“反击战” 一夜放出近10款模型

要访问具有 200 万 token 上下文窗口的 1.5 Pro,需要加入 Google AI Studio或适用于 Google Cloud 客户的 Vertex AI 中的候补名单。

更轻量级的新模型 Gemini 1.5 Flash

Gemini 1.5 Flash,这是一款专为扩展而打造的轻量级型号,也是 API 中速度最快的 Gemini 型号。它针对低延迟和成本最重要的任务进行了优化,服务成本效益更高,并具有突破性的长上下文窗口。

Google“反击战” 一夜放出近10款模型

虽然它比 1.5 Pro 模型重量更轻,但能在海量信息中进行多模态推理。默认情况下,Flash 也是具有 100 万个 token 上下文窗口,这意味着你可以处理一小时的视频、11 小时的音频、超过 30,000 行代码的代码库或超过 700,000 个单词。

Gemini 1.5 Flash 擅长做摘要、聊天、图像和视频字幕、从长文档和表格中提取数据等。这是因为 1.5 Pro 通过一个名为“distillation”(蒸馏)的过程对其进行了训练,将较大模型中最重要的知识和技能转移到更小、更高效的模型中。

Google“反击战” 一夜放出近10款模型

Gemini 1.5 Flash 的价格定为每 100 万个token 35 美分,这比 GPT-4o 的每 100 万个token 5 美元的价格要便宜一些。

Gemini 1.5 Pro 和 1.5 Flash 均已推出公共预览版,并在 Google AI Studio 和 Vertex AI 中提供。

Google 第一个视觉语言开放模型 PaliGemma 现已推出

PaliGemma 是一个功能强大的开放式 VLM(视觉语言模型),灵感来自 PaLI-3。PaliGemma 基于 SigLIP 视觉模型和 Gemma 语言模型等开放组件构建,旨在在各种视觉语言任务上实现一流的微调性能。这包括图像和短视频字幕、视觉问答、理解图像中的文本、对象检测和对象分割。

Google 表示,为了促进开放探索和研究,PaliGemma 可通过各种平台和资源获得,你可以在 GitHub、Hugging Face 模型、Kaggle、Vertex AI Model Garden 和 ai.nvidia.com(使用 TensoRT-LLM 加速)上找到 PaliGemma,并通过 JAX 和 Hugging Face Transformers  轻松集成。

Gemma 2 发布

全部发布 Gemma 2 将提供新尺寸,并采用专为突破性性能和效率而设计的全新架构。Gemma 2 具有 270 亿个参数,其性能可与 Llama 3 70B 相媲美,但尺寸却只有 Llama 3 70B 的一半。

Google“反击战” 一夜放出近10款模型

据 Google 透露,Gemma 2 的高效设计使其所需的计算量少于同类模型的一半。27B 模型经过优化,可以在 NVIDIA 的 GPU 上运行,也可以在 Vertex AI 中的单个 TPU 主机上高效运行,从而使更广泛的用户更易于部署且更具成本效益。

Google“反击战” 一夜放出近10款模型

Google“反击战” 一夜放出近10款模型

Gemma 2 将于 6 月推出。

Veo:最新、最先进的视频生成模型

可以视为对标 OpenAI 的 Sora,Google 在今天推出了视频生成模型 Veo,它可以生成各种电影和视觉风格的高质量 1080p 分辨率视频,时间可以超过一分钟。

Veo 以 Google 多年的生成视频模型工作为基础,包括生成查询网络(GQN)、DVD-GAN、Imagen-Video、Phenaki、WALT、VideoPoet 和 Lumiere,结合架构、缩放法则和其他技术来提高质量和输出分辨率。

从今天开始,用户可以加入候补名单,申请使用 Veo。

Imagen 3:高质量的文本到图像模型

与 Google 之前的模型相比,最新发布的 Imagen 3 分散注意力的视觉伪影要少得多,它可以更好地理解自然语言、提示背后的意图,并融合较长提示中的小细节。

Google“反击战” 一夜放出近10款模型

从今天开始,Imagen 3 可供选择的创作者在 ImageFX 中进行私人预览,并加入候补名单。Imagen 3 即将推出 Vertex AI。

未来畅想:通用 AI 代理 Project Astra

所谓 Agent,是指具有推理、计划和记忆能力的智能系统,它们能够提前“思考”多个步骤,并跨软件和系统工作。

在今天发布会上,Google DeepMind CEO、联合创始人 Demis Harbis 透露,Google 内部一直在致力于开发对日常生活有帮助的通用 AI Agent,Project Astra(高级视觉和说话响应代理)便是主要的尝试之一。

这个项目是在 Gemini 的基础上,Google 开发了原型代理,可以通过连续编码视频帧、将视频和语音输入组合到事件时间线中并缓存此信息以进行有效调用,从而更快地处理信息。

通过利用语音模型,Google 还增强了它们的发音,为代理提供了更广泛的语调。这些代理可以更好地理解他们所使用的上下文,并在对话中快速做出响应。

在发布会上演示的示例中,通过 Project Astra,可以自动识别出现实场景中发出声响的东西、甚至可以直接定位到发出声音的具体部件、也能解释电脑屏幕上出现代码的作用、还可以帮助人类找到眼镜等等。

”有了这样的技术,我们很容易想象未来人们可以通过手机或眼镜设备拥有专业的人工智能助手。其中一些功能将于今年晚些时候出现在 Google 产品中“,Google 表示。

03 Gemini Advanced 升级,可定制 Gemini

现如今,改进之后的 Gemini 1.5 Pro 引入了 Gemini Advanced 订阅中,面向全球所有开发者推出 Gemini 1.5 Pro 的改进版本,它可以跨 35 种语言使用。

如上文所述默认情况下,Gemini 1.5 Pro 拥有 100 万 token 上下文,这么长的上下文窗口意味着 Gemini Advanced 这可以理解多个大型文档,预计总共最多 1,500 页,或总结 100 封电子邮件,处理一小时的视频内容或超过 30,000 行的代码库。

借助 Google Drive 或直接从设备上传文件的功能,Google 透露,很快,Gemini Advanced 将充当数据分析师,从上传的数据文件(如电子表格)中发现见解并动态构建自定义可视化和图表。

Google“反击战” 一夜放出近10款模型

为了获得更加个性化的体验,Gemini Advanced 订阅者很快就能创建 Gems——Gemini 的定制版本。你可以创建任何你想要创建的 Gem,如健身伙伴、副主厨、编码伙伴或创意写作指南。只需描述你希望 Gem 做什么以及你希望它如何响应,例如“你是我的跑步教练,给我一个每日跑步计划,并保持积极、乐观和激励。” Gemini 将接受这些说明,只需单击一下即可增强它们,以创建满足特定需求的 Gem。

Google“反击战” 一夜放出近10款模型

04 用 AI 改写 Google 搜索

没有商业场景的落地应用,大模型技术的迭代似乎只是“纸上谈兵”。和 OpenAI 走的路线有所不同,Google、微软都在 AI 应用赛道上比拼速度。对于搜索起家的 Google 而言,其势必不会错过 AI 这波浪潮。

Google 副总裁、搜索主管 Liz Reid 表示,“借助生成式人工智能,搜索可以做的事情超出你的想象。因此,你可以提出任何你想到的事情或任何你需要完成的事情——从研究到计划再到集思广益——Google 将负责所有的跑腿工作。”

AI Overviews:「一次搜索,获得所有信息」

在发布会上,Google 发布了一个名为“AI 概述”(AI Overviews)的功能,做到「一次搜索,获得所有信息」。

简单来看,有时你想要快速得到答案,但没有时间将所需的所有信息拼凑在一起,如“你正在寻找一家新的瑜伽或普拉提工作室,并且想要一家受当地人欢迎、交通便利且还为新会员提供折扣的工作室”,你只需说清楚自己的需求进行一次搜索,AI Overviews 会给出解决复杂问题的答案。

Google“反击战” 一夜放出近10款模型

拍摄视频,获得 AI 帮助

由于视频理解的进步,Google 也对视觉搜索功能进行了增强。可以通过 Google Lens 视频搜索,对你遇到的问题或周围看到的事物(包括运动的物体)进行拍摄,从而进行搜索得到解答,节省用文字描述不清楚造成的时间浪费和麻烦。

不过,以上两项功能目前仅对美国地区推出,后续会向更多国家推出。

除了在搜索层面,大模型的到来,也将进一步提升产品的智能性。

Ask Photos

在照片搜索应用层面上,Google 带来了一个“询问照片”(Ask Photos)功能。

可以借助 Gemini,识别照片不同背景信息,如询问:自己的女儿什么时候学会游泳的?游泳进展如何?照片将所有内容汇总在一起,帮助用户快速收集信息并解惑。

Google“反击战” 一夜放出近10款模型

这一项功能目前还没有上线,Google 称今年夏季将推出。

Gemini 1.5 Pro 引入到 Google Workspace 

Google 还将大模型集成到 Google Workspace,譬如,在 Gmail 中搜索电子邮件,通过与学校最近往来的邮件,随时了解孩子学校发生的一切情况。我们可以要求 Gemini 总结一下学校最近发来的所有电子邮件。它在后台识别相关电子邮件,甚至分析 PDF 等附件。

新增 NotebookLM 中的音频输出

NotebookLM 是 Google 在去年 7 月推出的一款AI 笔记应用 ,可围绕用户上传文档完成摘要、创建想法。

基于多模态大模型技术,Google 在该应用上新增了音频输出功能。它使用 Gemini 1.5 Pro 获取用户的源材料并生成个性化的交互式音频对话。

05 深度集成 Gemini 的 Android

用 AI 对操作系统进行升级,是微软和 Google 正在大力推进的事情。作为全球第一大移动操作系统,Android 拥有数十亿用户。Google 对此表示,已将 Gemini 模型整合到 Android 中,并引入了很多实用的 AI 功能。

Google“反击战” 一夜放出近10款模型

如通过“Circle to Search”(划圈搜索),可以使用户无需切换应用程序,使用画圈、涂鸦、点击等简单的交互方式获取更多信息,如今,Circle to Search 可以帮助学生完成作业,当学生圈出他们遇到的提示时,他们将获得解决一系列物理和数学问题的分步说明从而获得更深入的理解,而不仅仅是答案。

另外,Google 将很快在 Android 系统上更新 Gemini,方便用户在应用程序顶部调出 Gemini 的叠加层,以便以更多方式轻松使用 Gemini。

Google“反击战” 一夜放出近10款模型

「Android 是第一个包含内置设备基础模型的移动操作系统」,借助 Gemini Nano,Android 用户可以快速体验 AI 功能。Google 透露,从今年晚些时候的 Pixel 开始,其将推出最新型号 Gemini Nano 与多模态。这意味着新版 Pixel 手机不仅能够处理文本输入,还能够理解更多上下文信息,例如视觉、声音和口语。

此外,Google 在 Android 中借助 Gemini Nano 在通话过程中检测到通常与诈骗相关的对话时,提供实时警报,例如,如果有声称”银行“的人要求你紧急转账、使用礼品卡付款或要求提供卡 PIN 码或密码等个人信息(这些都是不常见的银行要求),你就会收到提醒,不过这项功能还在测试中。

Google“反击战” 一夜放出近10款模型

06 第六代 TPU Trillium

Sundar Pichai 表示,训练最先进的模型需要大量的计算能力。过去六年中,行业对 ML 计算的需求增长了 100 万倍。并且每年都会增加十倍。

为了适应 ML 计算的增长需求,其推出了第六代 TPU—— Trillium,与上一代 TPU v5e 相比,每个 Trillium 芯片的计算性能提高了 4.7 倍。为了达到这种性能水平,Google 扩大了矩阵乘法单元 (MXU)的大小并提高了时钟速度。

此外,Trillium 还配备了第三代 SparseCore,这是一种专用加速器,用于处理高级排名和推荐工作负载中常见的超大嵌入。Trillium TPU 可以更快地训练下一波基础模型,并以更少的延迟和更低的成本为这些模型提供服务。

Trillium TPU 的能效比 TPU v5e 高出 67% 以上。

据悉,Google 将于 2024 年底向其云客户提供 Trillium。

07 安全措施

除了以上模型与产品更新外,Google 在安全方面也有了最新动作,旨在放在 AI 滥用等情况。

一方面,Google 推出了一个基于 Gemini 的新模型系列,并针对学习进行了微调,发布了 LearnLM。其将研究支持的学习科学和学术原则集成到 Google 的产品中,帮助管理认知负荷并适应学习者的目标、需求和动机。

Google“反击战” 一夜放出近10款模型

另一方面,为了让知识更容易获取和消化,Google 构建了一种新的实验工具 Illuminate,它利用 Gemini 1.5 Pro 的长上下文功能将复杂的研究论文转换为简短的音频对话。Illuminate 可以在几分钟内生成由两个人工智能生成的声音组成的对话,提供对研究论文中关键见解的概述和简短讨论。

最后,Google 采用了 “人工智能辅助红队”的技术来主动测试自己的系统是否存在弱点并试图打破它们,并通过将水印工具 SynthID 扩展为两种新模式:文本和视频,使 AI 生成的内容更易于识别。

08 你如何看待 Google I/O 这场发布会?

以上便是 Google I/O 2024 Keynote 的主要内容,产品非常丰富,不过多数都需要等待。

随着这一场发布会的结束,不少专家也发表了一些看法。来自 NVIDIA 高级研究经理 Jim Fan 表示:

Google I/O。一些想法:该模型似乎是多模式输入,但不是多模式输出。Imagen-3 和 music gen 模型仍作为独立组件与双子座分离。将所有模态输入/输出原生合并是不可避免的未来趋势: 

  • 使“使用更像机器人的声音”、“说话速度提高 2 倍”、“迭代编辑此图像”和“生成一致的连环画”等任务成为可能。

  • 不会丢失跨模态边界的信息,如情感和背景声音。

  • 提供新的语境功能。你可以通过少量的示例,教模型以新颖的方式将不同的感官结合起来。

  • GPT-4o 做得并不完美,但它的形式因素是正确的。用 Andrej 的 LLM-as-OS 比喻:我们需要模型原生支持尽可能多的文件扩展名。

  • 谷歌正在做的一件事是正确的:他们终于在认真努力地将人工智能整合到搜索框中。我感觉到了 Agent 流:规划、实时浏览和多模态输入,所有这些都来自登录页面。谷歌最强大的护城河是分销。Gemini 不一定要成为最好的模型,也可以成为世界上最常用的模型。

AI 著名学者吴恩达表示,“祝贺我所有的 Google 朋友在 I/O 上发布了很酷的公告!我个人期待 Gemini 拥有 200 万个 token 输入上下文窗口以及对设备上 AI 的更好支持——应该会为应用程序构建者带来新的机会!”

Google“反击战” 一夜放出近10款模型

发表在 比特币交易平台 | 留下评论