音视频技术开发周刊 | 315

近期，神经场（Neural Fields）领域的巨大进展，已经显著推动了神经场景表示和神经渲染的发展。为了提高3D场景的计算效率和渲染质量，一个常见的范式是将3D坐标系统映射到另一种测量系统，例如2D流形和哈希表，以建模神经场。本文将这种坐标或者测量系统的转换定义为“规范变换”（gauge transformation）。这种规范变换通常采用预定义的函数，例如EG3D中的垂直投影和Instant-NGP中的空间哈希函数。然而，这种预先定义的函数往往并非最优选择，所以一个很自然的问题浮现出来：是否能以端到端的方式直接学习规范变换，让它与神经场一同进行优化？本研究将此问题拓展为一个广义的范式，包括连续型和离散型规范变换，并设计了统一的学习框架以共同优化规范变换和神经场。

威斯康星大学发布|利用瞬态直方图释放接近传感器的性能

本文提供了利用一类近距离飞行时间 (ToF) 距离传感器捕获的瞬态直方图来恢复平面场景几何形状的方法。瞬态直方图是一维时间波形，对入射到 ToF 传感器上的光子的到达时间进行编码。通常，传感器使用专有算法处理瞬态直方图以产生距离估计，这通常用于多种机器人应用。

巴斯大学发布：运动目标轨迹预测的视觉SLAM

视觉同时定位与建图( Simultaneous Localization and Mapping，SLAM )由于能够单独使用视觉数据估计相机轨迹并创建环境地图，近年来受到了极大的关注，为自动驾驶应用做出了巨大贡献，特别是在有移动人群和车辆的现实场景中。在这项工作中，本文提出了一个融合移动对象轨迹跟踪和预测的视觉SLAM系统。

独家：国产“Vision Pro”来袭，头显的Turn-key时刻即将到来？

随着Vision Pro的发布，市场上最为兴奋的或许有两拨人：一波是VR/AR从业者以及发烧友，另外还有一波则是摩拳擦掌随时准备对产品进行开模打样的“华强北们”。

微信内测版适配Vision Pro；Meta推出企业级头显服务

据 IT 之家消息，10 月 8 日微信发布了 iOS 8.0.43 内测版更新，虽仅显示“bug fixed”看似微不足道的更新，但其内部却包含了不少界面的调整和细节优化。

升级混合现实体验！Meta Quest 3 MR功能的方方面面

随着Meta Connect大会的召开，下一代头显Quest 3也已经确定将于10月10日正式发布，定价499美元起。除了性能上的升级以外，混合现实是官方反复重点强调的功能，它可以令虚拟内容与物理世界无缝融合，同时让用户以丰富的色彩自然直观地观看和交互。

VoiceFlow:高效的文本到语音与纠偏匹配

Rectified Flow Matching 语音合成，上海交大开源。

https://arxiv.org/abs/2309.05027

NeurIPS 2023丨说话人识别：语音解耦与自监督

该研究由新加坡国家科技局（A⋆STAR）、新加坡国立大学、香港理工大学和香港中文大学（深圳）的研究人员共同完成。该项工作已被NeurIPS 2023（main track）接收。

单通道语音唤醒与语音增强结合时的性能变化

单通道语音唤醒常应用于TWS耳机、智能手表等边缘设备上，作为语音助手的“守门员”。各信噪比下的唤醒率、每日误唤醒、唤醒延迟、模型参/算量是衡量语音唤醒算法性能的若干关键指标。低信噪比下唤醒率低，一直是语音唤醒的应用痛点和技术难点。

专业音视频领域中，Pro AV的崛起之路

在技术进步的加持下，AV行业发展得如何了？本文采访了两位深耕于广播电视行业的技术人，为我们介绍了专业音视频的进展：一位冉冉升起的新星：Pro AV以及FPGA在其中发挥的作用。

自适应流媒体智能传输优化研究

在视频流量爆发式增长的当下，面对多用户多场景的网络挑战，如何降低卡顿、提升用户体验是流媒体传输研究的关键。LiveVideoStackCon 2023上海站邀请到了清华大学博士黄天驰，为大家分享自适应流媒体智能传输优化研究进展。

云化XR和沉浸式全息交互技术的探索与思考

计算机图形与仿真技术的发展为人类带来了众多的沉浸式技术。虚拟现实（VR）、增强现实（AR）、混合现实（MR）等技术通过不同程度数字信息与现实环境的融合，为用户带来了全新体验，而统括三者的扩展现实（XR）更强调虚拟世界与现实世界的弥合，缩小人们、信息和体验之间的距离壁垒。LiveVideoStackCon 2023 上海站邀请了来自北京邮电大学的黄亚坤，为大家分享学术界关于云化XR和沉浸式全息交互技术的探索与思考。

深度神经网络压缩与加速技术

深度神经网络是深度学习的一种框架，它是一种具备至少一个隐层的神经网络。与浅层神经网络类似，深度神经网络也能够为复杂非线性系统提供建模，但多出的层次为模型提供了更高的抽象层次，因而提高了模型的能力。深度神经网络是一种判别模型，可以使用反向传播算法进行训练。随着深度神经网络使用的越来越多，相应的压缩和加速技术也孕育而生。LiveVideoStackCon 2023上海站邀请到了胡浩基教授为我们分享他们实验室的一些实践。

挑战十万在播--直播全量在播分发系统

先说明下什么叫“全量在播”，指的是直播范围内，当前所有在线主播的信息，尤其是主播的房间id和uid，对于很多上游业务来说，是必要的数据，是业务逻辑的数据基础。直播之前虽然有一套这样的系统，但是从目前运行状态看并不能面向更高体量业务支撑，而且线上也因为这种过时的在播架构工作异常发生过几次线上事故。所以正如一本书所讲，如果不杀死任何系统，你会被僵尸包围。对于这种遗留系统需要做面向未来目标的设计。

75岁Hinton再次警告：AI可能会接管人类！

最近，Hinton在采访中谈论了人工智能存在的各种安全隐患，担忧人类将会被其接管。

【行业分析】中美半导体产业脱钩趋势下的影响研判和应对建议

半导体产业链供应链博弈正在成为中美竞争博弈的主战场，美国加速对华脱钩、重振自身半导体产业的战略轮廓逐渐清晰，同时美国对华实施以半导体为核心的科技战将呈现长期性、谋划性和加剧性的发展趋势。为此，中国必须做好打“持久战”的战略准备。本文将主要分析当前美方强推对华半导体“断链脱钩”的主要态势，研判其对全球半导体产业、技术创新、景气周期、区域布局等多个维度产生的变化和影响，并从加强保供韧链、加快创新提级、加速市场共享、加紧造船出海等四方面对我国半导体产业提出应对建议。

联丰迅声完成千万元Pre-A+轮融资

西安联丰迅声信息科技有限责任公司（以下简称“联丰迅声”）宣布完成千万级Pre-A+轮融资，本轮领投方为西安市人才基金。本轮融资资金将主要用于新产品技术研发、国内外销售团队扩充，以及生产测试线的建立等业务方向。

从ToC到ToB，MR头显Lynx-R1提价450美元至1300美元

随着目标市场的再次转变，法国硬件初创公司Lynx宣布MR头显R1将从原来的850美元提高到1300美元。

2023年9月半导体行业媒体传播报告：创芯片行业年内全球最大规模IPO，Arm纳斯达克上市！

国内方面，中国企业在光通信和存储芯片等领域份额上升，显示行业正稳步发展，但也面临产能过剩和价格战压力，企业致力产业升级。

时隔四年再次相聚，机会难得，不容错过。
11月24日至25日，LiveVideoStackCon 2023深圳站，期待与您共享此次音视频技术盛会，抓紧报名啦！

时间：2023年11月24日-25日
●地点：深圳圣淘沙酒店（翡翠店）
●咨询：13520771810（微信同号）了解详情。
●官方链接：https://sz2023.livevideostack.com/topics