rust 中的 DST 和 ZST

本贴最后更新于 2086 天前,其中的信息可能已经沧海桑田

类型的大小在 Rust 中很重要,Sized trait 是 std::marker 模块中的四大特殊 trait 之一。本文主要介绍 DST 和 ZST。

DST

DST 是 Dynamic Sized Type 的缩写,意思是动态大小类型,表示在编译阶段无法确定大小的类型。在讲这种类型之前,我们先从数组开始谈起。

数组是一个容器,它在一块连续内存空间中,存储了一系列的同样类型的数据。数组中的元素的占用空间大小必须是编译期确定的,数组本身所容纳的元素个数也必须是编译期确定的。如果需要使用变长的容器,可以使用标准库中的 Vec / LinkedList 等,原始数组类型是不支持动态改变大小的。数组类型的表示方式为[T; n],T 代表元素类型,n 代表元素个数。中间用分号隔开。在 Rust 中,对于两个数组类型,只有元素类型和元素个数都完全相同,这两个数组才是同类型的。示例如下:

fn  modify_array(mut arr: [i32; 5]) {    
	arr[0] = 100;

   println!("modified array {:?}", arr); 
 }
   
   fn  main() {

	 let xs: [i32; 5] = [1, 2, 3, 4, 5];    modify_array(xs);

	 println!("origin array {:?}", xs);
   }

编译执行,结果为:

modified array [100, 2, 3, 4, 5] origin array [1, 2, 3, 4, 5]

我们可以看到,把数组 xs 作为参数传给一个函数,这个数组并不会退化成一个指针,而是会将这个数组完整拷贝进入这个函数。函数体内对数组的改动,不会影响到外面的数组。

如果我们把数组的长度改变一下,会发现 [i32; 4] 类型的数组和 [i32; 5] 类型的数组是不同的类型,不能赋值。

数组切片

对数组取 borrow 操作,可以生成一个“数组切片(Slice)”。数组切片对数组没有“所有权”,我们可以把数组切片看做是专门用于指向数组的指针,是对数组的另外一个“视图”。比如,我们有一个数组[T; n],它的借用指针的类型就是&[T; n]。它可以通过编译器内部魔法,转换为数组切片类型&[T]。数组切片实质上还是指针,它不过是在类型系统中丢弃了编译阶段定长数组类型的长度信息,而将此长度信息存储为运行期的值。示例如下:

// 注意参数类型

fn  mut_array(a : &mut [i32]) {    a[2] = 5;

   println!("len {}", a.len()); }

   

fn  main() {

   let  mut v :  [i32; 3] = [1,2,3];   
   {

       let s : &mut [i32; 3] = &mut v;        mut_array(s);   
	}

   println!("{:?}", v);
  }

变量 v 是[i32; 3]类型,变量 s 是&mut; [i32; 3]类型。它可以自动转换为&mut; [i32]数组切片类型传入函数 mut_array。在函数内部,通过这个指针,修改了外部的数组 v 的值。而且我们可以看到,这个 &mut; [i32] 类型的指针,它不仅包含了指向数组的地址信息,还包含了指向数组的长度信息。

那它是怎么实现的呢?原因就在于 &mut; [i32; 3] 和 &mut; [i32] 的内部表示是有区别的。&mut; [i32; 3] 这种指针,就是普通指针,数组长度信息是编译期确定的。&mut; [i32] 这种指针,是“胖指针(fat pointer)”,它既可以指向 [i32; 3],也可以指向 [i32; 4],还能指向一个数组的某一个部分。示例如下:

use std::mem::transmute;

use std::mem::size_of;

fn  main() {

   println!("{:?}", size_of::<&[i32; 3]>());

   println!("{:?}", size_of::<&[i32]>());

   let v : [i32; 5] = [1,2,3,4,5];

   let p : &[i32] = &v;[2..4];

   unsafe {

       let (ptr, len) : (usize, isize) = transmute(p);

       println!("{} {}", ptr, len);

       let ptr = ptr as *const  i32;

       for i in  0..len {

           println!("{}", *ptr.offset(i));        
	    }    
	} 
		
}

由此可见,对于 &[i32] 型指针,它是普通指针大小的两倍,这也是为什么它叫做“胖指针”的原因。它里面同时存储了所指向的地址,以及长度信息。所以它避免了 C/C++ 里面出现的,数组作为函数参数的时候,退化为裸指针的问题。

Sized

为什么 Rust 编译器会把 &[i32] 这种类型的指针当成胖指针处理呢?因为在 Rust 眼里,[i32]也是一个合理的类型。它代表由 i32 类型组成的数组,然而长度在编译阶段不确定。对于编译阶段大小不定的类型,Rust 将其称之为 Dynamic Sized Type。我们不能直接声明 DST 类型的变量绑定,因为编译器根本没办法知道,怎么为它分配内存。但是,指向这种类型的指针是可以存在的,因为指针的大小是固定的。

Rust 中有一个重要的 trait Sized,可以用于区分一个类型是不是 DST。所有的 DST 类型都不满足 Sized 约束。我们可以在泛型约束中使用 Sized、!Sized、?Sized 三种写法。其中 T:Sized 代表类型必须是编译期确定大小的,T:!Sized 代表类型必须是编译期不确定大小的,T:?Sized 代表以上两种情况都可以。在泛型代码中,泛型类型参数默认携带了 Sized 约束,因为这是最普遍最常见的情况。如果我们希望这个泛型参数也可以支持 DST 类型,那么就应该为它专门加上 ?Sized 约束,示例如下:

use std::fmt::Debug;

fn  call(p : &T;)

   where T:Debug {

   println!("{}", p); }

fn  main() {

   let x : &[i32] = &[1,2,3,4];    call(x); }

以上写法,等同于默认有一个 T:Sized 约束。当参数是 &[i32] 类型的时候,编译器推理出来泛型参数是 [i32],不符合 Sized 约束,就会报错。修复方案是,加上 T: ?Sized 约束:

use std::fmt::Debug;

fn  call(p : &T;)

   where T: Debug {

   println!("{:?}", p); }

fn  main() {

   let x : &[i32] = &[1,2,3,4];    call(x); 
 }

如果我没记错的话,这个 ?Sized 表示法,是知乎网友 @Liigo 提出来的建议。

直接在语言中加入对 DST 的支持是有好处的。虽然这种类型无法直接实例化,但是可以被用在 impl 块,以及泛型代码中。比如,我们可以为 [i32] 类型 impl 一个 trait。再比如, Rc<[i32]> 也是一个合法的类型。我们为 [i32] 类型添加的方法,自然而然就可以被 Rc<[i32]> 使用。

Rust 中的 str 类型也是一种典型的 DST 类型。它跟不定长数组是一样的,它内部就是一个 u8 类型的不定长数组。&str;也是一个胖指针,跟数组切片一模一样。还有一种常见的 DST 类型就是 trait。trait 仅仅规定了类型需要实现的方法,而对具体类型的大小没有限制,因此实现同一个 trait 的具体类型大小是不定的,所以我们不能直接声明 trait 类型的变量。同理,把 trait 放到指针后面是合法的。此时,指针也是胖指针,其中包含了指向真实数据结构的指针以及指向虚函数表的 vtable 指针。这种胖指针,也叫做 trait object,在后面讲解泛型和动态分派的时候再详细介绍。

DST 的故事到现在为止还没有结束。目前编译器只支持上面介绍的这几种固定的 DST 及其对应的胖指针类型。按照 Rust 设计者的想法,用户应该有权自定义自己的 DST 类型以及各种智能指针类型。只不过这些问题目前不是很紧急,以后再来慢慢设计。

ZST

Rust 还支持 0 大小类型(Zero Sized Type)。比如,在前面的文章中提到过的 () 类型和空结构体类型,都是 0 大小类型。示例如下:

use std::mem::size_of;

fn  main() {

   println!("{}", size_of::<()>());

   println!("{}", size_of::<[(); 100]>());

   let boxed_unit = Box::new(());

   println!("{:p}", boxed_unit); }

执行结果为:

0 0 0x1

由此可见,unit 类型确实是 0 大小的类型,而且由它组成的数组,也是 0 大小类型。而如果我们为 0 大小的类型申请动态分配内存,我们可以得到,指针指向的地址是 1。这个 1 是怎么回事呢?

当碰到 0 大小类型需要动态分配空间的时候,在标准库里面会直接返回一个 EMPTY 出去。这个 EMPTY 定义在 liballoc/heap.rs 模块中:

/// An arbitrary non-null address to represent

/// zero-size allocations.

/// This preserves the non-null invariant for

/// types like Box. The address may overlap

/// with non-zero-size memory allocations.

pub const EMPTY: *mut () = 0x1 as *mut ();

为什么选 1 这个值呢?首先,1 不可能是内存分配器正常返回的地址,其次,0 已经用于表示空指针 null 的情况,所以选择另外一个不同的值来表示这种情况。那么这两种“空”有什么区别呢,我们继续用示例说明:

use std::mem::transmute;

fn main() {

let x : Box<()> = Box::new(());

let y : Option> = None;

let z : Option> = Some(Box::new(()));

unsafe {

 let value1 : usize = transmute(x);

 let value2 : usize = transmute(y);

 let value3 : usize = transmute(z);println!("{} {} {}", value1, value2, value3);    } }

其中的 transmute 函数是强制类型转换的作用。编译执行,结果为:“1 0 1”。所以,解释起来就是:非空指针指向 0 大小的类型,指向的是地址 1;空指针都是指向的是地址 0。

  • Rust

    Rust 是一门赋予每个人构建可靠且高效软件能力的语言。Rust 由 Mozilla 开发,最早发布于 2014 年 9 月。

    58 引用 • 22 回帖

相关帖子

欢迎来到这里!

我们正在构建一个小众社区,大家在这里相互信任,以平等 • 自由 • 奔放的价值观进行分享交流。最终,希望大家能够找到与自己志同道合的伙伴,共同成长。

注册 关于
请输入回帖内容 ...

推荐标签 标签

  • 持续集成

    持续集成(Continuous Integration)是一种软件开发实践,即团队开发成员经常集成他们的工作,通过每个成员每天至少集成一次,也就意味着每天可能会发生多次集成。每次集成都通过自动化的构建(包括编译,发布,自动化测试)来验证,从而尽早地发现集成错误。

    14 引用 • 7 回帖
  • Markdown

    Markdown 是一种轻量级标记语言,用户可使用纯文本编辑器来排版文档,最终通过 Markdown 引擎将文档转换为所需格式(比如 HTML、PDF 等)。

    165 引用 • 1471 回帖
  • V2Ray
    1 引用 • 15 回帖
  • Google

    Google(Google Inc.,NASDAQ:GOOG)是一家美国上市公司(公有股份公司),于 1998 年 9 月 7 日以私有股份公司的形式创立,设计并管理一个互联网搜索引擎。Google 公司的总部称作“Googleplex”,它位于加利福尼亚山景城。Google 目前被公认为是全球规模最大的搜索引擎,它提供了简单易用的免费服务。不作恶(Don't be evil)是谷歌公司的一项非正式的公司口号。

    49 引用 • 192 回帖
  • Java

    Java 是一种可以撰写跨平台应用软件的面向对象的程序设计语言,是由 Sun Microsystems 公司于 1995 年 5 月推出的。Java 技术具有卓越的通用性、高效性、平台移植性和安全性。

    3169 引用 • 8208 回帖
  • OkHttp

    OkHttp 是一款 HTTP & HTTP/2 客户端库,专为 Android 和 Java 应用打造。

    16 引用 • 6 回帖 • 53 关注
  • Wide

    Wide 是一款基于 Web 的 Go 语言 IDE。通过浏览器就可以进行 Go 开发,并有代码自动完成、查看表达式、编译反馈、Lint、实时结果输出等功能。

    欢迎访问我们运维的实例: https://wide.b3log.org

    30 引用 • 218 回帖 • 611 关注
  • B3log

    B3log 是一个开源组织,名字来源于“Bulletin Board Blog”缩写,目标是将独立博客与论坛结合,形成一种新的网络社区体验,详细请看 B3log 构思。目前 B3log 已经开源了多款产品:SymSoloVditor思源笔记

    1083 引用 • 3461 回帖 • 263 关注
  • H2

    H2 是一个开源的嵌入式数据库引擎,采用 Java 语言编写,不受平台的限制,同时 H2 提供了一个十分方便的 web 控制台用于操作和管理数据库内容。H2 还提供兼容模式,可以兼容一些主流的数据库,因此采用 H2 作为开发期的数据库非常方便。

    11 引用 • 54 回帖 • 650 关注
  • 导航

    各种网址链接、内容导航。

    37 引用 • 168 回帖
  • Rust

    Rust 是一门赋予每个人构建可靠且高效软件能力的语言。Rust 由 Mozilla 开发,最早发布于 2014 年 9 月。

    58 引用 • 22 回帖
  • 旅游

    希望你我能在旅途中找到人生的下一站。

    86 引用 • 896 回帖
  • 机器学习

    机器学习(Machine Learning)是一门多领域交叉学科,涉及概率论、统计学、逼近论、凸分析、算法复杂度理论等多门学科。专门研究计算机怎样模拟或实现人类的学习行为,以获取新的知识或技能,重新组织已有的知识结构使之不断改善自身的性能。

    76 引用 • 37 回帖
  • 安装

    你若安好,便是晴天。

    131 引用 • 1184 回帖
  • PWA

    PWA(Progressive Web App)是 Google 在 2015 年提出、2016 年 6 月开始推广的项目。它结合了一系列现代 Web 技术,在网页应用中实现和原生应用相近的用户体验。

    14 引用 • 69 回帖 • 140 关注
  • Python

    Python 是一种面向对象、直译式电脑编程语言,具有近二十年的发展历史,成熟且稳定。它包含了一组完善而且容易理解的标准库,能够轻松完成很多常见的任务。它的语法简捷和清晰,尽量使用无异义的英语单词,与其它大多数程序设计语言使用大括号不一样,它使用缩进来定义语句块。

    536 引用 • 672 回帖
  • ActiveMQ

    ActiveMQ 是 Apache 旗下的一款开源消息总线系统,它完整实现了 JMS 规范,是一个企业级的消息中间件。

    19 引用 • 13 回帖 • 644 关注
  • WebSocket

    WebSocket 是 HTML5 中定义的一种新协议,它实现了浏览器与服务器之间的全双工通信(full-duplex)。

    48 引用 • 206 回帖 • 383 关注
  • 房星科技

    房星网,我们不和没有钱的程序员谈理想,我们要让程序员又有理想又有钱。我们有雄厚的房地产行业线下资源,遍布昆明全城的 100 家门店、四千地产经纪人是我们坚实的后盾。

    6 引用 • 141 回帖 • 569 关注
  • jQuery

    jQuery 是一套跨浏览器的 JavaScript 库,强化 HTML 与 JavaScript 之间的操作。由 John Resig 在 2006 年 1 月的 BarCamp NYC 上释出第一个版本。全球约有 28% 的网站使用 jQuery,是非常受欢迎的 JavaScript 库。

    63 引用 • 134 回帖 • 734 关注
  • HTML

    HTML5 是 HTML 下一个的主要修订版本,现在仍处于发展阶段。广义论及 HTML5 时,实际指的是包括 HTML、CSS 和 JavaScript 在内的一套技术组合。

    103 引用 • 294 回帖 • 1 关注
  • React

    React 是 Facebook 开源的一个用于构建 UI 的 JavaScript 库。

    192 引用 • 291 回帖 • 431 关注
  • 安全

    安全永远都不是一个小问题。

    191 引用 • 813 回帖 • 1 关注
  • SpaceVim

    SpaceVim 是一个社区驱动的模块化 vim/neovim 配置集合,以模块的方式组织管理插件以
    及相关配置,为不同的语言开发量身定制了相关的开发模块,该模块提供代码自动补全,
    语法检查、格式化、调试、REPL 等特性。用户仅需载入相关语言的模块即可得到一个开箱
    即用的 Vim-IDE。

    3 引用 • 31 回帖 • 82 关注
  • Windows

    Microsoft Windows 是美国微软公司研发的一套操作系统,它问世于 1985 年,起初仅仅是 Microsoft-DOS 模拟环境,后续的系统版本由于微软不断的更新升级,不但易用,也慢慢的成为家家户户人们最喜爱的操作系统。

    215 引用 • 463 回帖
  • NGINX

    NGINX 是一个高性能的 HTTP 和反向代理服务器,也是一个 IMAP/POP3/SMTP 代理服务器。 NGINX 是由 Igor Sysoev 为俄罗斯访问量第二的 Rambler.ru 站点开发的,第一个公开版本 0.1.0 发布于 2004 年 10 月 4 日。

    311 引用 • 546 回帖 • 1 关注
  • Swagger

    Swagger 是一款非常流行的 API 开发工具,它遵循 OpenAPI Specification(这是一种通用的、和编程语言无关的 API 描述规范)。Swagger 贯穿整个 API 生命周期,如 API 的设计、编写文档、测试和部署。

    26 引用 • 35 回帖 • 11 关注