Token:为什么长对话有边界?
把一段任务说明压缩成关键条件。
今天看懂一件事
模型处理文本时使用 token,它不严格等于一个字或一个单词。
- 长说明
- 关键条件
- 检查遗漏
再多理解一点
把 token 理解为文本处理的小片段即可。今天不用精确数 token,重点是删掉重复话,同时留下会影响结果的条件。
2 分钟练习
检查压缩后是否仍保留“不讲代码”和“时间未定”。
请把以下任务说明整理成 5 条:目标、受众、限制、已确定事项、未知事项。不要删掉否定条件。说明:活动面向新手,不讲代码,周六线上,具体时间未定。
检查一下理解
删掉一半字数,就一定只用了原来一半 token 吗?
先想一想,再看解析
不一定。分词方式与文字有关,字数只能粗略帮助控制长度。
还有时间?加一个 5 分钟挑战
压缩背景到三句,检查是否丢掉否定条件。
今天记住:模型处理文本时使用 token,它不严格等于一个字或一个单词。
参考阅读:官方课程与文档 ↗ · 图解与练习由智栗原创