From 9b1c9371333e20611ec5422e660ebec7e66c4261 Mon Sep 17 00:00:00 2001 From: Sebastiano Tronto Date: Thu, 2 Nov 2023 22:17:14 +0100 Subject: Added avx2 moves --- src/cube.c | 49 ++++++++++++++++++++++++++++++++++++++++++++----- 1 file changed, 44 insertions(+), 5 deletions(-) (limited to 'src/cube.c') diff --git a/src/cube.c b/src/cube.c index 73f50af..401895e 100644 --- a/src/cube.c +++ b/src/cube.c @@ -269,6 +269,7 @@ static char *transstr[] = { [BLm] = "mirrored BL", }; +static inline cube_t inline_compose(cube_t, cube_t); static bool isconsistent(cube_t); static cube_t flipallcorners(cube_t); static uint8_t readco(char *); @@ -909,18 +910,49 @@ cube_t inverse(cube_t c) { /* TODO: optimize for avx2 */ - uint8_t i, piece, orien; cube_t ret; - setzero(ret); - #ifdef DEBUG if (!isconsistent(c)) { fprintf(stderr, "inverse error, inconsistent cube\n"); + setzero(ret); return ret; } #endif +#ifdef CUBE_AVX2 + /* Method taken from Andrew Skalski's vcube[1]. The addition sequence + * was generated using [2]. + * [1] https://github.com/Voltara/vcube + * [2] http://wwwhomes.uni-bielefeld.de/achim/addition_chain.html + */ + cube_t v3, vi; + + v3 = _mm256_shuffle_epi8(c, c); + v3 = _mm256_shuffle_epi8(v3, c); + vi = _mm256_shuffle_epi8(v3, v3); + vi = _mm256_shuffle_epi8(vi, vi); + vi = _mm256_shuffle_epi8(vi, vi); + vi = _mm256_shuffle_epi8(vi, v3); + vi = _mm256_shuffle_epi8(vi, vi); + vi = _mm256_shuffle_epi8(vi, vi); + vi = _mm256_shuffle_epi8(vi, vi); + vi = _mm256_shuffle_epi8(vi, c); + vi = _mm256_shuffle_epi8(vi, vi); + vi = _mm256_shuffle_epi8(vi, vi); + vi = _mm256_shuffle_epi8(vi, vi); + vi = _mm256_shuffle_epi8(vi, vi); + vi = _mm256_shuffle_epi8(vi, vi); + vi = _mm256_shuffle_epi8(vi, v3); + vi = _mm256_shuffle_epi8(vi, vi); + ret = _mm256_shuffle_epi8(vi, c); + + return flipallcorners(ret); +#else + uint8_t i, piece, orien; + + setzero(ret); + for (i = 0; i < 12; i++) { piece = get_edge(c, i); orien = piece & _eobit; @@ -932,12 +964,13 @@ inverse(cube_t c) orien = ((piece << 1) | (piece >> 1)) & _cobits2; set_corner(ret, piece & _pbits, i | orien); } +#endif return ret; } -cube_t -compose(cube_t c1, cube_t c2) +static inline cube_t +inline_compose(cube_t c1, cube_t c2) { cube_t ret; @@ -991,6 +1024,12 @@ compose(cube_t c1, cube_t c2) return ret; } +cube_t +compose(cube_t c1, cube_t c2) +{ + return inline_compose(c1, c2); +} + cube_t transform(cube_t c, trans_t t) { -- cgit v1.3